gpu: collect reset-required/row-remap status and classify Xid codes by severity
nvidia-smi exposes reset_status.reset_required and remapped_rows.* only on newer drivers for Ampere+ GPUs; queried via a separate exec call since an unrecognized field name fails the whole --query-gpu command and would have wiped out unrelated telemetry (temp/ECC/power) on older drivers otherwise. Also refines Xid severity in both the ingest dmesg collector and the always-on kmsg watcher: Xid 64 (row-remap InfoROM write failure) now escalates to Critical instead of the generic warning every other Xid got, and fixes the SAT-window flush path which previously hardcoded "Warning" and ignored pattern severity entirely. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Sonnet 5
parent
d850d4fc3a
commit
1175e6ccd8
@@ -418,6 +418,11 @@ GET /ingest/hardware/jobs/{job_id}
|
||||
| `ecc_corrected_total` | int64 | нет | Всего корректируемых ECC-ошибок |
|
||||
| `ecc_uncorrected_total` | int64 | нет | Всего некорректируемых ECC-ошибок |
|
||||
| `hw_slowdown` | bool | нет | Устройство вошло в hardware slowdown / protective mode |
|
||||
| `reset_required` | bool | нет | GPU требует reset (nvidia-smi `reset_status.reset_required`); драйвер/hardware state повреждён, требуется reset или reboot узла |
|
||||
| `remapped_rows_correctable` | int64 | нет | Число строк HBM, переназначенных из-за корректируемых ECC-ошибок (nvidia-smi `remapped_rows.correctable`) |
|
||||
| `remapped_rows_uncorrectable` | int64 | нет | Число строк HBM, переназначенных из-за некорректируемых ECC-ошибок; >0 означает как минимум одну аппаратно неисправную ячейку памяти (nvidia-smi `remapped_rows.uncorrectable`) |
|
||||
| `remapped_rows_pending` | bool | нет | Remap запланирован, но требует полного power cycle узла, чтобы вступить в силу (nvidia-smi `remapped_rows.pending`) |
|
||||
| `remapped_rows_failure` | bool | нет | Попытка remap не смогла записаться в InfoROM (XID 64) — серьёзная неисправность (nvidia-smi `remapped_rows.failure`) |
|
||||
| `battery_charge_pct` | float | нет | Заряд батареи / supercap, % |
|
||||
| `battery_health_pct` | float | нет | Состояние батареи / supercap, % |
|
||||
| `battery_temperature_c` | float | нет | Температура батареи / supercap, °C |
|
||||
@@ -443,6 +448,8 @@ GET /ingest/hardware/jobs/{job_id}
|
||||
| `present` | bool | нет | Наличие (по умолчанию `true`) |
|
||||
| + общие поля статуса | | | см. раздел выше |
|
||||
|
||||
`reset_required` и `remapped_rows_*` доступны только для NVIDIA datacenter GPU (Ampere и новее) на драйверах, поддерживающих поля `reset_status.*`/`remapped_rows.*` в `nvidia-smi --query-gpu`. На старых драйверах или GPU без row remapping (HBM ECC) поля просто отсутствуют в payload — это не ошибка сборщика.
|
||||
|
||||
`numa_node` передавайте для NIC / InfiniBand / RAID / GPU, когда источник знает CPU/NUMA affinity. Поле сохраняется в snapshot-атрибутах PCIe-компонента и дублируется в telemetry для topology use cases.
|
||||
Поля `temperature_c` и `power_w` используйте для device-level telemetry GPU / accelerator / smart PCIe devices. Они не влияют на идентификацию компонента.
|
||||
|
||||
|
||||
Reference in New Issue
Block a user