Propustnost GPU
Maximální využití sběrnice PCIe může vést k úzkým hrdlům při přenosu tenzorů. Monitorujte vytížení linky pomocí nástroje nvidia-smi.
- • Limit: 16 GB/s na linku
- • Doporučení: Aktivovat NVLink
Tato příručka definuje standardní operační postupy pro identifikaci a eliminaci technických závad v analytických modulech Daemonco. Odstraňování problémů vyžaduje striktní dodržování hierarchie kontrolních bodů pro zajištění integrity dat a stability modelů.
Prvním krokem při výskytu anomálie je extrakce surových dat z logovacího subsystému. Analýza musí probíhat v izolovaném prostředí, aby nedošlo k ovlivnění běžících procesů popsaných v sekci Nasazení do produkce. Zaměřte se na časová razítka (timestamps) s přesností na milisekundy, která korelují s nárůstem latence v API voláních.
Nikdy neprovádějte restart kontejnerů bez předchozího exportu stack trace. Došlo by k nenávratné ztrátě diagnostických metadat o stavu paměti v okamžiku selhání.
Po identifikaci chybového kódu je nutné prověřit, zda nedošlo k narušení integrity v rámci Přípravy a čištění dat. Často se stává, že neočekávaný formát vstupu způsobí přetečení bufferu nebo zacyklení neuronové sítě. Systematický přístup k logům zkracuje dobu obnovy (MTTR) o více než 60 %.
| Kód chyby | Popis symptomu | Pravděpodobná příčina | Nápravné opatření |
|---|---|---|---|
| ERR_MEM_04 | Nedostatek VRAM při inferenci | Příliš velká velikost dávky (batch size) | Snížit batch size v konfiguraci modelu |
| ERR_DATA_12 | Nízká přesnost predikce | Drift v distribuci vstupních dat | Rekalibrovat váhy modelu nebo aktualizovat dataset |
| ERR_CONN_09 | Timeout při sběru dat | Restrikce firewallu nebo výpadek API | Prověřit nastavení v modulu Sběr a import dat |
| ERR_SYS_01 | Zablokování jádra systému | Konflikt verzí knihoven CUDA/cuDNN | Provést čistou reinstalaci ovladačů GPU |
Maximální využití sběrnice PCIe může vést k úzkým hrdlům při přenosu tenzorů. Monitorujte vytížení linky pomocí nástroje nvidia-smi.
Při překročení 85°C dochází k automatickému snížení taktovací frekvence, což drasticky ovlivňuje čas zpracování analýz.
Pomalé čtení z NVMe disků může zpozdit načítání rozsáhlých vah modelů do operační paměti RAM při startu instance.
Pokud standardní postupy nevedou k vyřešení incidentu do 120 minut, je povinností operátora zahájit eskalaci na úroveň L3 inženýringu. Připravte si prosím kompletní výpis chybových hlášení a specifikaci prostředí pro urychlení procesu opravy.