Zdarzenie 17 · PCI Express Root Port
Łącze PCIe do karty graficznej, dysku NVMe albo urządzenia chipsetu miało błąd, który powtórzono i skorygowano.
WHEA-Logger 17, 19 i 47 to poprawki z licznikiem. Zdarzenie 18 to ta, której nie dało się zrobić.
Otwierasz Podgląd zdarzeń, bo wyleciała gra albo komputer raz się zrestartował w zeszłym tygodniu, a dziennik System jest pełen żółtych ostrzeżeń od WHEA-Logger: „Wystąpił skorygowany błąd sprzętu”. Czasem kilka. Czasem tysiące, po kilka na sekundę. Albo jest jeden czerwony wpis, „Wystąpił błąd krytyczny sprzętu”, zaraz po niebieskim ekranie z napisem WHEA_UNCORRECTABLE_ERROR.
WHEA to Windows Hardware Error Architecture. Procesor, kontroler pamięci i łącza PCI Express same wykrywają swoje błędy i zgłaszają je Windowsowi, a ten zapisuje je w dzienniku. Liczy się słowo skorygowany: sprzęt zauważył problem i naprawił go, zanim cokolwiek się zepsuło. To ostrzeżenie z licznikiem, a nie jeszcze awaria. Zadanie polega na tym, żeby ustalić, która część to zgłasza, jak często i czy liczba rośnie.
Zdarzenie 17 · PCI Express Root Port
Łącze PCIe do karty graficznej, dysku NVMe albo urządzenia chipsetu miało błąd, który powtórzono i skorygowano.
Zdarzenie 19 · zdarzenie 47
Skorygowany błąd machine check: 19 zwykle na magistrali lub połączeniu, 47 w pamięci. System działał dalej.
Zdarzenie 18 · Stop 0x124
Błąd krytyczny sprzętu. Windows zatrzymał się z WHEA_UNCORRECTABLE_ERROR i po restarcie zapisał zdarzenie 18.
Otwórz zdarzenie w Dzienniki systemu Windows → System i przeczytaj kartę Ogólne. Trzy linie decydują o wszystkim, co dalej. Przepisz je dla każdego rodzaju wpisu, który widzisz.
| Pole | Co mówi | Przykłady |
|---|---|---|
| Component | Która część zgłosiła błąd | PCI Express Root Port, Processor Core, Memory |
| Error Source | Który mechanizm go wykrył | Advanced Error Reporting (PCI Express), Corrected Machine Check, Machine Check Exception |
| Error Type | Jaki to rodzaj błędu, w zgłoszeniach procesora | Bus/Interconnect Error, Cache Hierarchy Error |
| Bus:Device:Function | We wpisach PCIe, które gniazdo lub urządzenie | Porównaj z polem Lokalizacja w Menedżerze urządzeń |
| Processor APIC ID | We wpisach procesora, który rdzeń zgłosił | Ten sam rdzeń za każdym razem to już wskazówka |
We wpisie PCI Express liczby Bus, Device i Function wskazują fizyczne łącze. Otwórz Menedżer urządzeń, przełącz widok na Urządzenia według połączenia i sprawdź Lokalizację portu głównego oraz to, co pod nim wisi. Zwykle tak się dowiadujesz, że ostrzeżenia dotyczą gniazda karty graficznej, gniazda M.2 albo urządzenia chipsetu, na przykład karty sieciowej.
Liczba znaczy więcej niż kolor. Kilka skorygowanych błędów przy starcie albo przy budzeniu urządzenia to inna sytuacja niż kilka na sekundę w trakcie gry. Policz je według identyfikatora w PowerShell:
Get-WinEvent -FilterHashtable @{LogName='System'; ProviderName='Microsoft-Windows-WHEA-Logger'} |
Group-Object Id | Select-Object Name, Count
Uruchom to ponownie po każdej sprawdzanej zmianie. Licznik, który przestaje rosnąć, to najczystszy dowód, że zmiana zadziałała. Jeśli licznik rośnie z tygodnia na tydzień przy tych samych ustawieniach, to jest trend, który trzeba traktować poważnie, nawet jeśli nic się jeszcze nie zawiesiło.
| Zdarzenie | Zwykle wskazuje na | Czego nie dowodzi |
|---|---|---|
| 17, PCI Express Root Port, AER | Zarządzanie energią łącza PCIe (ASPM), gniazdo, riser lub przedłużkę, firmware, sterownik chipsetu, urządzenie na tym łączu | Że karta albo dysk się psuje |
| 19, Bus/Interconnect, na AMD Ryzen | Zegar Infinity Fabric (FCLK) albo profil pamięci ponad to, co procesor utrzyma, napięcie SoC, ustawienia PBO lub Curve Optimizer | Że procesor jest wadliwy na ustawieniach domyślnych |
| 19 na Intelu albo na dowolnym procesorze bez strojenia | Niestabilne strojenie, domyślne ustawienia zasilania w BIOS-ie, chłodzenie, wczesny objaw psującego się procesora | Jednej przyczyny bez testu na domyślnych |
| 47, Memory | Błąd pamięci skorygowany przez ECC: moduł, jego profil albo kontroler pamięci | Którego modułu, dopóki nie sprawdzisz ich po jednym |
| 18, Processor Core, Cache Hierarchy | Niestabilność procesora: podkręcenie, undervolt, za niskie napięcie, temperatura, degradujący się procesor | Że jedyną naprawą jest wymiana procesora |
| 18 po wielu 17, 19 lub 47 | Problem skorygowany, który stał się nieskorygowanym | Że wcześniejsze ostrzeżenia były niegroźne |
PC Workman prowadzi lokalną historię obciążenia procesora i karty, temperatur, zegarów i napięć udostępnianych przez obsługiwane czujniki. Kiedy licznik WHEA skacze, ta historia pokazuje, co robiła maszyna: gra na pełnym obciążeniu, gorący procesor, komputer w spoczynku budzący urządzenie. Ten kontekst często rozstrzyga między przyczyną termiczną, strojeniem a zarządzaniem energią.
PC Workman nie czyta ani nie dekoduje rekordów błędów WHEA, nie testuje pamięci i sam nie powie, która część zawiodła. Używaj go obok Podglądu zdarzeń, licznika z PowerShell i testu na ustawieniach domyślnych.
Skorygowany błąd, zwykle na łączu PCI Express. Kilka to norma. Zalew wskazuje na zarządzanie energią łącza, gniazdo, riser, firmware albo urządzenie na tym łączu.
Jest skorygowane, więc system działał dalej. Stały strumień pod obciążeniem znaczy, że strojenie albo sprzęt jest na granicy. Na Ryzenach to często zegar Infinity Fabric albo profil pamięci.
Błąd krytyczny sprzętu, którego nie dało się skorygować, zwykle zapisany po niebieskim ekranie WHEA_UNCORRECTABLE_ERROR. Pole Component pokazuje, gdzie zacząć.
Microsoft pisze, że 0x124 zwykle wiąże się ze sprzętem, a sterownik jest mniej prawdopodobny, choć możliwy. Firmware i zarządzanie energią to częstsze przyczyny niż aplikacje.
Nie. Tłumienie ich usuwa wczesne ostrzeżenie. Usuń przyczynę albo zaakceptuj ją świadomie.
Ekran gaśnie, a sterownik NVIDII się resetuje? Przeczytaj nvlddmkm, zdarzenie 153 → · Restartuje się cały komputer? Przeczytaj Kernel-Power 41 →