Gel système total (hard reboot) 2s après sortie de veille

Demande d'aide : c'est ici.
Répondre
bauble296
Membre
Membre
Messages : 13
Inscription : 03 août 2026, 11:32
Status : Hors-ligne

J'ai laissé tourner suffisemment longtemps pour vérifier maintenant.

Ça règle une partie du problème mais pas tout. Je n'ai plus le même plantage, mais j'en ai un autre : parfois (je dirais une fois sur 3 ou 4), la sortie de veille ne réveille pas la sortie hdmi et mon écran reste éteint comme si le pc était toujours en veille. Le PC est bien rallumé mais pas d'affichage. J'ai essayé d'éteindre et rallumer l'écran, rien.

J'ai envoyé mes logs à claude qui m'a répondu :

Voici l'analyse. J'ai passé le fichier au crible (grep sur `nouveau|drm|gpu|xorg`, croisé avec `error|fail|warn|reset`), et l'histoire qui en ressort est claire.

Code : Tout sélectionner

## Ce que dit le log

Le fichier couvre environ 18h de journal (23 août 19h09 → 24 août 12h54) et contient **4 cycles de veille/réveil (S3)**. Un seul a mal tourné, mais c'est un vrai incident :

**23 août, 21:12:07 — le réveil (S3) échoue pour le GPU**
- La carte est une **Nvidia GA106 (RTX 3060 12GB)** pilotée par le driver **nouveau** avec firmware **GSP** (`r535`).
- Juste avant le suspend, le noyau logue une dizaine de `AMD-Vi: IO_PAGE_FAULT` sur le GPU (IOMMU qui bloque des accès mémoire).
- Au réveil : `sec2(gsp):booter-unload: boot failed: -5` puis `sec2(gsp):booter-load: boot failed: -5` — le microcode GSP embarqué (qui gère la carte côté firmware propriétaire Nvidia) ne redémarre pas.
- Ça déclenche 3 `WARNING` noyau dans `r535_gsp_fini`/`r535_gsp_init` (kernel taint `W`), puis en cascade : `gsp: init failed, -5` → `drm: Client resume failed with error: -5` → `PM: failed to resume async: error -5`.
- 18 secondes plus tard (21:12:25), un thread de hotplug (`nouveau_display_hpd_work`) essaie de sonder les sorties vidéo et se bloque dans `r535_gsp_msgq_wait` — normal, GSP est mort, plus rien ne répond.

**Résultat concret** : l'affichage était probablement figé/noir. Les logs montrent qu'une **initialisation à froid du module nouveau a suivi immédiatement** (21:12:24 : `NVIDIA GA106`, `VRAM: 12288 MiB`, `Initialized nouveau 1.4.0`, `fbcon` réinitialisé) — ce qui indique un **reboot**, pas juste un rechargement de module. C'est cohérent : une fois le firmware GSP planté, il n'y a pas de retour arrière possible sans redémarrage complet.

**Le reste s'est bien passé** : le cycle suspend/resume suivant (24 août, 21:31 → 12:41) s'est déroulé sans aucune erreur GSP — juste un `intr 00008000` anodin. Donc ce n'est pas systématique à chaque veille, c'est intermittent.

**Détail annexe (pas un bug graphique à proprement parler)** : un crash de **Dolphin** (signal ABRT, coredump traité par DrKonqi) à 19:10:05, avant le suspend — sans rapport avec nouveau/GSP.

## Analyse

C'est le bug classique **nouveau + GSP firmware + suspend S3** sur les cartes Nvidia Ampere/Ada récentes (RTX 30xx et au-delà). Le firmware GSP propriétaire (chargé en runtime par nouveau depuis 6.9+) a une fiabilité connue pour mal supporter le cycle suspend/resume — le microcode `booter` ne se relance pas correctement dans une fraction des réveils, sans schéma prévisible évident. Les `IO_PAGE_FAULT` juste avant le suspend suggèrent que quelque chose (peut-être une transaction DMA en cours) n'a pas eu le temps de se terminer proprement.

Kernel 6.12.101 (Debian 13/trixie) — c'est déjà une version relativement récente, donc pas un vieux bug déjà corrigé que tu aurais juste besoin de mettre à jour pour régler.
Je vais essayer d'installer le pilote propriétaire... Affaire encore à suivre...
Avatar de l’utilisateur
piratebab
Site Admin
Site Admin
Messages : 6677
Inscription : 24 avr. 2016, 18:41
Localisation : sud ouest
Status : Hors-ligne

Beaucoup de blabla:
C'est le bug classique **nouveau + GSP firmware + suspend S3**
C'est vague. Quand on affirme ça, on doit donner le ref CVE. Je n'en ai pas trouvé.
Regarde si ça ressemble à ça
https://forums.developer.nvidia.com/t/g ... ery/366591

Essaie de lancer en root

Code : Tout sélectionner

nvidia-bug-report.sh
, mais ça ne doit fonctionner qu'avec les drivers proprio
Répondre