Diagnostic matériel progressif d’un PC

Disque, mémoire, température : diagnostiquer un PC sans changer des pièces au hasard

Diagnostic matériel progressif d’un PC
Diagnostic matériel progressif d’un PC.

Un PC qui plante peut faire perdre beaucoup de temps et encore plus d’argent si l’on commence à changer des pièces au hasard. On remplace la mémoire, puis le SSD, puis l’alimentation, et le problème revient parce qu’un connecteur était mal enfiché ou qu’un réglage du BIOS rendait le système instable.

Je préfère une méthode moins spectaculaire : observer, reproduire, mesurer, ne changer qu’une variable et conserver les résultats. Elle ne trouve pas toutes les pannes en cinq minutes, mais elle évite de transformer le diagnostic en loterie.

Dans cet article, je me concentre sur trois familles de causes fréquentes : le stockage, la mémoire vive et la température. Elles peuvent produire des symptômes proches, et c’est précisément pour cela qu’il faut les distinguer.

Si le symptôme principal est une machine devenue lente sans plantage franc, commencez par les vérifications à mener avant de remplacer un PC lent : elles permettent de séparer saturation logicielle, stockage et manque de ressources.

Commencer par les données, pas par le tournevis

Avant tout test, je demande si les fichiers importants sont sauvegardés. Un disque malade peut encore fonctionner assez longtemps pour copier les données, puis tomber définitivement pendant un test prolongé. Un PC instable peut aussi corrompre des fichiers lors d’un redémarrage brutal.

La priorité est donc claire : si les données sont uniques, on les copie sur un autre support avant d’essayer de prouver la panne. Si le disque disparaît, fait des bruits mécaniques, ralentit dès qu’on l’utilise ou provoque des erreurs de lecture, je limite les manipulations. Un spécialiste de la récupération vaut parfois mieux qu’une nuit entière de tests.

Je note ensuite les informations de base :

  • modèle exact du PC ou de la carte mère ;
  • processeur, quantité de RAM et modèle du stockage ;
  • version du système et changements récents ;
  • nature et fréquence du symptôme ;
  • message d’erreur exact, s’il existe ;
  • état à froid, après plusieurs heures et sous forte charge.

Une photo d’un écran bleu, un journal d’événements ou l’heure précise d’un plantage vaut mieux que « ça bug parfois ».

Reproduire le problème sans torturer la machine

Un bon test doit ressembler à l’usage qui déclenche la panne. Si le PC plante uniquement dans un jeu, je surveille la machine pendant ce jeu. S’il fige lors d’une copie, je m’intéresse d’abord au stockage et au chemin emprunté par les données. S’il ne démarre qu’une fois sur trois, je ne lance pas immédiatement un test de charge de deux heures.

Je cherche le test le plus court et le moins risqué qui permette de reproduire le problème. Je garde les mêmes conditions et je ne modifie qu’un élément à la fois.

Il faut aussi distinguer corrélation et cause. Une température élevée observée au moment d’un plantage n’est pas forcément responsable. Un disque qui affiche une ancienne erreur n’est pas forcément celui qui a provoqué le blocage actuel. Le diagnostic consiste à construire un faisceau de preuves.

Le stockage : lire davantage que « bon » ou « mauvais »

Les disques durs, SSD SATA et SSD NVMe exposent généralement des informations de surveillance. La technologie S.M.A.R.T. peut signaler un état de santé, des erreurs, l’usure et les résultats d’autotests. Mais son affichage varie selon le constructeur et le type de support.

Avec smartctl, l’option --health affiche l’état global, --attributes les attributs fournis par le support, et les options de journal permettent de consulter les erreurs et autotests. Une commande comme la suivante peut afficher l’ensemble des informations disponibles sous Linux :

sudo smartctl --all /dev/sda

Le nom du périphérique doit évidemment être vérifié avant d’exécuter quoi que ce soit. Pour un NVMe, il peut prendre une autre forme. Sous Windows, smartmontools existe également, mais l’identification des disques et les droits nécessaires diffèrent.

Le résultat global est utile, mais il ne suffit pas. Un statut « PASSED » signifie que le support n’a pas franchi le seuil d’échec défini par son firmware ; il ne promet pas que chaque donnée sera lisible demain. Inversement, un compteur élevé n’a pas toujours la même signification d’une marque à l’autre.

Je regarde surtout la cohérence de l’ensemble :

  • erreurs de lecture ou d’écriture ;
  • secteurs réalloués, instables ou incorrigibles sur un disque ATA ;
  • erreurs d’intégrité du média et usure disponible sur un NVMe ;
  • journal des erreurs ;
  • résultat et date des autotests ;
  • évolution des valeurs entre deux relevés ;
  • correspondance avec les symptômes observés.

Une erreur de transmission peut aussi venir d’un câble SATA, d’un connecteur ou d’une alimentation, pas forcément du support lui-même. Changer un câble connu et refaire exactement le même test coûte moins cher que remplacer immédiatement le SSD.

Autotest court ou long : savoir ce que l’on demande

smartmontools peut demander au support de lancer ses propres autotests. L’exemple officiel suivant démarre un test étendu sur un disque Linux :

sudo smartctl --test=long /dev/sda

Le test s’exécute dans le disque ; il faut ensuite consulter le journal pour connaître son résultat. Sa durée dépend du matériel. Un test long sollicite le support et ne remplace pas une sauvegarde. Je ne le lance pas sur un disque qui agonise avant d’avoir sécurisé les données.

Un autotest réussi est une information rassurante, mais limitée. Il ne vérifie pas le système de fichiers, le câble, le contrôleur, la RAM utilisée par le système ni tous les scénarios de charge. Un échec, en revanche, mérite d’être documenté et traité rapidement.

Pour un SSD, je m’intéresse aussi à l’usure et à la température. Une endurance consommée n’indique pas automatiquement une panne immédiate, mais elle aide à décider si le support doit rester dans un poste critique.

La mémoire : les pannes qui aiment changer de visage

Une RAM instable peut provoquer des symptômes très variés : écran bleu, application qui se ferme, archive corrompue, installation impossible, redémarrage ou erreur qui semble différente à chaque fois. Elle peut fonctionner au repos et échouer seulement à chaud ou lorsque plusieurs zones sont fortement sollicitées.

Je commence par supprimer les variables volontaires : overclocking, sous-tension et profil mémoire agressif. Revenir temporairement aux réglages par défaut du firmware ne répare rien, mais permet de savoir si le système est instable dans sa configuration normale ou uniquement avec un réglage poussé.

Le diagnostic mémoire de Windows peut fournir un premier signal. Pour aller plus loin, MemTest86 démarre depuis une clé USB de diagnostic préparée et vérifiée, indépendamment du Windows installé, et exécute plusieurs algorithmes et motifs de test sur la RAM.

Trois règles évitent les conclusions trop rapides :

  1. Un test interrompu sans erreur n’équivaut pas à un test complet réussi.
  2. Une seule erreur détectée est déjà anormale dans une configuration censée être stable.
  3. Une erreur ne condamne pas automatiquement la barrette : emplacement, contrôleur mémoire, carte mère, alimentation, température et réglages peuvent être impliqués.

MemTest86 précise d’ailleurs qu’il ne sait pas diagnostiquer de nombreux autres défauts du PC. Un processeur ou une carte mère défaillante peut faire planter le test lui-même.

Isoler une barrette sans perdre la méthode

Lorsque plusieurs modules sont installés, je photographie leur position et je note leur référence avant de les retirer. Le manuel de la carte mère indique les emplacements recommandés ; il ne faut pas supposer que tous sont équivalents pour un seul module.

La méthode consiste à tester une configuration minimale connue, puis à déplacer un seul élément :

  • même barrette dans un autre emplacement ;
  • autre barrette dans le même emplacement ;
  • réglages mémoire par défaut ;
  • contacts et verrouillage vérifiés ;
  • même version du test et même nombre de passes.

Si une barrette échoue partout tandis qu’une autre réussit dans les mêmes conditions, la suspicion devient forte. Si toutes échouent dans un seul emplacement, la carte mère ou le processeur entre davantage dans l’équation. Si les erreurs disparaissent uniquement lorsque la fréquence est réduite, le kit n’est pas nécessairement stable avec le profil utilisé.

Je ne mélange pas au hasard des barrettes de capacités, puces, tensions et timings différents en espérant qu’un démarrage réussi prouve leur compatibilité à long terme.

La température : regarder la fréquence en même temps

Une température seule raconte peu de choses. Il faut savoir quel capteur on lit, à quel moment, avec quelle charge, dans quelle pièce et pour quel composant.

Les processeurs modernes se protègent. Intel explique que lorsque le processeur atteint sa limite thermique — TJ Max ou Tcase selon le produit — il peut réduire sa fréquence : c’est le throttling. Cette protection évite des dégâts, mais elle peut provoquer les ralentissements et saccades que l’utilisateur ressent.

La limite n’est pas universelle. Intel demande de consulter la fiche du modèle précis pour connaître Tjunction ou Tcase. Les fabricants de portables peuvent également configurer le comportement thermique selon leur châssis. Dire que « 90 °C est toujours dangereux » ou « 100 °C est toujours normal » n’est donc pas sérieux.

Je surveille simultanément :

  • température du processeur et de la carte graphique ;
  • fréquence et consommation ;
  • vitesse des ventilateurs lorsqu’elle est disponible ;
  • température du stockage ;
  • température ambiante ;
  • durée avant le ralentissement ou le plantage.

Si la température grimpe jusqu’à la limite pendant que la fréquence chute fortement, la piste thermique devient solide. Si le PC plante à froid avant toute hausse, je cherche ailleurs.

Examiner le refroidissement du plus simple au plus invasif

Je commence sans démonter : surface dure sous un portable, aérations libres, mode d’alimentation normal, ventilateurs audibles et sortie d’air effective. Je vérifie ensuite la poussière visible et l’état des filtres.

Machine éteinte, débranchée et batterie déconnectée lorsque c’est possible, on peut inspecter les ventilateurs et radiateurs. Je maintiens les pales pendant le nettoyage pour éviter de les faire tourner à une vitesse excessive. Je n’utilise ni aspirateur domestique directement sur les composants, ni produit liquide improvisé.

Le remplacement de pâte thermique vient après l’observation, pas avant. Une pâte vieillie ou un radiateur mal serré peut poser problème, mais ouvrir une machine ajoute de nouvelles variables : vis, connecteurs, pads thermiques, pression du dissipateur et risque d’endommagement. Sur certains appareils, les matériaux et épaisseurs sont spécifiques.

Après intervention, je reproduis la même charge et je compare les températures, fréquences, bruit et durée. Sans mesure avant/après, on ne sait pas si le nettoyage a réellement corrigé la cause.

Ne pas oublier l’alimentation et la carte mère

Disque, mémoire et température ne couvrent pas toutes les pannes. Une alimentation fatiguée peut provoquer des redémarrages sous charge. Un connecteur mal enfiché peut couper momentanément un support. Un firmware ancien peut mal gérer un composant récent. Une carte mère endommagée peut imiter une panne de RAM ou de stockage.

Je vérifie visuellement les connecteurs, traces de chauffe, condensateurs anormaux et câbles pincés sans toucher une alimentation secteur ouverte : ses condensateurs peuvent rester dangereux même débranchés. Pour valider une alimentation, le remplacement temporaire par un modèle connu, adapté et correctement dimensionné est souvent plus pertinent qu’un testeur basique qui ne mesure pas le comportement sous charge.

Sur un portable, chargeur, connecteur d’alimentation et batterie peuvent aussi limiter les performances ou provoquer des coupures.

Une matrice pour éviter les achats réflexes

Observation Preuve à chercher Action suivante raisonnable
Disque à 100 %, erreurs de lecture S.M.A.R.T., journal, copie contrôlée, câble Sauvegarder, vérifier la liaison, remplacer si la panne est confirmée
Plantages aléatoires et fichiers corrompus Test mémoire complet, réglages par défaut Isoler module et emplacement avant achat
Ralentissement après quelques minutes Température élevée et fréquence qui chute Inspecter refroidissement, nettoyer, retester à charge identique
Redémarrage brutal sous charge Journaux, températures, alimentation connue Tester alimentation et connexions sans ouvrir le bloc secteur
Erreur apparue après un changement Retour à la configuration précédente Réintroduire les changements un par un
Tous les tests passent Reproduire l’usage réel, logiciel, pilotes Élargir le diagnostic au système et aux périphériques

Cette table n’est pas un verdict automatique. Elle sert à choisir le prochain test qui donnera le plus d’informations avec le moins de risques.

Le compte rendu fait partie de la réparation

Je conserve pour chaque intervention : configuration, symptômes, sauvegarde effectuée, outils et versions, durée des tests, résultats, pièces déplacées et état final. Si la panne revient trois semaines plus tard, ces notes évitent de repartir de zéro.

Un compte rendu honnête indique aussi les limites. « Aucun défaut détecté pendant quatre passes » est plus précis que « la mémoire est parfaite ». « Autotest réussi et aucun compteur inquiétant observé » vaut mieux que « SSD garanti sans panne ».

Le diagnostic ne consiste pas à donner un nom à la première valeur rouge affichée par un logiciel. Il consiste à rendre une hypothèse de plus en plus solide, jusqu’à ce qu’une intervention ciblée corrige le problème et que le même test confirme le résultat.

C’est moins rapide que de commander trois pièces. C’est aussi beaucoup plus proche de la réparation.

Sources techniques à conserver dans l’article

Laisser un commentaire

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.