Salud SMART NVMe: porcentaje usado, errores de medio y apagados inseguros
- Lee primero Critical Warning: puede indicar poco repuesto, temperatura límite, fiabilidad degradada, solo lectura o fallo del respaldo de memoria volátil.
- Percentage Used es una estimación del desgaste consumido. NVMe permite llegar y superar 100; 100 no significa por sí solo que el SSD ya murió.
- Media and Data Integrity Errors importa más que un “estado 98%”. Un contador creciente, modo solo lectura o aviso de fiabilidad exige respaldo e investigación.
- Unsafe Shutdowns cuenta cortes no limpios, no incidentes confirmados de pérdida. Compáralo con errores, energía e historial del host.
Una utilidad que muestra «Salud: 97%» tranquiliza, pero oculta los campos que explican el estado. NVMe define un registro SMART con avisos, repuesto, desgaste, temperatura, datos escritos, energía y errores. El diagnóstico útil los lee juntos.
SMART tampoco es copia de seguridad. Un registro sano no protege de borrado, fallo súbito o un evento impredecible.
Lee primero Critical Warning
Es una máscara de bits; pueden activarse varias condiciones [1]:
- repuesto disponible bajo el umbral;
- temperatura fuera del límite;
- fiabilidad degradada;
- medio en solo lectura;
- fallo del respaldo de memoria volátil, si existe.
Un valor distinto de cero es más accionable que una puntuación redondeada. Respalda primero y después identifica el bit. Solo lectura puede ser una protección del controlador para conservar datos aún legibles.
Percentage Used es vida consumida
NVMe lo define como estimación específica del fabricante del porcentaje de vida consumida [1]. Dos claves:
- 100% puede no indicar fallo. Marca consumo estimado, no muerte física.
- Puede superar 100. La norma permite reportarlo.
Algunas herramientas muestran 100 - usado como vida restante. Es una presentación cómoda, no días exactos garantizados.
Úsalo para planificar:
- guarda la tendencia;
- compáralo con Data Units Written y TBW/DWPD;
- estima cuándo llegará al punto nominal;
- reemplaza antes de que el riesgo sea inaceptable.
Consulta TBW y DWPD.
Available Spare es otra señal
Available Spare normaliza el repuesto físico restante. El registro incluye su umbral; al caer por debajo se activa el aviso [1].
No es espacio libre del sistema. El repuesto pertenece al controlador para sustituir áreas NAND inutilizables. Borrar archivos no recupera bloques físicos gastados.
Una caída de repuesto junto con errores de medio preocupa más que el simple uso de capacidad.
Errores de medio y entradas de error no son iguales
Media and Data Integrity Errors cuenta eventos de integridad no recuperados. Error Information Log Entries cuenta entradas del registro y puede incluir errores de comando [2].
| Observación | Respuesta |
|---|---|
| Errores de medio en cero | Bien, mantén copias |
| Errores aumentan | Respalda; revisa registro, firmware, temperatura y host |
| Entradas crecen sin errores de medio | Lee el detalle; no supongas fallo NAND |
| Aviso de fiabilidad o solo lectura | Retira de escritura crítica y reemplaza/investiga |
Los contadores suelen ser acumulativos. Importa si siguen creciendo en uso normal.
Unsafe Shutdowns cuenta eventos, no corrupción confirmada
Registra pérdidas de energía o apagados sin aviso limpio [2][4]: apagado forzado, batería retirada, carcasa inestable, desconexión o caída del sistema.
No dice cuántos archivos se dañaron. Compáralo con cortes conocidos, errores, reparaciones del sistema de archivos, carcasa y suspensión. Para cargas intolerantes al corte, usa protección adecuada; consulta PLP.
La temperatura necesita tendencia
El registro incluye temperatura compuesta, tiempo en aviso/crítico y, según dispositivo, sensores y transiciones térmicas [3][4]. Un pico tras benchmark dice menos que tiempo repetido sobre el umbral.
Revisa temperatura en reposo y carga, tiempo en umbrales, flujo de aire, contacto del disipador y caída de rendimiento simultánea. Usa límites del fabricante, no una cifra universal de internet.
Orden práctico de lectura
- Respalda si hay aviso y los datos importan.
- Decodifica Critical Warning.
- Mira errores de medio y tendencia del registro.
- Compara repuesto con umbral.
- Contrasta porcentaje usado y datos escritos con resistencia nominal.
- Revisa tiempo térmico, no solo temperatura actual.
- Relaciona apagados inseguros con la energía.
- Guarda fecha, firmware y carga para comparar.
En resumen
SMART NVMe es evidencia, no un porcentaje. Avisos, errores, repuesto y solo lectura muestran riesgo inmediato. Percentage Used estima resistencia consumida. Temperatura, escrituras y apagados explican el historial. Léelos juntos y reemplaza según el coste del fallo, no según una insignia verde de 97%.
Preguntas frecuentes
¿El NVMe muere al llegar Percentage Used a 100%?
¿Cuál es el valor SMART NVMe más importante?
¿Unsafe Shutdowns significa archivos corruptos?
Referencias
Publicamos la capacidad utilizable medida y aceptamos verificación de lote de prueba — grado automotriz, directo de la fábrica de origen.