CONOCIMIENTO — Kalstor CONOCIMIENTO K KALSTOR
InicioRecursosSalud SMART NVMe: porcentaje usado, errores de medio y apagados inseguros
Conocimiento · Salud SSD

Salud SMART NVMe: porcentaje usado, errores de medio y apagados inseguros

Por Kalstor 8 min de lectura
Puntos clave
  • Lee primero Critical Warning: puede indicar poco repuesto, temperatura límite, fiabilidad degradada, solo lectura o fallo del respaldo de memoria volátil.
  • Percentage Used es una estimación del desgaste consumido. NVMe permite llegar y superar 100; 100 no significa por sí solo que el SSD ya murió.
  • Media and Data Integrity Errors importa más que un “estado 98%”. Un contador creciente, modo solo lectura o aviso de fiabilidad exige respaldo e investigación.
  • Unsafe Shutdowns cuenta cortes no limpios, no incidentes confirmados de pérdida. Compáralo con errores, energía e historial del host.

Una utilidad que muestra «Salud: 97%» tranquiliza, pero oculta los campos que explican el estado. NVMe define un registro SMART con avisos, repuesto, desgaste, temperatura, datos escritos, energía y errores. El diagnóstico útil los lee juntos.

SMART tampoco es copia de seguridad. Un registro sano no protege de borrado, fallo súbito o un evento impredecible.

Lee primero Critical Warning

Es una máscara de bits; pueden activarse varias condiciones [1]:

  • repuesto disponible bajo el umbral;
  • temperatura fuera del límite;
  • fiabilidad degradada;
  • medio en solo lectura;
  • fallo del respaldo de memoria volátil, si existe.

Un valor distinto de cero es más accionable que una puntuación redondeada. Respalda primero y después identifica el bit. Solo lectura puede ser una protección del controlador para conservar datos aún legibles.

Percentage Used es vida consumida

NVMe lo define como estimación específica del fabricante del porcentaje de vida consumida [1]. Dos claves:

  1. 100% puede no indicar fallo. Marca consumo estimado, no muerte física.
  2. Puede superar 100. La norma permite reportarlo.

Algunas herramientas muestran 100 - usado como vida restante. Es una presentación cómoda, no días exactos garantizados.

Úsalo para planificar:

  • guarda la tendencia;
  • compáralo con Data Units Written y TBW/DWPD;
  • estima cuándo llegará al punto nominal;
  • reemplaza antes de que el riesgo sea inaceptable.

Consulta TBW y DWPD.

Available Spare es otra señal

Available Spare normaliza el repuesto físico restante. El registro incluye su umbral; al caer por debajo se activa el aviso [1].

No es espacio libre del sistema. El repuesto pertenece al controlador para sustituir áreas NAND inutilizables. Borrar archivos no recupera bloques físicos gastados.

Una caída de repuesto junto con errores de medio preocupa más que el simple uso de capacidad.

Errores de medio y entradas de error no son iguales

Media and Data Integrity Errors cuenta eventos de integridad no recuperados. Error Information Log Entries cuenta entradas del registro y puede incluir errores de comando [2].

ObservaciónRespuesta
Errores de medio en ceroBien, mantén copias
Errores aumentanRespalda; revisa registro, firmware, temperatura y host
Entradas crecen sin errores de medioLee el detalle; no supongas fallo NAND
Aviso de fiabilidad o solo lecturaRetira de escritura crítica y reemplaza/investiga

Los contadores suelen ser acumulativos. Importa si siguen creciendo en uso normal.

Unsafe Shutdowns cuenta eventos, no corrupción confirmada

Registra pérdidas de energía o apagados sin aviso limpio [2][4]: apagado forzado, batería retirada, carcasa inestable, desconexión o caída del sistema.

No dice cuántos archivos se dañaron. Compáralo con cortes conocidos, errores, reparaciones del sistema de archivos, carcasa y suspensión. Para cargas intolerantes al corte, usa protección adecuada; consulta PLP.

La temperatura necesita tendencia

El registro incluye temperatura compuesta, tiempo en aviso/crítico y, según dispositivo, sensores y transiciones térmicas [3][4]. Un pico tras benchmark dice menos que tiempo repetido sobre el umbral.

Revisa temperatura en reposo y carga, tiempo en umbrales, flujo de aire, contacto del disipador y caída de rendimiento simultánea. Usa límites del fabricante, no una cifra universal de internet.

Orden práctico de lectura

  1. Respalda si hay aviso y los datos importan.
  2. Decodifica Critical Warning.
  3. Mira errores de medio y tendencia del registro.
  4. Compara repuesto con umbral.
  5. Contrasta porcentaje usado y datos escritos con resistencia nominal.
  6. Revisa tiempo térmico, no solo temperatura actual.
  7. Relaciona apagados inseguros con la energía.
  8. Guarda fecha, firmware y carga para comparar.

En resumen

SMART NVMe es evidencia, no un porcentaje. Avisos, errores, repuesto y solo lectura muestran riesgo inmediato. Percentage Used estima resistencia consumida. Temperatura, escrituras y apagados explican el historial. Léelos juntos y reemplaza según el coste del fallo, no según una insignia verde de 97%.

Preguntas frecuentes

¿El NVMe muere al llegar Percentage Used a 100%?
No. La especificación dice que 100 representa resistencia estimada consumida, pero puede no indicar fallo; el valor puede superar 100. Úsalo para planificar reemplazo y lee los demás campos, no como prueba de muerte instantánea.
¿Cuál es el valor SMART NVMe más importante?
Empieza por Critical Warning; después errores de medio, repuesto frente a umbral, solo lectura y temperatura. Percentage Used y Data Units Written aportan contexto de vida. Ningún porcentaje comercial sustituye el registro completo.
¿Unsafe Shutdowns significa archivos corruptos?
No necesariamente. Registra apagados sin aviso limpio. Es evidencia de un corte, no prueba de corrupción. Si crece, revisa energía, carcasa, suspensión y extracción, sobre todo si aparecen errores o problemas de archivos.
¿Abasteciendo por volumen?

Publicamos la capacidad utilizable medida y aceptamos verificación de lote de prueba — grado automotriz, directo de la fábrica de origen.