CONOCIMIENTO — Kalstor CONOCIMIENTO K KALSTOR
InicioRecursosBloques defectuosos y ECC en NAND: qué debe verificar el comprador
Conocimiento · Confiabilidad NAND

Bloques defectuosos y ECC en NAND: qué debe verificar el comprador

Por Kalstor 8 min de lectura
Puntos clave
  • Un dado NAND puede salir con bloques marcados por el fabricante y cumplir la especificación. El equipo debe respetarlos en NAND cruda; la flash administrada los oculta y sustituye fallos posteriores con bloques de reserva.
  • ECC es una operación esperada, no señal de que todos los datos estén corruptos. La cuestión es si la capacidad de corrección coincide con la generación NAND y si los errores no corregibles se comunican.
  • El aumento de correcciones y el consumo de reserva pueden mostrar desgaste antes de perder capacidad visible. eMMC, UFS, SSD y tarjetas ofrecen distinta telemetría.
  • No homologues con una captura de “cero bloques malos”. Fija NAND/controlador/firmware, verifica salud, prueba resistencia y ciclos de energía, y define la respuesta a errores no corregibles.

“Este chip tiene bloques defectuosos” suena a rechazo automático. En NAND flash, esa conclusión suele ser equivocada. Algunos bloques se marcan como no utilizables durante la fabricación, otros se desgastan en servicio y un diseño correcto gestiona ambos sin presentarlos como sectores de usuario.

Las alertas reales son otras: utilizar un bloque marcado, aplicar ECC insuficiente, agotar la reserva, ocultar un error no corregible o cambiar la NAND sin revalidar el firmware del controlador.

Un bloque defectuoso no debe almacenar datos

La NAND se organiza en páginas para leer/programar y en bloques mayores para borrar. Un bloque defectuoso es un bloque considerado inadecuado para almacenamiento confiable. Hay dos grupos generales:

  • bloques iniciales, identificados en la fabricación de NAND;
  • bloques desarrollados, retirados después de fallos de programa, borrado o lectura en servicio.

KIOXIA explica que los bloques iniciales forman parte de la realidad de rendimiento de oblea y pueden existir en NAND entregada. En dispositivos crudos se marcan para el equipo; en dispositivos administrados se excluyen internamente [2]. Micron especifica un mínimo de bloques válidos al final de los ciclos P/E y exige respetar marcadores y requisitos de gestión de errores [3].

Por eso, “cero bloques iniciales” no es una métrica universal de calidad. Lo correcto es comprobar que se cumple el mínimo válido y que ningún bloque marcado entra en uso.

NAND cruda y flash administrada reparten la responsabilidad

Con NAND cruda, el procesador y el software del equipo deben proporcionar:

  • escaneo inicial y tabla de bloques defectuosos;
  • ECC con la fuerza y tamaño de paso exigidos por la hoja de datos;
  • lectura del estado de programa/borrado y retiro en campo;
  • wear leveling, traducción lógica-física y recuperación de energía cuando aplique.

La documentación de NAND cruda de Linux muestra esas obligaciones: posición del marcador, patrón de escaneo, tablas y parámetros de fuerza/paso ECC forman parte de la integración [4].

Con flash administrada —eMMC, UFS, SSD y tarjetas— el controlador interno gestiona mapeo, ECC y retiro. Cuando detecta un bloque fallido, lo descarta y asigna un reemplazo de reserva [2]. El equipo ve direcciones lógicas, no páginas crudas.

Administrada no significa inmortal. Significa que la responsabilidad pasó al dispositivo y que controlador y firmware son parte del componente homologado.

ECC corrige errores de bit esperados

Las celdas NAND se vuelven más difíciles de leer con el desgaste, la retención prolongada y los cambios de temperatura. El código de corrección de errores (ECC) añade información redundante para detectar y corregir una cantidad admitida de bits erróneos.

KIOXIA describe la secuencia: al escribir, el controlador calcula ECC y lo guarda con los datos; al leer, comprueba y corrige bits antes de devolverlos [1]. En NAND cruda, esa función debe aportarla el equipo o un controlador externo.

Hay que separar tres eventos:

EventoSignificado
Error corregidoECC recuperó los datos dentro de su capacidad
Correcciones/umbral en aumentoSe consume margen; la tendencia puede indicar desgaste
Error no corregibleSe superó la capacidad o no se recuperaron los datos

Un error corregido no equivale a un archivo perdido. Un error no corregible sí exige acción y debe llegar al equipo. Micron advierte que el requisito ECC cambia con diseño y tipo de NAND; la hoja exacta define la capacidad necesaria [3].

Los bloques de reserva son un recurso consumible

La flash administrada guarda bloques fuera de la capacidad visible. El controlador los usa cuando retira bloques activos. Así conserva la capacidad lógica anunciada hasta que la reserva se acerca a sus límites.

KIOXIA documenta indicadores pre-EOL de eMMC y UFS basados en el consumo de reserva, con estados de advertencia/urgente o advertencia/crítico [2]. Los SSD usan campos SMART/NVMe y las tarjetas extraíbles suelen mostrar mucha menos telemetría.

Borrar archivos no repone bloques físicos de reserva. El espacio libre ayuda a garbage collection, pero no es la reserva del controlador. Consulta los campos de salud SMART NVMe para el caso SSD.

Por qué un cambio de NAND o firmware obliga a rehomologar

Requisito ECC, geometría de página, posición del marcador, temporización, reintentos de lectura y desgaste cambian entre generaciones NAND. Una combinación de controlador/firmware validada con un dado no es automáticamente segura con otro.

En NAND cruda, el equipo debe coincidir con la hoja exacta. En producto administrado, el proveedor debe validar el firmware contra la nueva NAND y mantener el comportamiento y confiabilidad prometidos. Una prueba rápida de capacidad y velocidad no revela todas las incompatibilidades.

Por eso importan una BOM fija y un proceso de cambio controlado: NAND, controlador y firmware deben quedar en el expediente.

Lista de homologación para compradores

Para NAND cruda o diseños BGA, pide y verifica:

  1. pieza y revisión exactas de NAND;
  2. fuerza ECC y tamaño de paso requeridos;
  3. marcador inicial y procedimiento de escaneo;
  4. mínimo de bloques válidos;
  5. reglas ante fallos de programa/borrado;
  6. reintentos y reporte de error no corregible;
  7. respuesta a corte de energía de tabla y metadatos de mapeo.

Para flash administrada, añade:

  1. revisión de controlador y firmware;
  2. indicadores accesibles de vida y pre-EOL;
  3. política cuando la reserva entra en advertencia;
  4. escritura/lectura de capacidad completa entre muestras y lotes;
  5. pruebas de resistencia, retención, temperatura y ciclos de energía según la aplicación;
  6. aviso de cambios y disparadores de rehomologación.

No pidas la promesa “sin bloques malos”. Pide un sistema que nunca exponga bloques marcados a datos del usuario, corrija dentro de especificación, avise cuando no pueda y conserve trazabilidad al cambiar la BOM.

Conclusión

Los bloques defectuosos y ECC son partes normales de la ingeniería NAND. Puede haber bloques iniciales en un dispositivo crudo conforme; los bloques desarrollados se retiran con el uso; ECC corrige errores esperados; la reserva conserva la capacidad lógica. La confiabilidad depende de implementación correcta, margen, señales de salud y rehomologación disciplinada, no de una captura que declare perfecto cada bloque físico.

Preguntas frecuentes

¿Un bloque defectuoso en un chip NAND nuevo significa rechazo?
No automáticamente. El fabricante puede entregar NAND cruda con bloques marcados de origen si cumple el mínimo de bloques válidos. Esos bloques nunca deben usarse. En flash administrada, el controlador los excluye antes de presentar la capacidad lógica al equipo.
¿Un error corregido por ECC significa que se perdieron datos?
No. ECC detecta y corrige una cantidad admitida de bits antes de devolver los datos. El riesgo aparece cuando los errores superan su capacidad, se implementa una fuerza incorrecta o el sistema ignora el estado de error no corregible.
¿Qué debe preguntar un comprador OEM sobre bloques defectuosos?
Pregunta si el producto usa NAND cruda o administrada, cómo se asegura la compatibilidad ECC, cómo se manejan bloques iniciales y de campo, cómo se vigila la reserva, qué registros o logs de salud existen y qué cambios de lote/BOM exigen homologar de nuevo.
¿Abasteciendo por volumen?

Publicamos la capacidad utilizable medida y aceptamos verificación de lote de prueba — grado automotriz, directo de la fábrica de origen.