Qué son los archivos FASTQ y qué hacer con ellos

Qué contiene el archivo que te entrega el laboratorio de secuenciación, cómo comprobar que llegó bien y los primeros pasos antes de cualquier análisis.

Cuando un laboratorio te entrega los resultados de una secuenciación, lo que recibes son archivos FASTQ. Mucha gente los descarga, los intenta abrir y se encuentra con un muro de letras. Esto es lo que son y lo que conviene hacer —y no hacer— con ellos.

Qué hay dentro de un FASTQ

Un FASTQ guarda lecturas: cada fragmento de ADN que la máquina leyó. Cada lectura ocupa exactamente cuatro líneas:


@LECTURA_001 identificador
GATTTGGGGTTCAAAGCAGTATCGATCAAATAGTAAATCCATTTGTTCAACTCACAGTTT
+
!''*((((***+))%%%++)(%%%%).1***-+*''))**55CCF>>>>>>CCCCCCC65

Esa cuarta línea es lo que distingue al FASTQ del simple texto: dice cuánto se puede confiar en cada letra. La calidad se expresa con el valor Phred: un Q30 significa aproximadamente un error cada mil bases.

Cuántos archivos esperar

En secuenciación de lecturas pareadas, que es lo habitual, cada muestra llega en dos archivos:

Los dos archivos van siempre juntos y en el mismo orden: la primera lectura de uno corresponde a la primera del otro. Si se separan, se reordenan o se pierde uno, el análisis de pares deja de funcionar.

La extensión .gz indica que están comprimidos. Es lo normal, y las herramientas de análisis los leen directamente sin descomprimir. Un FASTQ sin comprimir puede ocupar decenas de gigabytes.

Primero, comprobar que llegó bien

Antes de analizar nada, verifica que la descarga no se corrompió. El laboratorio debería entregar junto a los archivos una lista de sumas de verificación (MD5). Se comprueba con:


md5sum -c checksums.md5

Si algún archivo no coincide, se vuelve a descargar. Es un paso de un minuto que evita descubrir, tres días después de empezar el análisis, que un archivo estaba truncado.

Qué NO hacer

Los datos crudos se guardan en solo lectura, con copia de seguridad, y todo análisis trabaja sobre copias derivadas.

Los primeros pasos del análisis

1. Control de calidad. Con herramientas como FastQC se obtiene un informe por archivo con la calidad por posición, la presencia de adaptadores y las secuencias sobrerrepresentadas. MultiQC reúne todos los informes en uno solo, útil con muchas muestras. 2. Recorte y filtrado. Se eliminan los adaptadores que quedaron pegados a las lecturas y las bases de mala calidad, típicamente en los extremos, con herramientas como fastp, cutadapt o Trimmomatic. 3. Segundo control de calidad, ya sobre las lecturas recortadas, para confirmar que el problema se resolvió. 4. El análisis propiamente dicho, que depende de la pregunta: alineamiento contra un genoma de referencia, ensamblaje, cuantificación de genes, asignación taxonómica.

Hasta el paso 3 el proceso es casi el mismo para cualquier proyecto. Del 4 en adelante, cada pregunta tiene su camino.

Y los archivos AB1

Si lo que te entregaron fue una identificación por Sanger, no recibirás FASTQ sino archivos AB1: los cromatogramas, uno por reacción. Se abren con visores gratuitos y permiten comprobar a ojo la calidad de cada pico. Pídelos siempre, porque son la prueba de que la secuencia consenso que te dieron sale de datos limpios.

Al publicar: guarda los datos en un repositorio

Casi todas las revistas exigen que los datos crudos de secuenciación estén depositados en un repositorio público: SRA del NCBI o ENA del EBI. Conviene preparar los metadatos de cada muestra desde el principio, porque reconstruirlos al final es la parte que más se pospone.

Entregamos los datos crudos con cada proyecto y documentamos el análisis completo, con versiones y parámetros. Puedes ver el alcance en análisis de secuencias, reportes bioinformáticos y secuenciación y ómicas. Si ya tienes archivos y no sabes por dónde empezar, escríbenos.

Inicio · Blog cientifico · Solicitar cotizacion