Análisis de secuencias
Limpieza de FASTA
Ordena un FASTA pegado: quita lo suelto, ajusta, nombra y numera, y conserva los huecos.
Hay un ejemplo cargado. Pulsa aquí y se borra.
Ejemplos:
Ajustes
Ordenado
- Registros
- 5
- Longitud total
- 119
- Caracteres quitados
- 1
- Nombres generados
- 1
- Repetidos numerados
- 1
- Registros vacíos descartados
- 1
| Nombre | Longitud | Estado |
|---|---|---|
| sequence | 20 | nombre generado |
| clone_1 first pick | 39 | correcto |
| clone_1 second pick from the same plate | 20 | correcto |
| clone_2 backup | 20 | correcto |
| clone_2 backup_2 | 20 | duplicado (numerado) |
El texto ordenado se puede pegar directamente en la herramienta de alineamiento.
Cómo se usa
- Pega lo que tengas: un archivo FASTA, un bloque con números de posición al margen o una secuencia sin cabecera.
- Fija el ancho de línea y las mayúsculas. Deja marcada la casilla de los huecos si esto viene de un alineamiento.
- Lee los contadores, mira la tabla por registro y luego copia o descarga el archivo ordenado.
Conviene saber
- Los huecos se conservan por defecto. Quitarlos de un alineamiento deja filas que siguen pareciendo secuencias y ya no cuadran entre sí, y nada de lo que venga después se daría cuenta.
- Los identificadores repetidos se numeran en lugar de dejarse igual, porque si no un programa que use el nombre como clave se queda con un registro y descarta el otro sin decir nada.
- Los aminoácidos sobreviven. Un limpiador que solo conoce códigos de nucleótidos borra la E, la F, la I, la L, la P y la Q de una secuencia de proteína y lo llama ordenar.
Preguntas frecuentes
Todo lo que no sea una letra de secuencia o un hueco. Los espacios, los saltos de línea y los números de posición que algunos visores imprimen al margen no se cuentan, porque son maquetación y no algo que alguien escribiera.
Una cabecera sin secuencia debajo se descarta y se cuenta aparte. Si se ha esfumado un registro, está en el contador de registros vacíos.
La primera palabra de la línea de cabecera. El resto se conserva como descripción y viaja con el registro.
Las demás herramientas de secuencias
- Alineamiento múltiple de secuencias — Alinea una familia de secuencias y lee las columnas conservadas.
- Calculadora de contenido de GC — Contenido de GC y AT, sesgo, y GC a lo largo de la secuencia.
- Traducción de ADN a proteína — Traducción en seis marcos y marcos de lectura abiertos, con los códigos del NCBI.