Proyecto de Base de Datos Genómicas Ensembl: Guía Completa

Puntos Clave
  • Lanzado en 1999 para automatizar la anotación del genoma humano tras el Proyecto Genoma Humano.
  • Soporta más de 50,000 genomas a través de Ensembl y Ensembl Genomes (datos actualizados a 2020).
  • Todo el software es de código abierto y los datos están bajo licencia CC BY 4.0.

El proyecto de base de datos genómicas Ensembl es una iniciativa científica alojada en el European Bioinformatics Institute (EBI). Este proyecto proporciona un recurso centralizado fundamental para genetistas, biólogos moleculares y otros investigadores que estudian los genomas de los seres humanos, otros vertebrados y organismos modelo.

Ensembl se destaca como uno de los navegadores de genomas más reconocidos para la recuperación de información genómica, compartiendo similitudes funcionales con bases de datos y navegadores disponibles en el NCBI y la Universidad de California, Santa Cruz (UCSC).

Historia y Evolución

El genoma humano se compone de aproximadamente tres mil millones de pares de bases que codifican entre 20,000 y 25,000 genes. Para que esta información sea útil, es imperativo identificar la ubicación y las relaciones de los genes individuales. Mientras que la anotación manual es un proceso lento y laborioso, la anotación automatizada utiliza la potencia computacional para realizar el emparejamiento de patrones de proteínas con el ADN.

Lanzado en 1999, coincidiendo con la finalización del Proyecto Genoma Humano, Ensembl nació con el objetivo de anotar automáticamente el genoma humano, integrar dicha anotación con datos biológicos existentes y hacer que este conocimiento fuera público.

Captura de pantalla de Ensembl release 58
Interfaz de usuario del navegador de genomas Ensembl.

Expansión del Proyecto

Con el tiempo, el proyecto se expandió para incluir especies clave como el ratón, la mosca de la fruta y el pez cebra, además de datos sobre variaciones genéticas y características reguladoras. En abril de 2009, se creó Ensembl Genomes, un proyecto hermano que extendió el alcance hacia metazoos invertebrados, plantas, hongos, bacterias y protistas, proporcionando un contexto taxonómico y evolutivo, mientras que el proyecto original mantuvo su enfoque en los vertebrados.

Para el año 2020, Ensembl ya soportaba más de 50,000 genomas, introduciendo innovaciones como Rapid Release para agilizar la disponibilidad de datos y un portal específico para el genoma de referencia del SARS-CoV-2 (COVID-19).

Visualización de Datos Genómicos

El núcleo de Ensembl es su capacidad para generar vistas gráficas automáticas de la alineación de genes y otros datos genómicos frente a un genoma de referencia. Estos se presentan como pistas de datos (data tracks), que el usuario puede activar o desactivar para personalizar la visualización según sus intereses de investigación.

Vista detallada de datos genómicos en Ensembl
Ejemplo de visualización de pistas de datos en la plataforma Ensembl.

La interfaz permite realizar zooms en regiones específicas o desplazarse a lo largo del genoma. Además, ofrece niveles de resolución que van desde cariotipos completos hasta representaciones textuales de secuencias de ADN y aminoácidos, así como árboles de genes similares (homólogos) entre especies. Los datos pueden exportarse en formatos estándar como FASTA.

Métodos de Acceso a la Información

Además de su sitio web, Ensembl ofrece diversas herramientas para la recuperación de datos:

  • APIs: Proporciona una API REST y una API de Perl que modelan objetos biológicos (genes, proteínas), facilitando la creación de scripts para la extracción de datos.
  • BioMart: Una herramienta de minería de datos con interfaz web para descargar conjuntos de datos mediante consultas complejas.
  • Servidor FTP: Permite la descarga de bases de datos MySQL completas o conjuntos de datos seleccionados.
  • Consultas SQL: Los usuarios avanzados pueden realizar consultas directas a la base de datos MySQL pública.

Acceso Abierto y Software

Toda la información del proyecto Ensembl es de acceso abierto y el software es de código abierto, disponible bajo una licencia CC BY 4.0. Para optimizar el servicio, el sitio web de la base de datos Ensembl cuenta con espejos (mirrors) en tres ubicaciones diferentes alrededor del mundo.

Preguntas Frecuentes

Respuestas a las dudas más habituales sobre Proyecto de Base de Datos Genómicas Ensembl: Guía Completa.

Es el uso de software y algoritmos computacionales para identificar la ubicación de los genes mediante el emparejamiento de patrones de proteínas con el ADN, evitando el lento proceso de la anotación manual.

Volver al índice enciclopédico