El Centro de gestión y coordinación de datos de genómica CIRM ha logrado un progreso constante en nuestros hitos durante los últimos seis meses. Continuamos con el desarrollo de una base de datos que almacena archivos y etiquetas descriptivas para proyectos de genómica de células madre y desarrollamos un sitio web que permite a los usuarios autorizados tener acceso controlado a estos datos. El sitio incluye un explorador de archivos que muestra estadísticas de calidad, etiquetas y etiquetas para cada archivo. Para muchos tipos de archivos, el explorador de archivos proporciona un enlace al UCSC Genome Browser donde los datos dentro del archivo aparecen como una pista. Importamos conjuntos de datos de prueba de los laboratorios de Stephen Quake (CIP2, Stanford) y Michael Snyder (CIP1, Stanford) a una versión de prueba de la base de datos. Importamos nuestro primer conjunto de datos financiado por CIRM del laboratorio Kristin Baldwin (Scripps) a una versión de producción de la base de datos protegida por firewall. Entrevistamos a varios laboratorios adicionales, algunos de los cuales pueden tener datos listos para el próximo período del informe y han comenzado a desarrollar software anticipándose a sus necesidades.
Período de información:
Los estudiantes de Year 2
En el año 2, el Grupo de Gestión del Centro de Datos (DCM) discutió datos de producción o piloto de CIP1, CIP2 y de todos los laboratorios de CRP de la primera ronda menos uno, e inició contacto con laboratorios financiados en la segunda ronda de CRP. Creamos una infraestructura para vistas de conjuntos de datos completos de nivel superior, además de nuestras vistas archivo por archivo existentes. Implementamos una visualización simple e informativa de agrupaciones de RNA-seq de tipo de unión de vecinos que pueden mostrar múltiples tipos de metadatos en la misma pantalla. Desarrollamos figuras interactivas para mostrar los resultados del análisis de componentes principales y la agrupación T-SNE que son particularmente útiles para datos de una sola celda, y las probamos en conjuntos de datos de hasta 6000 celdas. Ampliamos las capacidades de SCHub para manejar datos humanos y del mouse, y ampliamos el sitio web para permitir a los usuarios autorizados descargar datos y metadatos sin la necesidad de una cuenta Unix.
Elegimos posponer un hito, un portal público de datos de producción de CIRM, hasta el Y3Q1Q2 para centrarnos en los nuevos adjudicatarios de CRP más grandes de lo esperado. Esto también nos permitió obtener 4 conjuntos de datos piloto adicionales de laboratorios existentes. Este retraso tiene un impacto mínimo en el proyecto general.
El trabajo secundario del DCM es proporcionar visualizaciones de los datos. Existe una demanda creciente de que DCM produzca nuevas visualizaciones de datos, así como que ejecute tanto el análisis estándar como el nuevo, inventado por CIP4, de los datos. Dadas estas mayores solicitudes de visualización y análisis, que a menudo van de la mano, así como el trabajo de disputa adicional de la gran cantidad de nuevos laboratorios financiados por el CRP, nos gustaría discutir la adición de un FTE al presupuesto de DCM.
En los próximos seis meses esperamos producir presentaciones web que muestren los resultados del análisis CIP4. Planeamos ayudar al grupo de curación de datos (DCG) a implementar sus estándares de metadatos, ayudar a capacitar a los laboratorios en estos protocolos y realizar un control de calidad para garantizar el cumplimiento de los estándares. Continuaremos importando datos de producción a medida que estén disponibles. Trabajaremos con los laboratorios que recibieron financiación del CRP en la segunda ronda en datos piloto si los conjuntos de datos de producción aún no están disponibles. Planeamos lanzar un conjunto de nuevas funciones y mejoras de usabilidad en el sitio web y desarrollar un portal público con una gama más amplia de datos publicados que los disponibles actualmente. Ayudaremos al CIP4 en el análisis entre laboratorios y conjuntos de datos.
El Grupo de Curación de Datos (DCG) ha trabajado para establecer procedimientos para anotar en profundidad los conjuntos de datos recopilados a través del centro de genómica. Debido a que la colección CIRM incluirá los resultados de varios laboratorios y proyectos diferentes, es fundamental establecer métodos para describir los experimentos y los resultados de manera coherente. La definición de terminología uniforme ayudará al análisis computacional posterior para arrojar luz al máximo sobre cualquier tipo de célula nueva y conocida identificada a través de estos experimentos. El esfuerzo es particularmente desafiante dada la naturaleza en constante evolución tanto de las tecnologías genómicas empleadas en estas investigaciones como de nuestra comprensión sobre las entidades celulares y moleculares fundamentales que existen o contribuyen a los diversos ensayos.
A la luz de la naturaleza dinámica de estas investigaciones, el DCG ha establecido un mecanismo de comunicación con el DCM para proporcionar terminología estándar para describir experimentos siempre que sea posible. Al mismo tiempo, el DCG podrá responder ampliando y adaptando las especificaciones de ontología según las necesidades del consorcio.
Durante los últimos seis meses, el DCG desarrolló un estándar mínimo de información (MISC) y trabajó con varios de los laboratorios colaboradores como proyecto piloto para completar un ciclo completo en el que se obtuvieron metadatos de los laboratorios, se asignaron al estándar y se devolvieron al laboratorios para su incorporación en la presentación de experimentos posteriores. Debido a que MISCE se utilizará en todo momento, esto garantizará que futuros laboratorios colaboradores también puedan aprovechar los términos controlados. Para ayudar a los laboratorios a adoptar estos estándares, el DCG está creando un portal basado en el sistema O-META desarrollado previamente por JCVI, para permitir a los investigadores anotar sus propias muestras experimentales utilizando los estándares desarrollados por los procedimientos del DCG y DCM. El próximo año, el DCG trabajará para desarrollar y probar aún más este sistema, así como para encontrar formas de ayudar a los laboratorios a anotar sus propios experimentos.
Para proporcionar un contexto de información sobre el estado de las células con el que se puedan comparar las muestras recopiladas dentro del consorcio, el DCG está recopilando un conjunto de conjuntos de datos disponibles públicamente de GEO y SRA. Estos conjuntos de datos incluyen decenas de miles de muestras para las cuales se han recopilado datos de expresión genética en microarrays y mediante secuenciación de ARN. El DCG ha procesado más de 80,000 muestras de RNA-Seq hasta este momento y está en proceso de utilizar métodos semiautomáticos para asignar estados celulares a cada una. Una vez completadas, estas muestras podrán ser utilizadas por el centro para desarrollar predictores de aprendizaje automático para conectar nuevos experimentos con aquellos establecidos en la literatura.
Período de información:
Los estudiantes de Year 3
El grupo de Gestión del Centro de Datos (DCM) ha sido muy productivo durante los últimos dos trimestres. El número de laboratorios que actualmente producen datos genómicos ha seguido creciendo. Durante este período integramos archivos y metadatos para ocho conjuntos de datos nuevos y agregamos nuevos archivos de análisis o datos primarios para ocho conjuntos de datos adicionales. Publicamos páginas de análisis para ocho conjuntos de datos y creamos páginas de resumen para quince conjuntos de datos, lo que resultó en un conjunto completo de resúmenes de todos los conjuntos de datos que se han enviado hasta la fecha. Desarrollamos un nuevo portal público para los datos publicados públicamente que incluye una página de inicio adecuada para una audiencia menos técnica y estamos en la fase de desarrollo de un nuevo visor interactivo para datos de una sola celda. El DCM colaboró con el Grupo de Curación de Datos (DCG) en la producción de la referencia v1.1 de Información mínima sobre un experimento con células madre (MISCE) y comenzó a colaborar con el grupo CIP4 para integrar su trabajo en las páginas de resumen y análisis del conjunto de datos. La DCG logró avances significativos en los últimos seis meses. El estándar de metadatos, MISCE, ahora ha lanzado una segunda versión (ver 1.2) y se ha incorporado al proceso de anotaciones de SCHub. Durante los últimos seis meses, hemos trabajado con el DCM para implementar un nuevo protocolo para anotar muestras recién aportadas mediante el cual los contactos de SCHub trabajan directamente con los laboratorios y los diseñadores de ontologías (en JCVI) trabajan con SCHub (en lugar de también directamente con los laboratorios). . Esto ha simplificado enormemente la interacción y evita la confusión de tener laboratorios colaboradores interactuando con dos grupos informáticos diferentes. Entonces todas las decisiones se pueden tomar de forma centralizada y controlada. Se seguirán desarrollando los estándares MISCE durante el próximo período de informe y publicaremos las descripciones en los próximos meses. También hemos formado dos nuevos grupos de trabajo para organizar el trabajo colaborativo en proyectos temáticos: el Cerebro de Células y los Grupos de Trabajo de Análisis Cardíaco (AWG). Estamos recopilando un gran conjunto de datos de RNA-Seq de células individuales para el proyecto BoC con el fin de reunir el análisis en torno a la identificación de nuevos tipos de células en esta colección de cerebro fetal. Los métodos CIP4 serán probados y evaluados en este BoC. En los próximos meses se implementará en los resúmenes de datos de SCHub una “boleta de calificaciones” que resume cómo una muestra recién aportada se relaciona con una muestra vista anteriormente en el BoC. Los detalles sobre cada hito se enumeran a continuación.
Período de información:
Los estudiantes de Year 4
El Núcleo de Gestión y Coordinación de Datos (DCM) ha seguido recopilando una gran cantidad de datos durante los últimos seis meses. Hemos incorporado datos para un nuevo laboratorio (Chi), hemos incorporado datos 10x (Bruneau, Chi y Corn) y conjuntos de datos ampliados para trece (13) laboratorios más (Bruneau, Chi, Corn, Crooks, Fan, Frazer, Geschwind, Jones, Kriegstein, Loring, Snyder, Weissman, Yeo). Estamos en el proceso de incorporar nuevos datos para cuatro laboratorios adicionales (Kriegstein, Quake, Clarke, Sanford). El Data Curation Group (DCG) ahora ha desviado completamente su atención del establecimiento de estándares de metadatos al desarrollo de herramientas informáticas de apoyo para el análisis de conjuntos de datos de colaboradores y compendios. Durante el próximo año, el DCG trabajará para solidificar las metodologías con las que ha experimentado para que puedan incorporarse a los proyectos de SCHub. Gran parte del código y los modelos también se coordinarán con un nuevo esfuerzo paralelo que forma parte de una iniciativa recientemente lanzada del Instituto Chan-Zuckerberg en la que participan los laboratorios Stuart, Kent y Schauermann como proyectos contribuyentes financiados.
Período de información:
Los estudiantes de Year 5
Resumen del progreso científico del DCM El Núcleo de Gestión y Coordinación de Datos (DCM) ha seguido recopilando una gran cantidad de datos durante los últimos seis meses. Hemos incorporado dos nuevos conjuntos de datos (Quake y Yeo) y datos ampliados para varios conjuntos de datos más (Chi, Crooks, Fan, Frazer, Sanford, Yeo, Jones, Loring, Bruneau, Belmonte). También agregamos archivos de análisis y coordinamos datos que pasan por el proceso uniforme de procesamiento a medida que los conjuntos de datos concluyen la generación de datos. Estamos en el proceso de incorporar datos adicionales para los laboratorios de Yeo, Sanford, Kriegstein, Loring y Corn. DCG Resumen del progreso general El Grupo de Curación de Datos (DCG) continúa su trabajo durante el período de extensión sin costo como se describe en el informe anterior. Poco después de la reunión cara a cara de abril en Stanford se estableció un acuerdo sobre procesos uniformes (desde la expresión cuantificada de CellRanger hasta la corrección por lotes, la normalización y la agrupación y la inferencia de trayectorias). El grupo ha incorporado alternativas adicionales en estos canales para satisfacer las necesidades de los colaboradores de HoC, por ejemplo, reemplazando tSNE con UMAP para la reducción de dimensionalidad o usando URD en lugar de Monocle2 para la inferencia de trayectoria. Además de solidificar dichos procesos de procesamiento, durante el próximo período de informe se finalizarán las interfaces en SCHub para buscar genes marcadores de grupos y para predecir tipos de células con SamplePsychic. Anticipando que una serie de nuevos conjuntos de datos estarán disponibles al final de este período de informe, ahora estamos automatizando la identificación y comparación de grupos de conjuntos de datos y las descripciones RDF de los marcadores genéticos que se encuentran como distintivos de estos grupos. Han progresado las mejoras en la identificación de genes marcadores (NS-Forest) y las transformaciones de características de los conjuntos de datos de scRNA-Seq. Se ha establecido una anotación adicional de células progenitoras (usando StemID). Tanto el grupo JCVI como el UCSC están estableciendo métodos para detectar tipos de células a partir de datos de expresión genética y para hacer que 1) los predictores estén disponibles en un portal (SamplePsychic) y 2) hacer que las listas de genes marcadores y los términos de ontología celular estén disponibles para indexar los conjuntos de datos de SCHub. JCVI continúa mejorando su algoritmo NS-Forest y ahora está aplicando la versión actualizada a los conjuntos de datos BoC y HoC, que aún está en progreso. Se desarrollarán representaciones controladas de los genes marcadores y los tipos de células utilizando RDF para que puedan recuperarse mediante consultas de los usuarios.
Período de información:
Año 6 NCE
El Núcleo de Gestión y Coordinación de Datos (DCM) ha seguido recopilando una gran cantidad de datos durante los últimos seis meses. Hemos incorporado dos nuevos conjuntos de datos (quakeFetalPancreas y pyleSkeletalMuscle) y ampliamos datos primarios para varios conjuntos de datos más (belmonteMouseDnmt3a y sanfordRnaRegulation1). También agregamos archivos de análisis para once conjuntos de datos y coordinamos los datos que pasan por el proceso uniforme de procesamiento a medida que los conjuntos de datos concluyen la generación de datos. Estamos finalizando la ingesta de todos los archivos de análisis restantes a medida que los recibimos del Stanford CESCG Core.
Durante los últimos seis meses, nuestro equipo trabajó en estrecha colaboración con los laboratorios de CESCG para actualizar las páginas de resumen e identificar datos que están listos para compartirse en el SCHub público. Enviamos cinco conjuntos de datos al sitio público (kriegsteinBrainOrganoids2, fanIcf1, jonesYap, pyleSkeletalMuscle y belmonteMouseDnmt3a). Además, hemos realizado actualizaciones en Cell Browser agregando una nueva interfaz de usuario y funciones de software de línea de comandos. Cell Browser también se ha ampliado con doce nuevos conjuntos de datos, tres de los cuales se agregaron para ayudar a los investigadores que trabajan en terapias y vacunas COVID-19.
La ingesta de datos y las anotaciones en SCHub ya están completas. También se han completado los canales para analizar scRNA-seq y scATAC-seq. En el último desarrollo, también se instalaron métodos para unir scRNA-seq y ATAC-Seq durante este último período de NCE (consulte el informe CIP4). Varias técnicas de reducción de dimensionalidad son parte de los procesos, incluidos tSNE, PCA y UMAP. Se han instalado enfoques de agrupación que incluyen DBSCAN, Louvain y métodos espectrales basados en gráficos. Se han instalado métodos de trayectoria para identificar tendencias, incluidos Scimitar, Monocle2, Slingshot y URD. El DCG ha creado varios canales para ingerir y analizar conjuntos de datos de SCHub. Desarrollamos enfoques analíticos para el análisis de trayectorias, aprendizaje automático para anotar conjuntos de datos como el algoritmo NS-Forest de JCVI y nuevas plataformas de intercambio de datos para que los investigadores comparen los resultados de sus experimentos. Un legado de conjuntos de datos y metodologías ahora está disponible públicamente para la comunidad de investigación y tendrá un valor duradero en proyectos de seguimiento y como esfuerzos de código abierto contribuidos por la comunidad.
El DCG trabajó más estrechamente con los investigadores de Heart-of-Cells (HoC) para probar la metodología. La colaboración implicó llamadas telefónicas semanales y luego quincenales para avanzar en el análisis de dos manuscritos principales de HoC. Durante el NCE, finalizamos NSForest de JCVI para encontrar conjuntos de genes marcadores, creamos una herramienta de anotación con reconocimiento de ontología llamada TreeMAP y una colección de firmas llamada scBeacon que recopila, comparte y muestra tipos de células encontradas a partir de datos de RNA-seq a través de sus firmas de grupos utilizando un sistema de igual a igual. Si se adopta ampliamente, este sistema permitirá a los investigadores compartir los resultados de sus hallazgos experimentales en un entorno descentralizado, pero totalmente verificable. Como punto secundario, pero con relevancia para la pandemia actual, el mismo sistema scBeacon también se está implementando para compartir los resultados de las pruebas de diagnóstico de COVID-19 comenzando con el campus de UCSC y pronto con el condado, lo que permite a los pacientes tener control total del acceso o la privacidad de su información de salud.
Detalles de la solicitud de subvención
Titulo de la aplicación:
Centro de excelencia para la genómica de células madre
Resumen público:
El Centro de Excelencia en Genómica de Células Madre reunirá a investigadores de siete importantes instituciones de investigación de California para unir dos campos: la genómica y la investigación con células madre pluripotentes. Los proyectos combinarán las fortalezas de los miembros del equipo del centro, cada uno de los cuales es líder en uno o ambos campos. Los directores del programa tienen una importante experiencia previa en la gestión de programas de investigación genómica a gran escala financiados con fondos federales y han publicado muchos artículos de alto impacto sobre la genómica de células madre humanas. Los investigadores principales de los proyectos iniciados por el centro son expertos en genómica, derivación y diferenciación de hESC e iPSC y bioinformática. A ellos se unirán líderes en biología de células madre, cáncer, epigenética y análisis de sistemas computacionales. Los proyectos 1 a 3 utilizarán enfoques genómicos multinivel para estudiar la derivación y diferenciación de células madre en el corazón, los tumores y el sistema nervioso, con implicaciones para comprender los procesos de enfermedades en el cáncer, la diabetes y la salud cardíaca y mental. El proyecto 4 desarrollará herramientas novedosas para sistemas computacionales y análisis de redes de la función del genoma de las células madre. También se propone un programa de gestión de datos de última generación. Este programa de investigación abrirá el camino hacia el desarrollo del uso seguro de células madre en la medicina regenerativa. Finalmente, los recursos del Centro estarán disponibles para investigadores de todo el Estado de California a través de un programa de investigación colaborativa revisado por pares.
Declaración de beneficio para California:
Nuestro Centro de Excelencia en Genómica de Células Madre ayudará a California a mantener su posición a la vanguardia de la investigación de células madre y beneficiará enormemente a California de muchas maneras. En primer lugar, enfermedades como las cardiovasculares, el cáncer, las enfermedades neurológicas, etc., suponen una gran carga financiera para el Estado. Utilizando tecnologías genómicas avanzadas, aprenderemos cómo las células madre cambian con el crecimiento y la diferenciación en el cultivo y cómo pueden manejarse mejor para su uso seguro para terapia en humanos. En segundo lugar, a través del programa de investigación colaborativa, el centro brindará servicios de genómica a investigadores de todo el estado que estudian células madre con el objetivo de comprender y tratar enfermedades específicas, avanzando así en los tratamientos. En tercer lugar, empleará a un gran número de personas de “alta tecnología”, generando así empleos de alta calidad para el estado. En cuarto lugar, dado que muchos investigadores de este centro tienen experiencia en la fundación de empresas biotecnológicas exitosas, es probable que "escindan" nuevas empresas en este campo de alta tecnología en rápido crecimiento. En quinto lugar, creemos que las iPS y los recursos de información generados por este proyecto tendrán un valor significativo para la ciencia y la industria y serán valiosos para el desarrollo de nuevas terapias. En general, las actividades del centro crearán un efecto de red revolucionario para el estado, impulsando el desarrollo de tecnología, el descubrimiento biológico y el tratamiento de enfermedades en el campo.