Introducción a la Genómica

1 Introducción a la GenómicaGisella Orjeda Gisella Orjeda...
Author: Luis Miguel Peña Coronel
0 downloads 0 Views

1 Introducción a la GenómicaGisella Orjeda Gisella Orjeda Mayo 2006

2 Que es la Genómica? La genética estudia la herencia de los genes, uno a la vez. La Genómica trata de mirar todos los genes como un sistema dinámico, a través del tiempo, para determinar como interactúan e influencian las vías, redes biológicas, y la fisiología. Es mucho mas global. Es un proceso dinámico Gisella Orjeda Mayo 2006

3 Que es el secuenciamiento del ADN?El secuenciamiento del ADN es el proceso que determina el orden exacto de las bases que conforman un genoma. Gisella Orjeda Mayo 2006

4 Para que sirve? Numero de genes que controlan un carácter, localización y función Regulación génica Organización de la secuencia de ADN Tipos de DNA no codante, cantidad, distribución, contenido de información y funciones Coordinación de la expresión génica síntesis de proteínas, y eventos post-translacionales. Interacción de las proteínas en las maquinaria molecular compleja Comparación entre la función génica predicha y la determinada experimentalmente Conservación evolutiva entre organismos Conservación de proteínas (estructura y función) Estudio del Proteoma (contenido total de proteínas y función) en organismos Correlación de SNPs (variaciones de una base entre individuos) con salud y enfermedad Susceptibilidad a una enfermedad basados en la variación de la secuencia Genes involucrados en caracteres complejos y enfermedades multigenicas Gisella Orjeda Mayo 2006

5 3,000’000,000 bp La posibilidad de un esfuerzo coordinado para secuenciar el genoma humano se toco por primera vez en un meeting en la universidad de California en Santa Cruz en 1985. Gisella Orjeda Mayo 2006

6 Como se secuencia? Gisella Orjeda Mayo 2006

7 Avances técnicos que hicieron posible el secuenciamiento del genoma humanoLa polymerase chain reaction (PCR) que permitió producir muchas copias de ADN rápida y precisamente Un método de secuenciamiento automatizado elaborado en base a la técnica de la PCR y el proceso de secuenciamiento desarrollado por Frederick Sanger en 1977 Gisella Orjeda Mayo 2006

8 Gisella Orjeda Mayo 2006

9 Añadir ddGTP, ddATP,ddCTP,ddTT, a cada uno de los tubos conteniendo el ADN de interés, luego de la reacción separarlos en un gel Para secuenciar leer el orden de las bases desde la mas corta hasta la mas grande Gisella Orjeda Mayo 2006

10 Gisella Orjeda Mayo 2006

11 Gisella Orjeda Mayo 2006

12 Gisella Orjeda Mayo 2006

13 Cartografiar el genoma o (mapear) involucra: Cortar los cromosomas en fragmentos pequeños que puedan ser mantenidos, propagados y caracterizados. Ordenarlos en sus posiciones correspondientes en los cromosomas. Una vez que el mapeo se completa, el siguiente paso es determinar las bases de cada uno de los fragmentos que ha sido ordenado Gisella Orjeda Mayo 2006

14 Gisella Orjeda Mayo 2006

15 Enzimas de restricción (Restricción incompleta)Gisella Orjeda Mayo 2006

16 Gisella Orjeda Mayo 2006

17 Vectores Vectores Caracteristicas Talla insertoMolécula de DNA que se origina de un virus, un plásmido o la célula de un organismo superior en la que otro fragmento de DNA de un tamaño apropiado puede ser integrado sin que el vector pierda su capacidad de auto-replicación Los vectores introducen DNA en células hospederas, donde el DNA puede ser reproducido en grandes cantidades. Vectores Caracteristicas Talla inserto Plasmido E.coli- Introducidos por transfornacion kb (electroporacion or heat shock) Fago E.coli- Virus que infecta bacterias kb Introducido por transfeccion Cosmido E.coli- Plasmido con “cos” sites para kb el packaging en fagos lambda. Introducidos por infeccion en E. coli Gisella Orjeda Mayo 2006

18 Cromosomas Artificiales : para el map-based cloningVector Caracteristicas Talla-inserto BACs: E.coli- Basado en el F factor ocurre natural kb mente. Estable, 1-2 copias por celula TACs Contain T-DNA (w vir genes) so can be kb BiBACs: transformed into plants via Agrobacterium PACs: E.coli- Basado en el genoma del fago-bacteria kb P1 (un virus) YACs: Cel. levadura ( veces mas volumen < 1,000 kb que E. Coli). Usualmente inestables tienen re-arreglos (1 Mb) Gisella Orjeda Mayo 2006

19 Gisella Orjeda Mayo 2006

20 Vector requirements Marcador de selecciónResistencia a ampicilina, kanamicina, hygromicina, herbicidas, etc. Permite que solo los clones recombinantes sobrevivan Sitios de clonamiento múltiple (mcs) muchos (únicos) sitios de restricción Los vectores que amplifican en E. coli: Origen de replicación (Ori): requerido por el plasmido para replicarse en la bacteria Control of copy number (F factor plasmid): reduce el numero de copias del plásmido en una célula dada para evitar problemas de re-arreglos (quimeras) Gisella Orjeda Mayo 2006

21 Tamaño del clon => tamaño de la genotecaCálculo del numero de clones necesario para tener la probabilidad (P) de obtener una secuencia dada: N = ln (1-P) / ln (1-f) Donde f es la proporción del genoma en un clon y N es el numero de clones necesarios. Ejemplo Cuantos clones BAC (con un inserto promedio de 150 kb) se necesitan para tener una prob de 99% de contener todos los fragmentos génomicos posibles del tomate (talla del genoma 950,000 kb)? Con p < 0.01, N = 30,701 Con p < 0.05, N = 19,933 Del Arroz (talla del genoma 430,000 kb)? Con p < 0.01, N = 13,199 Con p < 0.05, N = ?? Gisella Orjeda Mayo 2006

22 Gisella Orjeda Mayo 2006

23 Construcción de mapas físicosLos mapas físicos de construyen con arreglos continuos de clones con insertos grandes (YAC, BAC, PAC, etc) y alineándolos a un mapa de ligamiento genético Se hace el fingerprint (i.e.digestion con HindIII) de las genotecas grandes (10-20X) y los extremos de cada BAC se secuencian El patrón de restricción de los clones se aparea usando un programa que se llama FPC (fingerprint contig) que permite que los clones sean ensamblados en contigs Los Contigs se alinean a los mapas genéticos hibridándolos a marcadores o alineando informaticamente la secuencia de los marcadores a la secuencia de los BAC-end o YAC, PACS ETC. Gisella Orjeda Mayo 2006

24 Fig. 2: Chen et al. (2002) The Plant Cell 14:537-545Esto es un contig Gisella Orjeda Mayo 2006

25 Fig. 1: Chen et al. (2002) The Plant Cell 14:537-545Physical:Genetic map. Anchored BACs are shown in red, gaps in black, centromere in green. Use of a relatively small number of genetically mapped markers is sufficient to anchor the BAC contigs to the genetic map. The gaps that remain usually consist of repetitive DNA that is either hard to clone or hard to sequence. Gisella Orjeda Mayo 2006

26 Sequencing Oryza sativa chromosome 12 Strategy and status November 2004

27 Chromosome 12 public dataGenetic map 198 M 6 non spécifiques 141 acc 5` 86 acc 3` Seq Bac-Ends Clemson 2 libraries (10.9X) : HindIII EcoRI FPC: rice.fpc Clemson fingerprinted Bacs Seq 11 Bacs (CNS) markers Assigned to Contigs Clemson 322 EST mapped to K12

28

29

30

31 IMAGE

32

33 BAC L BAC F BAC B BAC A BAC G BAC I BAC K BAC HDuplication chr11-chr12 : 2.5 Mb Contig de Clemson BACs Monsanto BACs Clemson BACs en MTP OSJNBa0052H10 321/ (C et D) OSJNBa0009F13 OSJNBA0039D03 298 chr11? (ex 299) (E) BAC L 325/ (F et L) 8 BAC F BAC B (B) 1 BAC A (A) 3 BAC G 32 (ex 328) (G) 2 BAC I = (I) 1 na BAC K (K) 2 BAC H (dont le H) 13 337 (7 clones séquencés affectés potentiellement au chr1) 338 (dont 11 CNS) 78

34 Strategy to determine the minimaltiling path 20Kb

35 Strategy to determine the minimaltiling path OUR STRATEGY COMBINES Fingerprint Contig positioning by Blasts Monsanto Bac positioning by Blasts - STC approach - Bac fingerprinting - Gap filling by Hybridisation Minimum tiling path

36 Chromosome 12 Contig identificationSequencing strategy K12 rice Chromosome 12 Contig identification RepeatMask Blasts ID > 95% Positioning Monsanto BACs on contigs Blasts, Hybridation et Fingerprint f r Anchoring BACs and determining the minimal tiling path BacEnds Clemson BACs Monsanto BAC participating at MTP BACs Genoscope Unknown sequence Bac Clemson markers Fingerprint contig limit

37 Hybridation Trois séries de filtres de haute densité (82944 clones)72 plaques 384 banque Clemson HindIII 72+62 plaques 384 banque Clemson EcoRI + 10 plaques banque Monsanto 35mer Primer3 [32P]dCTP

38 FPC takes as input a set of clones and their restriction fragments (called Bands) and assembles the clones into contigs.

39 SPOTTING de las dos genotecas e hibridación con los marcadores asignados al cromosoma 12 En una membrana de nylon de 20 cm x 20 cm se puede hacer el spotting de 72 placas de 384-pocillos cada una en duplicado Por lo tanto 90% de los clones BAC pueden ser spotted en tres membranas. EL OBJETIVO ES ASIGNAR CLONES A LOS MARCADORES BASADOS EN LA HOMOLOGIA DE SECUENCIA

40

41

42

43 I II 1 24 A III IV P V VI 2 6 12 2 3 1 10 4 11 12 9 6 G 7 10 7 8 11 3 5 1 5 9 4 8

44 I II 1 24 A G 2 6 12 3 1 10 4 11 9 7 8 5 III IV P V VI

45

46

47 Status physical mappingNumber of markers used: 126 Number of anchored contigs: 37 6 gaps closed with BacEnds from contig extremities Number of gaps 3 centromere and 2 telomeres

48 Chr 11- chr 12 DUPLICATION 249/223 : 249/224 Rice FPC contigs 8.6 252 375 250 281 251 405 b0070A21 a0021D06 b0074J13 Tel K8 Genetic map C1556S C11324 E60377 R3375 G1225 S10520 C10656S C60227S R3023 S4736 G1391 S2572 E50828S 8.4 9.7 26.7 27.1 38.1 39.4 39.7 40.3 40.6 CENTROMERE 74 253 295 255a 393 107 255b 154 257 a0085J02 Syd 434 311 256 Syd b0016C24 PCR PCR S6477 C60217 R617 R2219 R1869 S10904 E50593S E31151SA E60377B C61563S E2889SC S20542S E10037 C53024S E4211 E61229 C52894 E30009S S21511S S1893 S16219 C52663 S10704 C30362 S144274 S10411 R887 C443 S14025 Y6854R 41.2 42.7 47 47 47.6 48.2 48.2 48.2 48.2 48.2 48.2 49.3 49.3 50.4 51.5 51.5 51.8 51.8 254 258 259 409 b0119N22 260 324 262 210 293 269 325 a0017A21 a0056I16 Syd PCR PCR a0028L05 S13287A C11372 S13126S S10043S S13752 S6205 S1436 C11831S R10818 E4418S C50732S E60142 E4047 E338S E4319 S11679 C53919 G402 C449 S2545 E60556 E3246 C53903 C0185 E51166 S5184 E209945 71.2 55.1 55.9 55.9 57.8 58.9 61.6 64.4 67.2 71.2 72.2 73 73 75.8 78.9 339 263 264 265 109 348 266 PCR a0028L05 K5 Tel R10289S S10074 C208 S15568 R1709 C460 C87 E2234 C52936 C1069 R0125 S861 R4038 L405 C51368 G1406 R1684 R1759 S13561 S11076 Y2824R C901 88.6 91.4 94.6 95.1 97 97.3 99.7 100.9 100.9 103.1 108.2 106.6 107.4 108.7 109.2 109.5 :chr12 :chr11 :centromere Syd : Syngenta data :EST hyb. :marker hyb. Updated 24/10/02

49 How we have eliminated gaps between contigs?Hybridisation with probes developed from BAC ends positioned at contig extremities

50 CHROMOSOME 12 SEQUENCING PROGRESSCHROMOSOME LENGHT Mb TILE LENGHT 27 Mb TILE BACs BACs SUBMITTED in PLN EMBL 214 BACs FINISHING 52 BACs GAPS (centromere and 2 telomeres)

51

52 The Team Nathalie CHOISNE, Gisella ORJEDA, Eric PELLETIER, Marcel SALANOUBAT, Jean WEISSENBACH and Francis QUETIER Tech: Nadia DEMANGE, Agnes VIOLLET GENOSCOPE and UMR 8030 GENOSCOPE/CNRS/Université d ’Evry, 2 Rue Gaston Crémieux CP 5706, EVRY Cedex, France

53 Tallas de los genomas Tamaño comparativo (Bases)(levadura cromosoma 3) 350 K Escherichia coli (bacteria) 4.1 Millones El mas grande cromosoma de levadura 5.8 Millones Levadura entera 15 Millones El cromosoma humano mas pequeño (Y) 50 Millones El cromosoma humano mas grande(1) 250 Millones El genoma humano entero 3 k Millones Gisella Orjeda Mayo 2006

54 Gisella Orjeda Mayo 2006

55 • E.coli 4.1 Mb • Levadura 15 Mb • Arabidopsis 125 Mb• Drosophila 137 Mb • Arroz 420 Mb • Fugu 365 Mb • Soya 1,100 Mb • Pollo 1,200 Mb • Maiz 2,500 Mb • Raton 2,700 Mb • Humano 3,200 Mb • Cebada 4,800 Mb • Trigo 16,000 Mb • Pino 20,000+ Mb Gisella Orjeda Mayo 2006

56 C-value paradox La talla del genoma no esta correlacionada con el numero de genes o la complejidad biológica. Species Physical size Genetic size Phys:Genetic Gene No. Arabidopsis Mb 1200 cM kb/cM 25,498 Rice Mb 1800 cM kb/cM ~50,000 Sorghum Mb 1500 cM kb/cM ~50,000 Tomato Mb 1400 cM kb/cM ?? Maize 2,500 Mb 1500 cM 1,660 kb/cM ~50-100,000 Barley ,300 Mb 1760 cM 3,000 kb/cM ~50,000 Talla física de los genomas varia enormemente Talla genética es mas o menos equivalente Los grandes genomas tienen tasas talla-fisica: talla-genetica grandes el numero estimado de genes varia y no es aun estable Gisella Orjeda Mayo 2006 18

57 Primero, mapas de organismos modeloGisella Orjeda Mayo 2006

58 Que es un genoma modelo? Interpretación de las agencias de financiamiento: Tiempo intergeneracional rápido, genoma pequeño, fácil de hibridizar (endo y cross) tamaño físico pequeño, en relación a especies importantes, fácilmente transformable, mapas genéticos y físicos de alta densidad. Gisella Orjeda Mayo 2006 11

59 Gisella Orjeda Mayo 2006

60 Info en genomas secuenciados http://www.genomesonline.org/Gisella Orjeda Mayo 2006

61 Gisella Orjeda Mayo 2006

62 Gisella Orjeda Mayo 2006

63 Anotación Gisella Orjeda Mayo 2006

64 Que hemos aprendido del genoma humanoTenemos million de bases nucleotídicas (A, C, T, and G). El gen promedio tiene mas o menos bases, pero el tamaño varian enormemente, el mas grande es el de distrofina con 2.4 million de bases. Se estima que el numero total de genes es de 30,000 —mucho menos que previos estimados de 80,000 a 140,000 que fueron basados en extrapolaciones de areas ricas en genessin contar las areas pobres. Casi todas (99.9%) las bases nucleotidicas son exactas en toda la gente. No conocemos las funciones del 50% de los genes descubiertos. Gisella Orjeda Mayo 2006

65 Separar la paja del granoMenos del 2% de genoma codifica proteinas. Las secuencias repetidas que no codifican por proteinas ("junk DNA") forma por lo menos 50% del genoma humano. Se piensa que la secuencias repetidas no tienen una funcion directa pero ellas nos enseñan sobre la estructura y la dinamica cromosomica. En el tiempo los “repeats” re-modelan el genoma re-arreglandolo, creando nuevos genes y modificando y barajando los existentes. Gisella Orjeda Mayo 2006

66 Como esta dispuesto El genoma tiene sectores geno-densos "urban centers" que estan compuestos predominantemente de G y C. En contraste los sectores geno-pobres so ricos en A y T. Estas regiones GC y AT pueden verse como bandas claras y oscuras en un cariotipo Los genes parecen estar concentrados en áreas al azar a lo largo del genoma con espacios vastos de DNA no codante entre ellos. Existen segmentos de hasta 30,000 C y G que se repiten una y otra vez en general alrededor de areas ricas en genes y que forman una barrera entre los gnees y el "junk DNA." Se piensa que estas islas CpG ayudan a regular la actividad génica. El cromosoma 1 es el que tiene mas genes (2968), y el Y, el que tiene menos (231). Gisella Orjeda Mayo 2006

67 El próximo paso: Functional GenomicsGisella Orjeda Mayo 2006

68 Investigando la relacion entre genotipo y fenotipo Organizacion del Genoma Prediccion genica Genomica comparative Regulacion genica Gisella Orjeda Mayo 2006

69 Aquí en Cayetano Positional cloning of 4HL stripe rust resistance quantitative trait loci in barley Genómica Funcional de las Variaciones Naturales en dos genes importantes para la calidad del fruto de la Chirimoya (Annona cherimolia) Identificación de genes y Eco-tilling para la resistencia durable a enfermedades de la cebada en Latinoamérica Differential Display (DD) para el descubrimiento de genes candidatos que participan en la tolerancia a sal y sequia. Hacia la Pesca y Analisis de Genes de Tolerancia a Sales, Sequia y Heladas en Granos Andinos por "Differential Display" y Real Time PCR Seleccion de Cepas de Acidiothiobacillus Ferrooxidans Productoras de Biofertilizantes por Ecotilling Gisella Orjeda Mayo 2006