| ID (v2, interno) | TP (final) | Start | End | Len | F2 vs PAO1 · log2FC | padj F2 | F5 vs PAO1 · log2FC | padj F5 | Clasificación | Locus (genes) | IGV (PDF) |
|---|
Comparación F2 = librerías ExpF2_1/2/3 vs PAO1 naïve (DESeq2); comparación F5 = ExpF5_1/2/3 vs PAO1 naïve. Si una celda F2/F5 muestra «·», ese TP no mostró cambio de expresión en esa comparación: 17,275 TPs tienen algunas reads pero sin diferencia, y 6,469 carecen por completo de reads en esas condiciones. Los counts crudos de las 18 librerías (Ctl/F2/F4/F5/OP50/PAO1, 3 réplicas cada una) están en el panel al clic y en la hoja Master_TPs del Excel.
El caso estrella: TP 29042 & 29043 → locus PA4746.2 (tRNA‑Leu)
① Coordenadas & estructura
| 29042 → ID=26195 | 5,332,175–5,332,276 · 102 bp · (+) (final: 5,332,175–5,332,275 · 101 bp) |
| 29043 → ID=26196 | 5,332,288–5,332,319 · 32 nt · (+) · nested en PA4746.2 |
| Relación | Contiguos, NO contenido: gap 12 bp, mismo strand, extremos distintos. El 102 bp cubre parte 5' del tRNA‑Leu; el de 32 nt es un fragmento interno del tRNA aguas abajo. |
② Counts por réplica
| ID=26196 (32 nt) | F4: 47 · 598 · 259 F2: 1618/1231/350 · F5: 156/342/405 PAO1 naïve: 6901/9257/8034 (24,192) OP50: 169/145/101 (415) |
| ID=26195 (102 bp) | F2: 43/52/11 · F5: 10/29/12 PAO1 naïve: 5044/4224/6145 (15,413) |
La variabilidad 47/598/259 es biológica (dispersión entre réplicas), no de tamaño de librería — los TPs ya vienen normalizados para padj y en los TPMs. Los tamaños de librería están en el Excel (hoja Tamaños_biblioteca).
③ Unicidad de los 32 nt
| PAO1 (su genoma) | 1 hit exacto, donde corresponde ✔ |
| OP50 / E. coli | 0 hits exactos y 0 de sus mitades 16 nt |
| C. elegans (WBcel235) | 0 hits |
La secuencia de 32 nt sólo existe en PAO1 — la señal OP50 (415 reads) provendría de secuencias casi-identificables u homólogas del mismo tRNA; en TPM nace 757,450 vs 14,045 PAO1, ojo al comparar entre genomas.
④ Todos los counts del caso
5) Pile-up real en IGV (PA4746.2)
Cobertura read-por-posición derivada de los BAM (samtools/PySAM) por muestra (rep 1). La franja magenta cubre el TP29042/26195 (102 bp) y la teal el TP29043/26196 (32 nt) — es como un mini-IGV: clic en cada barra para la posición exacta.
Catálogo alternativo v2 (23,704 TPs, la nomenclatura interna usada en las tablas de trabajo del manuscrito)
| ID v2 | Start | End | Len | Clasif. | Locus | F2 vs PAO1 · log2FC | padj F2 | F5 vs PAO1 · log2FC | padj F5 | F4 · rep1/2/3 | TP final equivalente |
|---|
Comparaciones OP50 (F4 vs Control/naïve) y C. elegans están en Tabla_sRNA_v2.xlsx sobre otros genomas (OP50 y WBcel235), así que no son mapeables 1:1 por coordenada al catálogo PAO1 — quedan fuera de esta vista.
TPs de PAO1 cuya señal existe en F4 (presencia/ausencia, TP_F4_(15_05_25).xlsx)
Red sRNA → genes objetivo (de Target_sRNA_DE.xlsx)
Detalle de nodo
Haz clic en un sRNA (izquierda) o un gen (derecha) para ver las conexiones, los counts y la info.
ChIP-seq — cromatina (H3K4me3 / H3K9me3) en C. elegans F2/F4/F5
| Peak_ID | Generación | Marca | Chr | Start | End | signalValue | -log10 p | -log10 q | Anotación | Gen anotado | Dist. TSS |
|---|
Pipeline ChIP-seq (del manuscrito)
- QC: FastQC 0.12 + MultiQC 1.26
- Trimming: fastp 0.20.1 — para ChIP se removieron únicamente adaptadores (sin filtro de calidad/longitud)
- Align Bowtie2 2.5.4 → BAM y samtools markdup (duplicados únicos)
- Peak calling: MACS2 2.2.9.1 — fragmento manual 150 bp, p-value cutoff 0.005
- Anotación/rel. TSS: ChIPseeker 1.40.0 (± 3 kb alrededor del TSS y reporters de promoter, q<0.005)
- Integración: cada peak se cruza con la baja/up del mRNA de la misma generación (memoria de cromatina)
Cómo leer el resultado
- H3K4me3 se interpreta como marca activadora y H3K9me3 como represiva de transcripción en el germline.
- signalValue (columna MACS2) = enriquecimiento del pico (ratio sobre el background); -log10 p y -log10 q = significancia (cuanto más alto, mejor).
- Anotación = ChIPseeker clasifica el pico según su posición respecto al gen anotado (promoter ≤1 kb, 1‑2 kb, 2‑3 kb, exon, intron, UTR, distal intergenic).
- Dist. TSS en bp (negativo = aguas arriba de la transcripción, 0 = sobre el TSS).
- ChIP_peaks_all (Excel) = TODOS los peaks (50,013 filas en 6 combinaciones gen×marca). ChIP_peak_gene_link = una fila por cada peak con el gen de mRNA y su log2FC/padj en esa generación (41,398 pares).
💡 Qué representa cada columna y cómo interpretar la señal de ChIP
| FoldChange = log2FC del mRNA del gen | El valor de FoldChange que se muestra por peak es el log2 fold-change del mRNA del gen al que se anotó (DESeq2, condición vs CtlF1). Verificado numéricamente con el caso testigo peak_1021 de F2-K9 (gen T15D6.12): log2FC −7.876 ≈ −7.9 y padj 4.31E-08 coinciden exactamente con la hoja comprimida. No es una estadística del ChIP. |
| 1.4 / 1.7 / 2.6… = fold enrichment local (signalValue) | Esos valores provienen del signalValue de narrowPeak y representan el fold enrichment del pico dentro de cada muestra (señal local vs background del propio input). Un F.E. de 2.14 significa ~2× señal sobre el fondo en esa región en esa muestra — no es una comparación entre generaciones ni respecto a OP50. |
| padj_Peak = q-value del pico | Corresponde a la columna qvalue de narrowPeak (columna 9). En la tabla completa aparece como −log10(q); en la hoja resumida está expresado como potencia de 10, con q real = 10^(−qvalue). Caso testigo: peak_1021 con −log10(q) 11.37 → 1.00E-11 ✔. |
| La columna ‘peak’ (525, 96, 131…) | No es un fold: es el offset en bp desde el inicio del narrowPeak hasta el summit (el punto de mxima pila de la región) — coinciden con los summits.bed de MACS2. |
| MACS2 corrió sin control | En los 16 logs de peak_calling aparece callpeak -t X.bam --nomodel --extsize 150 -g ce --pvalue 0.05 y control file = None: no se pasó ningún BAM control (ni CtlF1 ni OP50) al calling. El CtlF1 fue llamado en paralelo con su propio peak-calling, nunca como parámetro -c. El F.E. (signalValue) ≈ fondo local dinámico del propio sample. |
| Análisis diferencial de ocupación: pendiente | No existe todavía un análisis diferencial formal (DiffBind o DESeq2/edgeR sobre counts por pico). El corte manual "padj y foldchange >1.5" se hizo a ojo y no está en M&M. |
| Concordancia marca ↔ dirección del mRNA | Sobre 41,398 filas: H3K9me3 con log2FC<0 = 5,333/18,474 (29%); H3K4me3 con log2FC>0 = 6,773/22,924 (30%). Es decir ~70% va en dirección INVERSA a la esperada — un patrón frecuente en marcas globales de histonas que ya se discutió en el laboratorio y del cual hay ejemplos usados en la tesis interna. |
| Asignación peak → gen | ChIPseeker asigna el gen más cercano por TSS (sin ventana fija). "Promoter (≤1/2/3 kb)" = casos con dist TSS ≤3 kb; para "Distal Intergenic" sigue reportando el gen más cercano aunque esté a >3 kb (histograma real de |dist|: 0-500 bp 29,612 · 500-1k 7,117 · 1k-2k 6,806 · 2k-3k 2,944 · 3-6k 2,886 · 6-11k 540 · 11-30k 108). |
| Marco comparativo general | La dirección de todas las tablas de este proyecto es siempre condición (ExpF2/F4/F5) vs CtlF1. Los folds de señal de ChIP no comparten denominador entre muestras porque MACS2 no recibió control cruzado. |
Archivos de origen y verificaciones
- CHIP-Seq_Raw_Data.xlsx — salida de MACS2+ChIPseeker en 6 hojas (F2/F4/F5 × H3K4me3/H3K9me3). 50,013 peaks en total.
- table_chip-rna-compress.xlsx — versión resumida usada para el manuscrito: padj_Peak = q del pico (redondeada a la orden de magnitud: 1, 1E‑02, 1E‑07…), padj_Gene = mRNA padj del gen, FoldChange = log2FC del mRNA del gen, Distance_to_TSS.
- Fuentes completas con las columnas de mRNA: worms/files/full_annotate_{F2,F4,F5}{K4,K9}.txt (7671/7981/6785/2157/8469/8336 filas; solo peaks con gen anotado + mRNA DE adjunto).
- Falta por verificar: los archivos bigWig (use_k4/bw, bw_total) y los reports de figuras en worm/worm/last_chip — son los tracks de señal por generación.
Glosario (los términos del manuscrito)
| TP (Transcriptional Peak) | Región del genoma de PAO1 donde se mapea una señal de sRNA (small RNA); se anota el Start/End del «pico» de reads. Cada TP tiene un ID por versión. |
| CtlF1 (control) | Librería control de gusanos F1 (naïve, sin exposición a PAO1) — 3 réplicas. |
| F2 | Librería de gusanos de la generación F2 en el experimento de memoria transgeneracional, 3 réplicas (columnas ExpF2_1..3). |
| F4 / F5 | Replicas del mismo experimento en las generaciones F4 (en el Excel/web hay counts crudos de ExpF4_1..3; la comparación con padj explícito de F4 estálimitada) y F5, respectivamente. |
| PAO1 naïve | Librería de PAO1 sin historial con gusanos, 3 réplicas — la referencia en las comparaciones F2 y F5 vs PAO1 naïve. |
| OP50 | E. coli OP50, la comida control de los gusanos, 3 réplicas (usada para descartar señales de la comida y para el check de unicidad). |
| Compartido (Común) | Diferencial en F2 y en F5 a la vez con la misma dirección (↑ sube / ↓ baja), es decir, un TP con memoria reproducible entre generaciones. |
| «Solo se ve en F2 / F5» | Diferencial únicamente en esa generación (sin cambio en la otra). En el análisis visual del PDF: 34 TPs «Solo F2» (todos bajan) y 23 TPs «Solo F5» (todos suben). |
| Clasificación (v2) | known / partially_novel / novel según la anotación v2; partially_novel = peak nuevo dentro de un locus ya anotado (ej. tRNA-Leu). |
| padj | p-valor ajustado (FDR Benjamini-Hochberg); < 0.005 es el umbral del paper. Notación científica: 4E-18 = 4×10⁻¹⁸. |
| SUM_F2 / SUM_PAO1 / TPM | SUM = reads crudos sumados en ese TP para la librería; TPM = normalización por tamaño de librería y longitud del TP (los TPs muy cortos dan TPMs altos por diseño). |
✅ Anotación oficial (mapeada y verificada hoy)
| PAO1 | worms/12feb/NEW_pao1.gtf (13-02-2025) — verificado: los 29,981 TPs coinciden 100% con DESeq_FINAL Coordenadas/Counts. Es LA anotación oficial del catálogo final de PAO1. |
| PAO1 (numeración antigua) | counts_06-11/pao1_count.txt + new_files/pao1/new/tpeaks.bed (32,930 TPs, Nov-2024) — la nomenclatura interna de trabajo (IDs 29042/29043). |
| C. elegans | Z2024/file_annotations/CELE_TP.gtf — 761,331 TPs (chr I-V numerados NC_003279.8); es la única base de los IDs que se usan en Target_sRNA_DE.xlsx (ID=396296, 326705, 722189…). Counts: counts/cele_filtered_countdata.txt (numeración 761k). |
| F4 presencia | TP_F4_(15_05_25).xlsx (15-05-2025) — 4 TPs de PAO1 cuya señal está presente en F4 mediante presencia/ausencia (no DE). Las secuencias fueron resueltas exactamente en el genoma: TU125=1,660,261·PA1525 (final TP 7915), TU336=4,937,747 intergénico, TU371=5,278,366 (PA4700 mrcB), TU405=5,850,141 intergénico. |
| Targets C.elegans sRNA→genes | Target_sRNA_DE.xlsx: 47 sRNAs curados (3 de C.elegans + 44 de PAO1 F2/F4/F5), genes objetivo (436 con múltiples sRNAs y 317 con único) y la lista final de 68 genes (de esa plantilla). Fórmula: cada TP conecta a los genes que se desregulan con datos de log2FC de F2/F4/F5. |
Cómo se armó todo
Sobre cuál es la «base»: la numeración alternativa (v2, Tabla_sRNA_v2.xlsx, creada 2024‑07) es anterior al catálogo final (DESeq_FINAL_PAO1_11‑04‑25.xlsx, creado 2025‑04‑09/modif 2025‑04‑11). Esta es la numeración interna de trabajo (IDs 29042/29043) que convive con el catálogo final DESeq_FINAL; por eso mantenemos ambas vistas vistas con sus IDs paralelos.
- Catálogo final (claves para el paper): DESeq_FINAL_PAO1_11‑04‑25.xlsx → 29,981 TPs con counts de 18 librerías + padj/log2FC F2 y F5 vs PAO1 naïve.
- TPM/coverage tomados de mRNA_&sRNA_TPM‑Coverage.xlsx.
- Dos números de TP en paralelo: el catálogo final (29,981, DESeq_FINAL 11-04-25) y el catálogo alternativo v2 (23,704, Tabla_sRNA_v2.xlsx, creado 2024-07-20 — así se hicieron las tablas de trabajo del manuscrito). La pestaña Vista v2 los lista con sus stats propios y su TP equivalente del final cuando hay solapamiento ≥50% (17,160 mapeables).
- Nomenclaturas viejasMap_old_new (~21,300 pares).
- Secuencias & unicidad: 157 secuencias del Excel de blunt; búsqueda exacta (todo y mitades 16 nt, + reverso complementario) en PAO1 / OP50 / C. elegans.
- PDF TP_DE_PAO1: se extrajeron los 175 TPs con slide, su tabla (SUM, TPM, locus) y la imagen IGV de cada uno.
Qué se ve al hacer clic en un TP
Cada ficha muestra padj en notación científica (4E‑18 = 4·10⁻¹⁸), la dirección (↑ sube / ↓ baja vs PAO1 naïve), la clasificación v2 (novel / partially_novel / known), el locus (gen que comparte coordenadas) y los counts crudos por réplica. Las fichas moradas Casos destacan TP29042/29043.
Advertencias
- Los IDs cambian entre versiones; en la tabla la columna ID viejo indica el correspondiente al sistema de tpeaks.bed / hojas F4 si existe.
- Los TPs con celdas vacías no expresados ≠ no medidos: 17,275 tienen reads pero sin cambio (DESeq2 los filtra), 6,469 carecen de reads en las librerías relevantes.
- En TPM, TPs muy cortos (p.e. 32 nt) dan valores altos por diseño del normalizador (TPM); usar counts o padj para discutir.
- Para comparaciones OP50/C.elegans los catálogos usan otro genoma y otra numeración (no mapeables 1:1 por coordenada).