🧬 Transcriptional Peaks (sRNA) PAO1 · F2 / F4 / F5

Memoria transgeneracional tras infección — catálogo final 29,981 TPs · IDs viejos mapeados por coordenadas · unicidad vs OP50/E. coli y C. elegans
TPs en el catálogo final
diferenciales en F2
TPs con cambio de expresión F5
TPs con slide IGV (PDF)
Todos Compartido entre F2 y F5 Solo en F2 Solo en F5 ↑ suben ↓ bajan intergénicos
Todos ↑ suben en F2/F5↓ bajan en F2/F5 con slide con ID viejocon secuencia sin reads
ID (v2, interno) TP (final) Start End Len F2 vs PAO1 · log2FC padj F2 F5 vs PAO1 · log2FC padj F5 Clasificación Locus (genes) IGV (PDF)

Comparación F2 = librerías ExpF2_1/2/3 vs PAO1 naïve (DESeq2); comparación F5 = ExpF5_1/2/3 vs PAO1 naïve. Si una celda F2/F5 muestra «·», ese TP no mostró cambio de expresión en esa comparación: 17,275 TPs tienen algunas reads pero sin diferencia, y 6,469 carecen por completo de reads en esas condiciones. Los counts crudos de las 18 librerías (Ctl/F2/F4/F5/OP50/PAO1, 3 réplicas cada una) están en el panel al clic y en la hoja Master_TPs del Excel.

El caso estrella: TP 29042 & 29043 → locus PA4746.2 (tRNA‑Leu)

① Coordenadas & estructura

29042 → ID=261955,332,175–5,332,276 · 102 bp · (+)
(final: 5,332,175–5,332,275 · 101 bp)
29043 → ID=261965,332,288–5,332,319 · 32 nt · (+) · nested en PA4746.2
RelaciónContiguos, NO contenido: gap 12 bp, mismo strand, extremos distintos. El 102 bp cubre parte 5' del tRNA‑Leu; el de 32 nt es un fragmento interno del tRNA aguas abajo.
En el PDF (p.100) el ID es 26195: log2FC F2 −4.28 · padj 4e−18 · SUM 106/F5 51/PAO1 15,413 — todo cuadra con los counts crudos ✔

② Counts por réplica

ID=26196 (32 nt)F4: 47 · 598 · 259
F2: 1618/1231/350 · F5: 156/342/405
PAO1 naïve: 6901/9257/8034 (24,192)
OP50: 169/145/101 (415)
ID=26195 (102 bp)F2: 43/52/11 · F5: 10/29/12
PAO1 naïve: 5044/4224/6145 (15,413)

La variabilidad 47/598/259 es biológica (dispersión entre réplicas), no de tamaño de librería — los TPs ya vienen normalizados para padj y en los TPMs. Los tamaños de librería están en el Excel (hoja Tamaños_biblioteca).

③ Unicidad de los 32 nt

PAO1 (su genoma)1 hit exacto, donde corresponde ✔
OP50 / E. coli0 hits exactos y 0 de sus mitades 16 nt
C. elegans (WBcel235)0 hits

La secuencia de 32 nt sólo existe en PAO1 — la señal OP50 (415 reads) provendría de secuencias casi-identificables u homólogas del mismo tRNA; en TPM nace 757,450 vs 14,045 PAO1, ojo al comparar entre genomas.

⚠️ Nomenclatura: en el catálogo final, los IDs 29042/29043 apuntan a otros loci (5,997,325… y 5,997,360…). El número no es estable entre versiones: mapear SIEMPRE por coordenadas. La hoja Map_old_new del Excel tiene el mapeo completo.

④ Todos los counts del caso

5) Pile-up real en IGV (PA4746.2)

Cobertura read-por-posición derivada de los BAM (samtools/PySAM) por muestra (rep 1). La franja magenta cubre el TP29042/26195 (102 bp) y la teal el TP29043/26196 (32 nt) — es como un mini-IGV: clic en cada barra para la posición exacta.

No. de reads con la secuencia EXACTA de 32 nt por librería (la pregunta #5 de las discusiones internas):

Catálogo alternativo v2 (23,704 TPs, la nomenclatura interna usada en las tablas de trabajo del manuscrito)

Esta es la nomenclatura alternativa (la de Tabla_sRNA_v2.xlsx, tpeaks.bed y las hojas de F4). Contiene clasificación (novel/partially_novel/known), locus, biotipo y stats F2/F5 propias de ese catálogo + counts F4 experimentales. Cada fila indica su TP equivalente en el catálogo final cuando hay overlap ≥50%. Los IDs de ambos catálogos no son intercambiables.
Todos mapeable a final solo v2 con counts F4
ID v2 Start End Len Clasif. Locus F2 vs PAO1 · log2FC padj F2 F5 vs PAO1 · log2FC padj F5 F4 · rep1/2/3 TP final equivalente

Comparaciones OP50 (F4 vs Control/naïve) y C. elegans están en Tabla_sRNA_v2.xlsx sobre otros genomas (OP50 y WBcel235), así que no son mapeables 1:1 por coordenada al catálogo PAO1 — quedan fuera de esta vista.

TPs de PAO1 cuya señal existe en F4 (presencia/ausencia, TP_F4_(15_05_25).xlsx)

En F4 no se hizo comparación de expresión diferencial: aquí se clasificó presencia vs ausencia del sRNA en las librerías (F4&PAO1, F4 y F5, F4+F2/F5, etc.). Las secuencias se resolvieron por coincidencia exacta en el genoma PAO1 (GCF_000006765) para darles coordenada, y se mapearon contra el catálogo final.

Red sRNA → genes objetivo (de Target_sRNA_DE.xlsx)

⭐ Red personal (centro = TP o gen) 🕸️ Red completa genes ↓ en F2 y F5 genes ↓ en F2 y F5 genes ↓ en F4 genes ↓ en F5 genes ↓ en F2
⭐ Red personal 🕸️ Red completa
Modo ⭐ personal: un nodo central (gen o sRNA) con quienes le afectan alrededor (estilo String). «Toda la red» = vista completa en dos columnas. Clic en cualquier nodo: lo fija como centro si es sRNA o gen; clic en la ficha cambia el centro sin volver a cargar.
(47 = 24 PAO1 F2&F5 + 9 F2 + 7 F5 + 4 F4 + 3 C elegans). Derecha: genes de C. elegans objetivo (436 únicos). Arco = el sRNA apuntan a ese gen. Clic en any 关 point: highlights sus conexiones y muestra la ficha a la derecha.

Detalle de nodo

Haz clic en un sRNA (izquierda) o un gen (derecha) para ver las conexiones, los counts y la info.

ChIP-seq — cromatina (H3K4me3 / H3K9me3) en C. elegans F2/F4/F5

Todas las marcas H3K4me3 (activante) H3K9me3 (represiva) promoter ≤1kb peaks con q<0.005 (MACS2) gen mRNA DE (padj<0.005)
Peak_IDGeneraciónMarcaChr StartEndsignalValue -log10 p -log10 q Anotación Gen anotado Dist. TSS

Pipeline ChIP-seq (del manuscrito)

  1. QC: FastQC 0.12 + MultiQC 1.26
  2. Trimming: fastp 0.20.1 — para ChIP se removieron únicamente adaptadores (sin filtro de calidad/longitud)
  3. Align Bowtie2 2.5.4 → BAM y samtools markdup (duplicados únicos)
  4. Peak calling: MACS2 2.2.9.1 — fragmento manual 150 bp, p-value cutoff 0.005
  5. Anotación/rel. TSS: ChIPseeker 1.40.0 (± 3 kb alrededor del TSS y reporters de promoter, q<0.005)
  6. Integración: cada peak se cruza con la baja/up del mRNA de la misma generación (memoria de cromatina)

Cómo leer el resultado

  • H3K4me3 se interpreta como marca activadora y H3K9me3 como represiva de transcripción en el germline.
  • signalValue (columna MACS2) = enriquecimiento del pico (ratio sobre el background); -log10 p y -log10 q = significancia (cuanto más alto, mejor).
  • Anotación = ChIPseeker clasifica el pico según su posición respecto al gen anotado (promoter ≤1 kb, 1‑2 kb, 2‑3 kb, exon, intron, UTR, distal intergenic).
  • Dist. TSS en bp (negativo = aguas arriba de la transcripción, 0 = sobre el TSS).
  • ChIP_peaks_all (Excel) = TODOS los peaks (50,013 filas en 6 combinaciones gen×marca). ChIP_peak_gene_link = una fila por cada peak con el gen de mRNA y su log2FC/padj en esa generación (41,398 pares).

💡 Qué representa cada columna y cómo interpretar la señal de ChIP

FoldChange = log2FC del mRNA del genEl valor de FoldChange que se muestra por peak es el log2 fold-change del mRNA del gen al que se anotó (DESeq2, condición vs CtlF1). Verificado numéricamente con el caso testigo peak_1021 de F2-K9 (gen T15D6.12): log2FC −7.876 ≈ −7.9 y padj 4.31E-08 coinciden exactamente con la hoja comprimida. No es una estadística del ChIP.
1.4 / 1.7 / 2.6… = fold enrichment local (signalValue)Esos valores provienen del signalValue de narrowPeak y representan el fold enrichment del pico dentro de cada muestra (señal local vs background del propio input). Un F.E. de 2.14 significa ~2× señal sobre el fondo en esa región en esa muestra — no es una comparación entre generaciones ni respecto a OP50.
padj_Peak = q-value del picoCorresponde a la columna qvalue de narrowPeak (columna 9). En la tabla completa aparece como −log10(q); en la hoja resumida está expresado como potencia de 10, con q real = 10^(−qvalue). Caso testigo: peak_1021 con −log10(q) 11.37 → 1.00E-11 ✔.
La columna ‘peak’ (525, 96, 131…)No es un fold: es el offset en bp desde el inicio del narrowPeak hasta el summit (el punto de mxima pila de la región) — coinciden con los summits.bed de MACS2.
MACS2 corrió sin controlEn los 16 logs de peak_calling aparece callpeak -t X.bam --nomodel --extsize 150 -g ce --pvalue 0.05 y control file = None: no se pasó ningún BAM control (ni CtlF1 ni OP50) al calling. El CtlF1 fue llamado en paralelo con su propio peak-calling, nunca como parámetro -c. El F.E. (signalValue) ≈ fondo local dinámico del propio sample.
Análisis diferencial de ocupación: pendienteNo existe todavía un análisis diferencial formal (DiffBind o DESeq2/edgeR sobre counts por pico). El corte manual "padj y foldchange >1.5" se hizo a ojo y no está en M&M.
Concordancia marca ↔ dirección del mRNASobre 41,398 filas: H3K9me3 con log2FC<0 = 5,333/18,474 (29%); H3K4me3 con log2FC>0 = 6,773/22,924 (30%). Es decir ~70% va en dirección INVERSA a la esperada — un patrón frecuente en marcas globales de histonas que ya se discutió en el laboratorio y del cual hay ejemplos usados en la tesis interna.
Asignación peak → genChIPseeker asigna el gen más cercano por TSS (sin ventana fija). "Promoter (≤1/2/3 kb)" = casos con dist TSS ≤3 kb; para "Distal Intergenic" sigue reportando el gen más cercano aunque esté a >3 kb (histograma real de |dist|: 0-500 bp 29,612 · 500-1k 7,117 · 1k-2k 6,806 · 2k-3k 2,944 · 3-6k 2,886 · 6-11k 540 · 11-30k 108).
Marco comparativo generalLa dirección de todas las tablas de este proyecto es siempre condición (ExpF2/F4/F5) vs CtlF1. Los folds de señal de ChIP no comparten denominador entre muestras porque MACS2 no recibió control cruzado.

Archivos de origen y verificaciones

  • CHIP-Seq_Raw_Data.xlsx — salida de MACS2+ChIPseeker en 6 hojas (F2/F4/F5 × H3K4me3/H3K9me3). 50,013 peaks en total.
  • table_chip-rna-compress.xlsx — versión resumida usada para el manuscrito: padj_Peak = q del pico (redondeada a la orden de magnitud: 1, 1E‑02, 1E‑07…), padj_Gene = mRNA padj del gen, FoldChange = log2FC del mRNA del gen, Distance_to_TSS.
  • Fuentes completas con las columnas de mRNA: worms/files/full_annotate_{F2,F4,F5}{K4,K9}.txt (7671/7981/6785/2157/8469/8336 filas; solo peaks con gen anotado + mRNA DE adjunto).
  • Falta por verificar: los archivos bigWig (use_k4/bw, bw_total) y los reports de figuras en worm/worm/last_chip — son los tracks de señal por generación.

Glosario (los términos del manuscrito)

TP (Transcriptional Peak)Región del genoma de PAO1 donde se mapea una señal de sRNA (small RNA); se anota el Start/End del «pico» de reads. Cada TP tiene un ID por versión.
CtlF1 (control)Librería control de gusanos F1 (naïve, sin exposición a PAO1) — 3 réplicas.
F2Librería de gusanos de la generación F2 en el experimento de memoria transgeneracional, 3 réplicas (columnas ExpF2_1..3).
F4 / F5Replicas del mismo experimento en las generaciones F4 (en el Excel/web hay counts crudos de ExpF4_1..3; la comparación con padj explícito de F4 estálimitada) y F5, respectivamente.
PAO1 naïveLibrería de PAO1 sin historial con gusanos, 3 réplicas — la referencia en las comparaciones F2 y F5 vs PAO1 naïve.
OP50E. coli OP50, la comida control de los gusanos, 3 réplicas (usada para descartar señales de la comida y para el check de unicidad).
Compartido (Común)Diferencial en F2 y en F5 a la vez con la misma dirección (↑ sube / ↓ baja), es decir, un TP con memoria reproducible entre generaciones.
«Solo se ve en F2 / F5»Diferencial únicamente en esa generación (sin cambio en la otra). En el análisis visual del PDF: 34 TPs «Solo F2» (todos bajan) y 23 TPs «Solo F5» (todos suben).
Clasificación (v2)known / partially_novel / novel según la anotación v2; partially_novel = peak nuevo dentro de un locus ya anotado (ej. tRNA-Leu).
padjp-valor ajustado (FDR Benjamini-Hochberg); < 0.005 es el umbral del paper. Notación científica: 4E-18 = 4×10⁻¹⁸.
SUM_F2 / SUM_PAO1 / TPMSUM = reads crudos sumados en ese TP para la librería; TPM = normalización por tamaño de librería y longitud del TP (los TPs muy cortos dan TPMs altos por diseño).

✅ Anotación oficial (mapeada y verificada hoy)

PAO1worms/12feb/NEW_pao1.gtf (13-02-2025) — verificado: los 29,981 TPs coinciden 100% con DESeq_FINAL Coordenadas/Counts. Es LA anotación oficial del catálogo final de PAO1.
PAO1 (numeración antigua)counts_06-11/pao1_count.txt + new_files/pao1/new/tpeaks.bed (32,930 TPs, Nov-2024) — la nomenclatura interna de trabajo (IDs 29042/29043).
C. elegansZ2024/file_annotations/CELE_TP.gtf — 761,331 TPs (chr I-V numerados NC_003279.8); es la única base de los IDs que se usan en Target_sRNA_DE.xlsx (ID=396296, 326705, 722189…). Counts: counts/cele_filtered_countdata.txt (numeración 761k).
F4 presenciaTP_F4_(15_05_25).xlsx (15-05-2025) — 4 TPs de PAO1 cuya señal está presente en F4 mediante presencia/ausencia (no DE). Las secuencias fueron resueltas exactamente en el genoma: TU125=1,660,261·PA1525 (final TP 7915), TU336=4,937,747 intergénico, TU371=5,278,366 (PA4700 mrcB), TU405=5,850,141 intergénico.
Targets C.elegans sRNA→genesTarget_sRNA_DE.xlsx: 47 sRNAs curados (3 de C.elegans + 44 de PAO1 F2/F4/F5), genes objetivo (436 con múltiples sRNAs y 317 con único) y la lista final de 68 genes (de esa plantilla). Fórmula: cada TP conecta a los genes que se desregulan con datos de log2FC de F2/F4/F5.

Cómo se armó todo

Sobre cuál es la «base»: la numeración alternativa (v2, Tabla_sRNA_v2.xlsx, creada 2024‑07) es anterior al catálogo final (DESeq_FINAL_PAO1_11‑04‑25.xlsx, creado 2025‑04‑09/modif 2025‑04‑11). Esta es la numeración interna de trabajo (IDs 29042/29043) que convive con el catálogo final DESeq_FINAL; por eso mantenemos ambas vistas vistas con sus IDs paralelos.

  1. Catálogo final (claves para el paper): DESeq_FINAL_PAO1_11‑04‑25.xlsx → 29,981 TPs con counts de 18 librerías + padj/log2FC F2 y F5 vs PAO1 naïve.
  2. TPM/coverage tomados de mRNA_&sRNA_TPM‑Coverage.xlsx.
  3. Dos números de TP en paralelo: el catálogo final (29,981, DESeq_FINAL 11-04-25) y el catálogo alternativo v2 (23,704, Tabla_sRNA_v2.xlsx, creado 2024-07-20 — así se hicieron las tablas de trabajo del manuscrito). La pestaña Vista v2 los lista con sus stats propios y su TP equivalente del final cuando hay solapamiento ≥50% (17,160 mapeables).
  4. Nomenclaturas viejasMap_old_new (~21,300 pares).
  5. Secuencias & unicidad: 157 secuencias del Excel de blunt; búsqueda exacta (todo y mitades 16 nt, + reverso complementario) en PAO1 / OP50 / C. elegans.
  6. PDF TP_DE_PAO1: se extrajeron los 175 TPs con slide, su tabla (SUM, TPM, locus) y la imagen IGV de cada uno.

Qué se ve al hacer clic en un TP

Cada ficha muestra padj en notación científica (4E‑18 = 4·10⁻¹⁸), la dirección (↑ sube / ↓ baja vs PAO1 naïve), la clasificación v2 (novel / partially_novel / known), el locus (gen que comparte coordenadas) y los counts crudos por réplica. Las fichas moradas Casos destacan TP29042/29043.

Advertencias

  • Los IDs cambian entre versiones; en la tabla la columna ID viejo indica el correspondiente al sistema de tpeaks.bed / hojas F4 si existe.
  • Los TPs con celdas vacías no expresados ≠ no medidos: 17,275 tienen reads pero sin cambio (DESeq2 los filtra), 6,469 carecen de reads en las librerías relevantes.
  • En TPM, TPs muy cortos (p.e. 32 nt) dan valores altos por diseño del normalizador (TPM); usar counts o padj para discutir.
  • Para comparaciones OP50/C.elegans los catálogos usan otro genoma y otra numeración (no mapeables 1:1 por coordenada).