Pilar D · Estado a 2026-09-04

¿Por qué un detector puede parecer bueno solo por estar cerca del sitio activo?

En una auditoría interna fechada el 2 de septiembre de 2026, Rosetta Q midió que su propio detector de sitios alostéricos de novo dispara en el percentil 11 de distancia al sitio activo mientras los sitios alostéricos reales viven en el 28, y que al emparejar el nulo estadístico por esa distancia el p-valor titular del proyecto cae de 5,4e-6 a 0,0138. El resultado sigue cruzando 0,05, pero quitando una sola proteína pasa a 0,057. Rosetta Q publica la corrección porque un control tan barato lo puede correr cualquier revisor en una tarde.
→ Read in English
Estado a: 2026-09-04
ROSETTA QQUANTUM VERIFICATION LEDGERPILAR D · RUN REPORTESTADO A: 2026-09-04¿Por qué un detector puedeparecer bueno solo por estarcerca del sitio activo?11 / 28percentil de distancia alsitio activo — dónde apuntadetector (11) vs. real (28)11NUESTRO28REAL med56REAL p75rosettaquantum.com/blograw, reproducible data · sources below

¿Qué midió Rosetta Q?

Que su propio detector apunta a la cáscara equivocada. En una corrida interna sellada el 2026-09-02, el detector de sitios alostéricos de novo de Rosetta Q se auditó contra un control que no venía usando: la distancia al sitio activo. Los bolsillos que predice caen en el percentil 11 de distancia al sitio activo, medido dentro de cada proteína; los sitios alostéricos reales de nuestro set validado de 86 proteínas viven en el 28 (medianas; Mann-Whitney, candidatos más cerca que los reales, p < 1e-5, medido el 2026-08-31). En Ångströms: 9,0 de mediana para los 15 bolsillos predichos, 12,8 para los reales. Apenas uno de cada diez sitios reales está tan cerca del sitio activo como nuestro candidato mediano.

La distancia es señal legítima, y esa parte conviene defenderla. Los sitios alostéricos reales están más cerca del sitio activo que un residuo distal al azar, así que el modelo hace bien en usar esa información. La falla es que la sobre-explota: el detector dispara en una cáscara donde vive alrededor de uno de cada seis sitios reales, y el puntaje no lo notaba.

DISTANCIA AL SITIO ACTIVO · PERCENTIL POR PROTEÍNADÓNDE DISPARA EL DETECTORmediana 11 · IQR 7–15 · n=15DÓNDE VIVEN LOS SITIOS REALESmediana 28 · IQR 18–56 · n=860%25%50%75%100%medianas: 9,0 Å predichos vs 12,8 Å realesMann–Whitney p < 1e-5 · Rosetta Q, 2026-08-31

¿Por qué la distancia al sitio activo engaña a un detector?

Porque el nulo contra el que se lo puntúa ignora la distancia. Nuestro número de confianza es la fracción de bolsillos contiguos al azar que puntúan al menos tan alto como el predicho. Cuando esos bolsillos al azar se sortean entre todos los residuos distales, caen, en promedio, mucho más lejos del sitio activo que el sitio real. Un detector que no aprendió nada salvo "más cerca es mejor" le gana a ese nulo sin haber aprendido nada sobre alostería.

El control interno vuelve concreto el tamaño de la brecha. En EGFR, el sitio alostérico real está a 8,3 Å del sitio activo mientras el nulo histórico sorteaba sus bolsillos a una mediana de 16,5 Å. La comparación nunca fue justa. Es la misma falla sobre la que Rosetta Q escribió en benchmarking cuántico: un baseline clásico débil arruina un benchmark porque el número que publicas es una afirmación sobre tu control, no sobre tu método. Un nulo débil es ese mismo pecado en estadística.

¿Qué es un nulo emparejado por distancia?

Un nulo que sortea sus bolsillos al azar en la misma cáscara de distancia que aquello que se está midiendo. Rosetta Q lo reconstruyó en un módulo nuevo y cambió exactamente una cosa: las semillas de los bolsillos nulos se sortean solo entre residuos distales cuya distancia mínima al sitio activo está a ±2 Å de la mediana de distancia del sitio alostérico real de esa proteína. Mismas 10 features, mismo protocolo dejando una proteína afuera, mismo estadístico, mismas 2.000 permutaciones, misma combinación de Fisher. La pregunta pasa de "¿puntúa alto en algún lado?" a "¿puntúa alto para lo lejos que está?"

El control no castiga a todos por igual, y así sabemos que hace lo que dice. Bajo el nulo emparejado EGFR se degrada de 0,0065 a 0,049 (su sitio está en el percentil 8 de distancia) mientras PAK1 mejora de 0,0175 a 0,0005 (percentil 29, genuinamente distal). Castiga exactamente a los sitios que solo destacaban por estar cerca.

¿Qué le pasó al número titular?

Sobrevivió, y cayó alrededor de tres órdenes de magnitud. Las 86 proteínas quedaron evaluables bajo el nulo emparejado (pools de 21 a 164 semillas, mediana 59), así que las dos columnas describen el mismo conjunto.

Condición Fisher p (N=86) Proteínas bajo p<0,05 Fuente
Nulo histórico (contiguo, sin emparejar), semilla A 5,4e-6 8 / 86 Run report de Rosetta Q, sellado 2026-09-02
Nulo histórico, semilla B 6,6e-6 8 / 86 Run report de Rosetta Q, sellado 2026-09-02
Nulo emparejado, banda ±2 Å, semilla A 0,0138 5 / 86 Run report de Rosetta Q, sellado 2026-09-02
Nulo emparejado, banda ±2 Å, semilla B 0,0107 5 / 86 Run report de Rosetta Q, sellado 2026-09-02
Nulo emparejado, banda ±1 Å 0,0011 6 / 86 Run report de Rosetta Q, sellado 2026-09-02
Nulo emparejado, banda ±3 Å 0,0076 5 / 86 Run report de Rosetta Q, sellado 2026-09-02

La misma auditoría corrigió un número que veníamos citando mal. El ledger interno guardaba el p combinado redondeado a cuatro decimales, o sea 0,0000, y un one-pager interno lo había convertido en "p ≈ 0, por debajo del tope numérico de 1e-6". No había tal tope: el valor histórico real a N=86 es 5,4e-6 — significativo, pero ni cero ni topado. Rosetta Q lo cita como 5,4e-6 de acá en adelante, y la versión equivocada queda en el registro en vez de sobrescribirse en silencio.

DOS NULOS, UNA MÉTRICA · N=86NULO HISTÓRICOsin control de distanciaFisher p = 5,4e-6proteínas bajo p<0,058 / 86quitando las 5 más fuertessigue en 0,004qué pregunta¿alto en algún lado?EMPAREJADO ±2 Åmisma cáscara de distanciaFisher p = 0,0138proteínas bajo p<0,055 / 86 vs 4,3quitando 1 proteína0,057 — ya no cruzaqué pregunta¿alto para lo lejos?mismos datos y mismo modelo — solo cambió el control

¿Qué tan frágil es lo que sobrevive?

Frágil por una proteína. El cruce agregado se apoya en dos casos, PAK1 y SLC6A4, los dos en el piso de resolución del nulo emparejado (p = 1/2001 = 0,0005).

Proteínas quitadas (las más fuertes primero) Fisher p emparejado Fisher p histórico ¿Cruza 0,05? Fuente
ninguna 0,0138 5,4e-6 Run report de Rosetta Q, 2026-09-02
1 (PAK1) 0,057 5,4e-5 no Run report de Rosetta Q, 2026-09-02
2 (PAK1, SLC6A4) 0,176 2,2e-4 no Run report de Rosetta Q, 2026-09-02
3 0,266 7,4e-4 no Run report de Rosetta Q, 2026-09-02
5 0,435 3,7e-3 no Run report de Rosetta Q, 2026-09-02

Hay una segunda lectura que importa más que el agregado. Bajo el nulo emparejado, 5 de 86 proteínas quedan por debajo de p = 0,05 contra 4,3 esperadas por azar a ese umbral: binomial exacta p = 0,43. Proteína por proteína, el detector no acierta más seguido que el azar. Lo que queda es un efecto agregado débil concentrado en dos casos, y la forma honesta de decirlo es exactamente esa.

FISHER p EMPAREJADO vs k QUITADAS (LOG)0,0138k=00,057k=10,176k=20,266k=30,435k=5umbral 0,05nulo histórico en k=5: 0,004 · el emparejado se cae en k=1

¿Qué le hizo el mismo control al resto del trabajo?

Se llevó 9 de 15. Aplicado el 2026-08-31 a los compromisos forward de la cola de descubrimiento — bolsillos candidatos señalados en proteínas sin sitio alostérico conocido — el nulo emparejado por distancia dejó a 9 de los 15 sin significancia, incluido el candidato que había sido el más fuerte del proyecto. Esos compromisos son apuestas fechadas, no hallazgos, y tienen su propio reporte; el punto acá es que el mismo control cortó en la misma dirección en todos lados donde se aplicó.

El sesgo también se reprodujo en dianas frescas que no tenían nada que ver con el lote original. De cinco dianas nuevas abiertas el 2026-09-02, las dos que pasaron el primer filtro caían en el percentil 9 y 7 de distancia al sitio activo. Rosetta Q cerró las dos. El sesgo de periferia no es una propiedad de un lote: es del detector, cuyo hit-rate ciego top-1 es 32,6 % (28/86), medido el 2026-08-28.

¿Es esta falla exclusiva de Rosetta Q?

No, y el arreglo tiene historia larga en otros campos. La forma general es que el modelo aprende una propiedad de cómo se armaron los ejemplos negativos en vez de la biología, y el benchmark se lo premia.

Campo El sesgo El arreglo Fuente
Cribado virtual basado en estructura Modelos profundos puntuaban bien en DUD-E aprendiendo artefactos del lado del ligando en cómo se eligieron los señuelos, no la interacción proteína-ligando Señuelos emparejados por propiedades, y probar si el modelo sigue funcionando con la proteína oculta Chen et al., PLOS ONE 14(8), 2019
Diseño de benchmarks en quimioinformática Señuelos que difieren de los activos en propiedades físicas triviales vuelven fácil la recuperación Señuelos emparejados por propiedades físicas pero topológicamente disímiles (la propia construcción de DUD-E) Mysinger et al., J. Med. Chem. 55, 6582 (2012)
Ciencia basada en aprendizaje automático, 17 campos revisados El leakage infla el desempeño reportado en cientos de artículos; el modelo ve, indirectamente, lo que debería predecir Fichas de modelo y auditoría explícita de qué comparte el set de evaluación con el de entrenamiento Kapoor y Narayanan, Patterns 4, 100804 (2023)
Genómica Las diferencias de distribución entre el set positivo y el negativo son una trampa documentada y recurrente Emparejar los negativos por la propiedad que confunde; reportar el resultado emparejado Whalen et al., Nat. Rev. Genet. 23, 169 (2022)
Detección de sitios alostéricos (este reporte) Los bolsillos predichos caen en el percentil 11 de distancia y los sitios reales en el 28; el nulo sin emparejar no lo controla Semillas sorteadas en la misma cáscara de ±2 Å que el sitio real Run report de Rosetta Q, sellado 2026-09-02

Nada de esto es una acusación a nadie, nosotros incluidos. Un nulo sin emparejar es la construcción por defecto, no mala conducta, y es invisible hasta que alguien mide la propiedad que no controla. Lo que sí corresponde juzgar es qué pasa después de que la medición existe.

¿Qué cambia esto en cómo reporta Rosetta Q?

Cuatro cosas, todas fechadas. El nulo emparejado pasa a ser la métrica primaria del proyecto. El valor histórico se reporta al lado, nunca en su lugar, porque los dos no son comparables y el emparejado es más exigente. El número corregido, 5,4e-6, reemplaza al "≈ 0" en todos lados donde se citaba. Y la fragilidad viaja con el resultado: un p de 0,0138 que pasa a 0,057 cuando se va una proteína se reporta exactamente así, no como "p < 0,05".

Es el mismo estándar que Rosetta Q le pide a todos los demás en nuestro checklist para juzgar un claim de ventaja y en qué significa reproducibilidad radical: un resultado que solo sobrevive el control que te tocó elegir todavía no es un resultado. Y un ledger que solo publica los números que lo halagan no es un ledger — por la misma razón por la que un advantaged solve se define de modo que se pueda reportar en cero.

Qué sabemos y qué no sabemos

Qué sabemos, al 2026-09-04. Los bolsillos predichos y los sitios alostéricos reales ocupan cáscaras de distancia distintas (percentil 11 vs 28, Mann-Whitney p < 1e-5). Bajo un nulo emparejado a ±2 Å de la distancia del sitio real, el resultado agregado sigue cruzando 0,05 (0,0138 y 0,0107 con dos semillas independientes; 0,0011 y 0,0076 en las bandas de ±1 y ±3 Å) pero cae unos tres órdenes de magnitud respecto del 5,4e-6 sin emparejar. Quitando una proteína pasa a 0,057. A nivel individual, 5 de 86 significativas contra 4,3 esperadas por azar no es un exceso (binomial p = 0,43).

Qué no sabemos. Si sobrevive algo una vez corregido el sesgo de periferia en el detector mismo, que es ahora lo primero de nuestra cola: tal como están las cosas, la métrica primaria y la cola de descubrimiento están midiendo parcialmente lo mismo, la cercanía al sitio activo. Si el cruce agregado es señal o dos proteínas con suerte — eso pide un bootstrap sobre proteínas que no corrimos. Cuánto del efecto restante es real, dado que el emparejamiento es imperfecto en una dirección que nos favorece: emparejamos la semilla, mientras que el bolsillo nulo es la semilla más sus k-1 vecinos, así que los bolsillos nulos terminan algo más lejos que el sitio real (EGFR: real 8,3 Å, nulo histórico 16,5 Å, nulo emparejado 10,3 Å). El p emparejado sigue siendo entonces algo optimista, no conservador. El emparejamiento es por la mediana de distancia, no por toda la distribución. La resolución efectiva la fija el tamaño del pool (21 a 164 semillas distintas), así que los 0,0005 hay que leerlos como "por debajo de la resolución del test", no como p-valores chicos. Y el nulo emparejado condiciona en la respuesta — usa la distancia del sitio real para definir la banda —, lo cual es legítimo para esta pregunta pero no es predicción ciega y no debe presentarse como tal.

Falta una cosa más, y es nuestra: los artefactos crudos de esta corrida son internos. Por el estándar con el que Rosetta Q publica, un run report debería venir con un notebook que otro pueda ejecutar, y este viene como resumen. Eso es una deuda, no una virtud, y queda escrito acá para que siga a la vista.

Rosetta Q publica veredictos con datos crudos reproducibles. Esto es contenido educativo, no un claim de producto.

Fuentes:
· Kapoor y Narayanan — Leakage and the reproducibility crisis in machine-learning-based science, Patterns 4, 100804 (2023)
· Kapoor y Narayanan — versión preprint (arXiv:2207.07048)
· Whalen, Schreiber, Noble y Pollard — Navigating the pitfalls of applying machine learning in genomics, Nat. Rev. Genet. 23, 169 (2022)
· Chen et al. — Hidden bias in the DUD-E dataset leads to misleading performance of deep learning in structure-based virtual screening, PLOS ONE 14(8): e0220113 (2019)
· Mysinger, Carchia, Irwin y Shoichet — Directory of Useful Decoys, Enhanced (DUD-E), J. Med. Chem. 55, 6582 (2012)
· Run report del motor de Rosetta Q, RQ-PRIMARY-MATCHED, sellado 2026-09-02 — interno; artefactos crudos aún no publicados
· Rosetta Q — ¿Por qué un baseline clásico débil arruina un benchmark cuántico?
· Rosetta Q — ¿Qué significa reproducibilidad radical en benchmarking?
· Rosetta Q — ¿Cómo saber si un claim de ventaja cuántica es creíble?
· Rosetta Q — ¿Qué es un advantaged solve y por qué importa?

Recibe la próxima.

Un correo por semana: lo que publicó el motor de evidencia y lo que se movió en el registro. Sin ofertas.