¿Qué significa "reproducibilidad radical" en benchmarking?
Estado a: agosto 2026. Este es un post de metodología. Define un término y después lo contrasta contra el registro público.
¿Qué es exactamente la "reproducibilidad radical"?
Un resultado de benchmark es radicalmente reproducible cuando la unidad completa de re-ejecución se publica junta: los datos crudos, el código completo, las semillas aleatorias, la instancia exacta del problema y el presupuesto de cómputo. Cualquiera — un revisor, un competidor, un desconocido con una laptop — puede re-ejecutar la corrida y obtener el mismo número, sin escribirle a los autores y sin confiar en ellos. El lema operativo es: no me creas — corre el notebook.
Cada componente faltante es una vía de escape específica. Sin datos crudos: solo existe el claim resumido. Sin código: toda re-implementación difiere y la brecha se le achaca al re-implementador. Sin semillas: un solver estocástico consigue reintentos silenciosos. Sin instancia exacta: la réplica se contesta con "corriste un problema parecido". Sin presupuesto de cómputo: al rival clásico se lo puede matar de hambre de tiempo y des-afinar — el modo de falla que documentamos en por qué un baseline clásico débil arruina un benchmark cuántico. Un benchmark al que le falta cualquiera de las cinco no es auditable; es un comunicado de prensa con barras de error.
¿Por qué no alcanza con la revisión de pares?
Porque la revisión de pares revisa el texto, no el experimento. Los revisores juzgan si los métodos suenan plausibles; casi ninguno re-corre el cómputo. Las propias revistas son explícitas en lo que exigen — y lo exigido es más débil de lo que la palabra "reproducible" sugiere.
La única auditoría grande que contrastó política contra práctica es la de Stodden, Seiler y Ma (PNAS, 2018): tomaron 204 papers computacionales publicados en Science en 2011–2012 — ya vigente su política — y simplemente pidieron los artefactos. El 36% de los 180 grupos de autores contactables entregó al menos algo de material. El 26% de los hallazgos muestreados pudo efectivamente reproducirse (IC 95%: 20–32%).
| Qué | Estado | Fecha | Fuente |
|---|---|---|---|
| Science: "todos los datos necesarios… deben estar disponibles para cualquier lector… todos los códigos de computadora involucrados… también deben estar disponibles" | Política editorial, condición de publicación | Vigente desde el 11-feb-2011 | Stodden et al., PNAS (2018), citando la política |
| Nature Portfolio: declaración de disponibilidad de datos en todo paper de investigación | Obligatoria | Desde sep 2016 | Nature Portfolio, reporting standards |
| Nature Portfolio: liberar el código para que el lector repita los resultados | "Best practice" (la declaración es obligatoria; liberarlo no) | Accedido ago 2026 | Nature Portfolio, reporting standards |
| Autores que efectivamente entregan artefactos al pedirlos | 36% de los contactados (65 de 180) | Medido en 2018 | Stodden et al., PNAS (2018) |
| Hallazgos efectivamente reproducidos | 26% (IC 95% 20–32%) | Medido en 2018 | Stodden et al., PNAS (2018) |
Léase la brecha: la política de datos más fuerte de la ciencia mainstream produjo artefactos-en-mano en cerca de un tercio de los pedidos, y resultados reproducidos en un cuarto de los papers. La política no es el mecanismo. El mecanismo es publicar la unidad de re-ejecución por adelantado, para que nadie tenga que pedir. Eso es lo que agrega la palabra "radical".
¿Qué muestra el registro en computación cuántica?
Esta es la tesis histórica del post, dicha sin vueltas: cada reversión famosa de un claim de computación cuántica la ejecutó alguien re-corriendo artefactos públicos. No re-leyendo el paper — re-corriendo el blanco. Donde el claim, la instancia y el protocolo estaban completamente especificados, el lado clásico pudo presentarse con un rival más fuerte; donde no, el claim habría sido infalsable.
| Claim | Artefacto público | Quién lo re-corrió | Resultado | Fuente |
|---|---|---|---|---|
| Speedup exponencial de QML para sistemas de recomendación (2016) | Algoritmo + modelo de acceso a datos, especificados por completo | Tang (2018), algoritmo clásico con acceso emparejado | La brecha exponencial colapsó a polinomial | arXiv:1807.04271 |
| Kicked Ising de 127 qubits de IBM, "utilidad más allá de fuerza bruta" (2023) | Circuitos + observables completamente especificados en el paper | Tindall et al. (2024), redes tensoriales en hardware clásico modesto | Igualó los resultados cuánticos | PRX Quantum 5, 010308 |
| Dinámica de spin-glass "beyond classical" en D-Wave Advantage2 (mar 2025) | Geometrías de retícula + protocolo de simulación, publicados | Tindall et al. (Science, jul 2026) — cálculos tempranos en una laptop personal con ITensor open-source | Igualó los regímenes cubiertos; en disputa declarada — la refutación de D-Wave (may 2026) sostiene que las instancias más duras y los observables de mayor orden siguen fuera del alcance clásico | Science 392, 868 (2026) · Refutación de D-Wave |
Dos notas de honestidad. Primera: nada de esto es una acusación — cada claim original fue trabajo serio, publicado con especificación suficiente para que otros lo probaran; eso es la ciencia funcionando, no fraude expuesto. Las correcciones son mediciones corregidas, exactamente el patrón que mapeamos en dequantización y en baselines débiles. Segunda: nótese la simetría — las propias re-ejecuciones fueron reproducibles (la réplica de Tindall corre sobre una librería open-source que cualquiera puede instalar), y por eso la corrección quedó firme en vez de degradar en un él-dijo-ella-dijo. El caso D-Wave muestra el estándar operando en ambas direcciones a la vez: los artefactos eran lo bastante públicos para atacarlos, y la disputa ahora es sobre qué regímenes cubre la réplica — una discusión que solo puede tenerse cuando ambos lados publicaron algo re-corrible.
¿Quién está construyendo infraestructura de reproducibilidad?
La dirección del movimiento son bancos de instancias compartidos con baselines publicados. QOBLIB (Nature Computational Science, 2026; 32 autores de 18 instituciones, IBM incluida) publica diez clases de problemas de optimización con instancias exactas, soluciones baseline de solvers clásicos con nombre y apellido, y rutinas de validación — diseñado, en palabras de los autores, "para asegurar la comparabilidad de los métodos usados, la reproducibilidad de los resultados respectivos y la trazabilidad de las mejoras algorítmicas y de hardware en el tiempo". Eso es la unidad de re-ejecución, institucionalizada: cualquiera que reclame progreso cuántico en esas clases puede ser chequeado contra las mismas instancias y los mismos baselines. Es la respuesta estructural al problema de incomparabilidad que documentamos para las métricas de vendors, donde cada vendor anota en una escala que definió él mismo.
¿Cómo lo aplica Rosetta?
Nuestro protocolo de corridas selladas es la unidad de re-ejecución aplicada primero a nuestros propios números. Cada corrida de nuestras series selladas (la serie V-0012 de optimización de portafolios y la serie RQ de quantum walks) sella juntos la instancia exacta, las semillas aleatorias, el presupuesto de cómputo y el resultado, por corrida — los mismos cinco componentes del checklist de arriba. El alcance es deliberadamente chico y lo declaramos: un puñado de clases de optimización y quantum walks, en las que el baseline clásico está invicto en todas las corridas selladas hasta la fecha. Esto es un ejemplo trabajado del estándar, no un veredicto universal ni un claim de producto.
Qué sabemos / qué no sabemos
Qué sabemos. Las políticas de datos de las grandes revistas son reales y tienen fecha (Science 2011, Nature 2016), pero la única auditoría grande midió 36% de entrega de artefactos y 26% de reproducción. Las tres reversiones más conocidas de claims de computación cuántica (2018, 2024, 2026) corrieron todas sobre artefactos públicos. QOBLIB hoy publica instancias, baselines y código de validación para diez clases de optimización.
Qué no sabemos. No existe medición pública de qué fracción de los claims de computación cuántica publica artefactos re-corribles — el 26% es de papers computacionales generales de Science 2011–2012, no específico de cuántica, y nadie corrió la auditoría equivalente sobre benchmarks cuánticos. En QPUs reales la re-ejecución bit-exacta es imposible por principio — la calibración deriva entre sesiones y las máquinas se dan de baja — y re-correr el lado cuántico cuesta plata real por disparo (lo que cuesta una corrida), así que lo "radical" muchas veces solo es alcanzable por completo del lado clásico o simulado; qué estándar estadístico debería reemplazar la bit-exactitud en hardware no está resuelto. La disputa D-Wave/Flatiron no está cerrada: la reproducibilidad ejecutó el chequeo, no el veredicto final sobre cada régimen. Y si QOBLIB se vuelve el estándar compartido del campo, es demasiado pronto para decirlo.
Rosetta Q publica veredictos con datos crudos reproducibles. Esto es contenido educativo, no un claim de producto.