Pillar D · Estado a 2026-08-12

¿Qué significa "reproducibilidad radical" en benchmarking?

Reproducibilidad radical significa publicar la unidad completa de re-ejecución — datos crudos, código completo, semillas aleatorias, la instancia exacta del problema y el presupuesto de cómputo — junta, para que cualquiera re-ejecute el benchmark y obtenga el mismo número sin pedir permiso. A agosto de 2026 es el estándar que separa un benchmark de una anécdota: cada reversión famosa de un claim de computación cuántica la ejecutó alguien re-corriendo artefactos públicos, no alguien re-leyendo el paper.
→ Read in English
Estado a: 2026-08-12

Estado a: agosto 2026. Este es un post de metodología. Define un término y después lo contrasta contra el registro público.

¿Qué es exactamente la "reproducibilidad radical"?

Un resultado de benchmark es radicalmente reproducible cuando la unidad completa de re-ejecución se publica junta: los datos crudos, el código completo, las semillas aleatorias, la instancia exacta del problema y el presupuesto de cómputo. Cualquiera — un revisor, un competidor, un desconocido con una laptop — puede re-ejecutar la corrida y obtener el mismo número, sin escribirle a los autores y sin confiar en ellos. El lema operativo es: no me creas — corre el notebook.

LA UNIDAD DE RE-EJECUCIÓN DATOS CRUDOS lo que salió, sin editar CÓDIGO COMPLETO lo que lo produjo SEMILLAS ALEATORIAS el azar, fijado INSTANCIA EXACTA la pregunta misma PRESUPUESTO DE CÓMPUTO lo que costó la respuesta LAS 5 PUBLICADAS → RE-CORRES → MISMO NÚMERO FALTA UNA → "CONFÍA EN MÍ" → UNA ANÉCDOTA

Cada componente faltante es una vía de escape específica. Sin datos crudos: solo existe el claim resumido. Sin código: toda re-implementación difiere y la brecha se le achaca al re-implementador. Sin semillas: un solver estocástico consigue reintentos silenciosos. Sin instancia exacta: la réplica se contesta con "corriste un problema parecido". Sin presupuesto de cómputo: al rival clásico se lo puede matar de hambre de tiempo y des-afinar — el modo de falla que documentamos en por qué un baseline clásico débil arruina un benchmark cuántico. Un benchmark al que le falta cualquiera de las cinco no es auditable; es un comunicado de prensa con barras de error.

¿Por qué no alcanza con la revisión de pares?

Porque la revisión de pares revisa el texto, no el experimento. Los revisores juzgan si los métodos suenan plausibles; casi ninguno re-corre el cómputo. Las propias revistas son explícitas en lo que exigen — y lo exigido es más débil de lo que la palabra "reproducible" sugiere.

La única auditoría grande que contrastó política contra práctica es la de Stodden, Seiler y Ma (PNAS, 2018): tomaron 204 papers computacionales publicados en Science en 2011–2012 — ya vigente su política — y simplemente pidieron los artefactos. El 36% de los 180 grupos de autores contactables entregó al menos algo de material. El 26% de los hallazgos muestreados pudo efectivamente reproducirse (IC 95%: 20–32%).

POLÍTICA EN PAPEL VS ARTEFACTOS EN MANO LA POLÍTICA APLICA (SCIENCE, FEB 2011) 100% AUTORES ENTREGARON ALGÚN MATERIAL 36% HALLAZGOS REPRODUCIDOS 26% 204 papers de Science, 2011–2012 · Stodden et al., PNAS (2018)
Qué Estado Fecha Fuente
Science: "todos los datos necesarios… deben estar disponibles para cualquier lector… todos los códigos de computadora involucrados… también deben estar disponibles" Política editorial, condición de publicación Vigente desde el 11-feb-2011 Stodden et al., PNAS (2018), citando la política
Nature Portfolio: declaración de disponibilidad de datos en todo paper de investigación Obligatoria Desde sep 2016 Nature Portfolio, reporting standards
Nature Portfolio: liberar el código para que el lector repita los resultados "Best practice" (la declaración es obligatoria; liberarlo no) Accedido ago 2026 Nature Portfolio, reporting standards
Autores que efectivamente entregan artefactos al pedirlos 36% de los contactados (65 de 180) Medido en 2018 Stodden et al., PNAS (2018)
Hallazgos efectivamente reproducidos 26% (IC 95% 20–32%) Medido en 2018 Stodden et al., PNAS (2018)

Léase la brecha: la política de datos más fuerte de la ciencia mainstream produjo artefactos-en-mano en cerca de un tercio de los pedidos, y resultados reproducidos en un cuarto de los papers. La política no es el mecanismo. El mecanismo es publicar la unidad de re-ejecución por adelantado, para que nadie tenga que pedir. Eso es lo que agrega la palabra "radical".

¿Qué muestra el registro en computación cuántica?

Esta es la tesis histórica del post, dicha sin vueltas: cada reversión famosa de un claim de computación cuántica la ejecutó alguien re-corriendo artefactos públicos. No re-leyendo el paper — re-corriendo el blanco. Donde el claim, la instancia y el protocolo estaban completamente especificados, el lado clásico pudo presentarse con un rival más fuerte; donde no, el claim habría sido infalsable.

Claim Artefacto público Quién lo re-corrió Resultado Fuente
Speedup exponencial de QML para sistemas de recomendación (2016) Algoritmo + modelo de acceso a datos, especificados por completo Tang (2018), algoritmo clásico con acceso emparejado La brecha exponencial colapsó a polinomial arXiv:1807.04271
Kicked Ising de 127 qubits de IBM, "utilidad más allá de fuerza bruta" (2023) Circuitos + observables completamente especificados en el paper Tindall et al. (2024), redes tensoriales en hardware clásico modesto Igualó los resultados cuánticos PRX Quantum 5, 010308
Dinámica de spin-glass "beyond classical" en D-Wave Advantage2 (mar 2025) Geometrías de retícula + protocolo de simulación, publicados Tindall et al. (Science, jul 2026) — cálculos tempranos en una laptop personal con ITensor open-source Igualó los regímenes cubiertos; en disputa declarada — la refutación de D-Wave (may 2026) sostiene que las instancias más duras y los observables de mayor orden siguen fuera del alcance clásico Science 392, 868 (2026) · Refutación de D-Wave

Dos notas de honestidad. Primera: nada de esto es una acusación — cada claim original fue trabajo serio, publicado con especificación suficiente para que otros lo probaran; eso es la ciencia funcionando, no fraude expuesto. Las correcciones son mediciones corregidas, exactamente el patrón que mapeamos en dequantización y en baselines débiles. Segunda: nótese la simetría — las propias re-ejecuciones fueron reproducibles (la réplica de Tindall corre sobre una librería open-source que cualquiera puede instalar), y por eso la corrección quedó firme en vez de degradar en un él-dijo-ella-dijo. El caso D-Wave muestra el estándar operando en ambas direcciones a la vez: los artefactos eran lo bastante públicos para atacarlos, y la disputa ahora es sobre qué regímenes cubre la réplica — una discusión que solo puede tenerse cuando ambos lados publicaron algo re-corrible.

¿Quién está construyendo infraestructura de reproducibilidad?

La dirección del movimiento son bancos de instancias compartidos con baselines publicados. QOBLIB (Nature Computational Science, 2026; 32 autores de 18 instituciones, IBM incluida) publica diez clases de problemas de optimización con instancias exactas, soluciones baseline de solvers clásicos con nombre y apellido, y rutinas de validación — diseñado, en palabras de los autores, "para asegurar la comparabilidad de los métodos usados, la reproducibilidad de los resultados respectivos y la trazabilidad de las mejoras algorítmicas y de hardware en el tiempo". Eso es la unidad de re-ejecución, institucionalizada: cualquiera que reclame progreso cuántico en esas clases puede ser chequeado contra las mismas instancias y los mismos baselines. Es la respuesta estructural al problema de incomparabilidad que documentamos para las métricas de vendors, donde cada vendor anota en una escala que definió él mismo.

¿Cómo lo aplica Rosetta?

Nuestro protocolo de corridas selladas es la unidad de re-ejecución aplicada primero a nuestros propios números. Cada corrida de nuestras series selladas (la serie V-0012 de optimización de portafolios y la serie RQ de quantum walks) sella juntos la instancia exacta, las semillas aleatorias, el presupuesto de cómputo y el resultado, por corrida — los mismos cinco componentes del checklist de arriba. El alcance es deliberadamente chico y lo declaramos: un puñado de clases de optimización y quantum walks, en las que el baseline clásico está invicto en todas las corridas selladas hasta la fecha. Esto es un ejemplo trabajado del estándar, no un veredicto universal ni un claim de producto.

Qué sabemos / qué no sabemos

Qué sabemos. Las políticas de datos de las grandes revistas son reales y tienen fecha (Science 2011, Nature 2016), pero la única auditoría grande midió 36% de entrega de artefactos y 26% de reproducción. Las tres reversiones más conocidas de claims de computación cuántica (2018, 2024, 2026) corrieron todas sobre artefactos públicos. QOBLIB hoy publica instancias, baselines y código de validación para diez clases de optimización.

Qué no sabemos. No existe medición pública de qué fracción de los claims de computación cuántica publica artefactos re-corribles — el 26% es de papers computacionales generales de Science 2011–2012, no específico de cuántica, y nadie corrió la auditoría equivalente sobre benchmarks cuánticos. En QPUs reales la re-ejecución bit-exacta es imposible por principio — la calibración deriva entre sesiones y las máquinas se dan de baja — y re-correr el lado cuántico cuesta plata real por disparo (lo que cuesta una corrida), así que lo "radical" muchas veces solo es alcanzable por completo del lado clásico o simulado; qué estándar estadístico debería reemplazar la bit-exactitud en hardware no está resuelto. La disputa D-Wave/Flatiron no está cerrada: la reproducibilidad ejecutó el chequeo, no el veredicto final sobre cada régimen. Y si QOBLIB se vuelve el estándar compartido del campo, es demasiado pronto para decirlo.

Rosetta Q publica veredictos con datos crudos reproducibles. Esto es contenido educativo, no un claim de producto.

Fuentes:
· Stodden, Seiler & Ma — An empirical analysis of journal policy effectiveness for computational reproducibility, PNAS 115, 2584 (2018)
· Nature Portfolio — Reporting standards and availability of data, materials, code and protocols (accedido ago 2026)
· QOBLIB — The Quantum Optimization Benchmarking Library, Nature Computational Science (2026)
· QOBLIB — Quantum Optimization Benchmark Library: The Intractable Decathlon (arXiv:2504.03832)
· Repositorio QOBLIB (ZIB-AOPT/QOBLIB)
· Tang — A quantum-inspired classical algorithm for recommendation systems (arXiv:1807.04271, 2018)
· Kim et al. — Evidence for the utility of quantum computing before fault tolerance, Nature 618, 500 (2023)
· Tindall et al. — Efficient tensor network simulation of IBM's kicked Ising experiment, PRX Quantum 5, 010308 (2024)
· King et al. — Beyond-classical computation in quantum simulation, Science (mar 2025)
· Tindall et al. — Dynamics of disordered quantum systems with two- and three-dimensional tensor networks, Science 392, 868 (jul 2026)
· Refutación de D-Wave a la simulación clásica de Flatiron (Quantum Computing Report, may 2026)