¿Por qué nadie mantiene un ledger neutral de verificación cuántica?
Estado a: agosto 2026.
No existe un organismo económicamente independiente que corra todas las máquinas cuánticas bajo la misma regla — mismas instancias, mismo presupuesto de cómputo, artefactos re-corribles, veredictos que se revisan cuando el hardware cambia. A agosto de 2026 ese ledger no existe, y su ausencia no es un descuido. Cada actor del ecosistema tiene una razón racional para no mantenerlo: los vendors miden con la regla que su propia arquitectura favorece, la academia premia la novedad y no el mantenimiento, los analistas facturan a la industria que cubren, y el capital público financia máquinas, no arbitraje. Los tres intentos parciales más serios — la Quantum Benchmarking Initiative de DARPA, Metriq y QOBLIB — cubren cada uno una parte del trabajo. Ninguno lo cubre entero.
¿Qué es exactamente lo que falta?
Dos hechos, ambos ya en el registro. Primero: no existe conversión publicada entre las métricas que reportan los vendors — Quantum Volume, algorithmic qubits, CLOPS, error por capa de compuertas. Un comprador que compara dos máquinas está comparando dos reglas; aquí mapeamos las cuatro reglas y sus récords. Segundo: el registro de correcciones corre sobre voluntarios. Cada claim cuántico grande que luego se revisó — el resultado de utilidad del kicked Ising de IBM, el spin-glass de D-Wave, los speedups exponenciales de QML — lo re-corrieron grupos externos en su propio tiempo, con los artefactos públicos que hubiera (la tabla de reversiones, el registro de la dequantización).
Lo que falta es la institución del medio: un organismo permanente, económicamente independiente de cada máquina que mide, que corra las mismas instancias bajo los mismos presupuestos en todas, publique artefactos re-corribles por veredicto, y revise esos veredictos cuando las máquinas cambien. Llamémoslo un ledger neutral de verificación. Nadie mantiene uno.
Por qué cada actor racionalmente pasa
No hace falta ninguna conspiración. El incentivo de cada actor apunta lejos del trabajo, y cada uno actúa racionalmente dentro del suyo — esta sección es análisis estructural, no una acusación.
Vendors. El presupuesto de benchmarking de un vendor se convierte en la métrica que su arquitectura gana (el registro de quién definió, adoptó y abandonó qué métrica). Financiar un ledger donde tu máquina puede perder contra un rival en un workload que no elegiste es, desde el punto de vista fiduciario, un uso extraño del dinero de los accionistas. Cada vendor reporta honestamente dentro de su propia definición; ningún vendor cobra por mantener la definición que los compara.
Academia. La unidad académica de recompensa es el paper nuevo, no el registro mantenido. La única auditoría grande de la brecha entre política y artefactos: de 204 papers computacionales publicados en Science bajo una política obligatoria de datos y código, el 36% de los 180 grupos contactables entregó algún material y el 26% de los hallazgos se pudo reproducir (Stodden, Seiler & Ma, PNAS 115, 2584, 2018 — aquí cubrimos el mecanismo). Un ledger vivo es mantenimiento puro — la actividad que el sistema de incentivos paga menos.
Analistas. Las firmas de investigación de mercado venden reportes y briefings, y la industria cubierta es también la base de clientes. Es una estructura comercial normal, no un escándalo — pero no es independencia económica del medido, que es el primer requisito de un árbitro.
Gobiernos. El capital cuántico, público y privado, compra abrumadoramente máquinas, no arbitraje: de los $12.6B invertidos en startups de tecnología cuántica en 2025, ~90% fue a empresas de computación cuántica, y la porción gubernamental del financiamiento de startups cayó de 33% (2024) a 3% (2025) al entrar el capital privado (McKinsey Quantum Technology Monitor 2026, abr-2026 — el desglose completo del capital). El único programa público que financia evaluación — el QBI de DARPA, abajo — evalúa roadmaps hacia 2033, no las máquinas de hoy sobre workloads de usuario.
Comunidad. Las iniciativas que más se parecen a un ledger (Metriq, QOBLIB) corren con presupuestos de fundaciones y consorcios, y reciben resultados como envíos en vez de ejecutar las máquinas ellas mismas — cobertura sin arbitraje.
Quién lo está intentando — y qué le falta a cada intento
Tres iniciativas hacen trabajo serio adyacente al hueco. Ninguna es el ledger.
DARPA Quantum Benchmarking Initiative (QBI). El único esfuerzo con forma de árbitro que tiene dinero público e independencia del medido. Desde mediados de 2024 evaluó los conceptos de ~20 empresas para computadores cuánticos de escala útil — "utility-scale" definido como valor computacional que excede el costo. Once equipos avanzaron a Stage B el 6-nov-2025, con hasta ~$15M cada uno por ~1 año: IBM, IonQ, Quantinuum, QuEra, Xanadu, Atom Computing, Photonic, Diraq, Quantum Motion, Nord Quantique y Silicon Quantum Computing. En Stage C, equipos gubernamentales de verificación y validación prueban si cada máquina puede construirse y operarse como fue diseñada; dos performers del piloto previo US2QC ya están ahí. En marzo de 2026 el QBI abrió una nueva convocatoria Stage A para arquitecturas aún no evaluadas (abstracts hasta el 31-jul-2026). El encuadre de su propio director: "ahora parece probable que alguien construya un computador cuántico de escala útil para 2033, pero sigue sin estar claro exactamente qué equipo o equipos cruzarán esa meta" (Micah Stoutimore, mar-2026). Lo que el QBI no es: un ledger de las máquinas de hoy. Evalúa roadmaps y prototipos de vendors contra un hito de 2033; no corre workloads de usuario en cada QPU actual bajo una regla, y si sus evaluaciones de Stage C se publicarán como veredictos públicos y comparables no está declarado.
Metriq (Unitary Foundation). Una plataforma comunitaria de benchmarking, relanzada en 2026 alrededor de la suite metriq-gym con un puntaje compuesto por plataforma (arXiv:2603.08680, 2026). Es lo más parecido que existe a un scoreboard público vivo — y sus resultados son enviados por la comunidad vía CLI en vez de ejecutados por un operador independiente, y la plataforma hoy se declara a sí misma en beta: "los datos y visuales todavía se están estabilizando" (metriq.info, accedida ago-2026). Agregación sin arbitraje.
QOBLIB (Quantum Optimization Working Group). La capa de instancias y baselines, bien hecha: 10 clases de problema, 1.200+ instancias (500+ resueltas a optimalidad probada), baselines clásicos transparentes, y un leaderboard vivo que ya registró 2.000+ resultados enviados — paper en Nature Computational Science y sitio nuevo lanzados el 12-ago-2026 (blog IBM Quantum; cubrimos QOBLIB como el estándar de reproducibilidad). Lo que no tiene: un ejecutor. Los que envían corren su propio hardware y reportan; el leaderboard muestra los mejores resultados conocidos, no los re-corre.
Benchmarks de aplicación del QED-C. Suites open-source y neutrales de vendor que cualquiera puede correr (Lubinski et al., arXiv:2110.03137; IEEE TQE 2023). Código, no una institución: el consorcio publica herramientas; no opera un ledger permanente entre vendors.
Revisión de pares. Revisa el texto de un claim; no re-corre el experimento. El resultado medido de depender de ella es la auditoría del 36%/26% de arriba.
| Iniciativa | Qué hace | Qué no hace | Fuente, fecha |
|---|---|---|---|
| DARPA QBI | V&V con presupuesto público de roadmaps de vendors a 2033; 11 equipos en Stage B | No corre workloads de usuario en las máquinas de hoy; comparabilidad pública del Stage C sin declarar | DARPA, 6-nov-2025 / 11-mar-2026 |
| Metriq | Scoreboard comunitario vivo, suite metriq-gym, puntaje compuesto | Resultados auto-enviados; sin ejecutor independiente; en beta | metriq.info; arXiv:2603.08680 (2026) |
| QOBLIB | 1.200+ instancias, baselines clásicos, leaderboard con 2.000+ resultados | Ningún árbitro ejecuta; el leaderboard lista envíos | Nature Comput. Sci. 2026; blog IBM, 12-ago-2026 |
| Suite QED-C | Benchmarks de aplicación open-source que cualquiera puede correr | Herramientas, no una institución; sin ledger permanente | arXiv:2110.03137 (2021; IEEE TQE 2023) |
| Revisión de pares | Chequea el texto de los claims | No re-corre; 26% reproducido en la única auditoría grande | PNAS 115, 2584 (2018) |
¿Qué requeriría un ledger neutral?
Cuatro propiedades, cada una derivada de cómo fallaron de verdad los claims publicados (baselines débiles, artefactos faltantes):
Independencia económica del medido. El presupuesto del operador no puede venir de los vendors que se rankean. El QBI la tiene (dinero público); nada más la tiene del todo.
Misma instancia, mismo presupuesto, ambos lados. Cuántico y clásico corren el problema idéntico bajo el presupuesto de cómputo idéntico. QOBLIB aporta las instancias y los baselines para un dominio; nadie aporta la ejecución.
Artefactos re-corribles por veredicto. Datos, código, semillas, instancia y presupuesto, publicados juntos por corrida. QOBLIB y Metriq empujan en esta dirección — para resultados enviados.
Veredictos vivos, fechados, revisables. Las máquinas cambian cada mes; un ledger sin mantener es una foto, y de fotos está hecho el registro de correcciones-por-voluntarios.
Cada requisito tiene al menos un dueño parcial. Ninguna iniciativa sostiene los cuatro — esa intersección es el hueco.
Nuestros propios datos medidos
El protocolo de corridas selladas de Rosetta es un ejemplo trabajado de los requisitos 2 y 3 a escala chica y declarada: cada corrida de nuestra serie V-0012 / RQ sella juntos la instancia, las semillas, el presupuesto de cómputo y el resultado, y el baseline clásico sigue invicto en todas las corridas selladas hasta ahora (la serie de portafolios). Eso es un solo operador, un puñado de clases de optimización y quantum walks, y cero pretensión de ser el ledger neutral — la declaración de alcance es el punto. Un ledger real necesitaría la misma disciplina de artefactos a escala de ecosistema, operada por una institución con las propiedades de independencia de arriba.
Qué no sabemos
- Si el Stage C del QBI producirá evaluaciones públicas y comparables. DARPA describe V&V gubernamental de si cada máquina puede construirse y operarse como fue diseñada — no un scoreboard público entre vendors.
- Si el hueco es transitorio. Un regulador, un organismo de estándares o un consorcio podrían decidir financiar el arbitraje; nada estructural lo prohíbe. El análisis de incentivos de arriba explica la ausencia — no prueba permanencia.
- Si el leaderboard de QOBLIB se vuelve el estándar de facto en optimización, y si Metriq se estabiliza fuera de beta como scoreboard mantenido.
- Si alguien mantiene un ledger así en privado — un fondo, un laboratorio, una agencia de defensa. La ausencia de un ledger público no es evidencia de que nadie lleve uno.
- Nuestra matriz de incentivos es inferencia estructural desde el comportamiento público, no una encuesta medida. Nadie ha encuestado a vendors, laboratorios y agencias sobre por qué no financian arbitraje.
Fuentes
- DARPA — selección de Stage B del QBI (6-nov-2025)
- DARPA — el QBI se expande, nueva convocatoria Stage A (11-mar-2026)
- The Quantum Insider — cobertura de la expansión del QBI (11-mar-2026)
- PostQuantum — análisis del Stage B del QBI: financiamiento y etapas (nov-2025)
- Blog IBM Quantum — QOBLIB: siguiendo el progreso en optimización cuántica (12-ago-2026)
- QOBLIB — The Quantum Optimization Benchmarking Library (Nature Computational Science, 2026)
- Plataforma Metriq (Unitary Foundation, accedida ago-2026)
- Metriq — A Collaborative Platform for Benchmarking Quantum Computers (arXiv:2603.08680, 2026)
- Stodden, Seiler & Ma — auditoría de reproducibilidad de papers de Science (PNAS 115, 2584, 2018)
- McKinsey Quantum Technology Monitor 2026 (abr-2026)
- Lubinski et al. — benchmarks orientados a aplicación del QED-C (arXiv:2110.03137; IEEE TQE 2023)
Rosetta Q publica veredictos con datos crudos reproducibles. Esto es contenido educativo, no un claim de producto.