Pillar D · Estado a 2026-07-23

Run 001: cómo se ve un benchmark cuántico honesto (y por qué ganó el clásico)

Corrimos nuestra primera pelea real: QAOA (cuántico, simulado) vs OR-Tools CP-SAT (clásico) sobre la misma instancia de portafolio de 12 activos, mismo presupuesto de tiempo, semilla fija. CP-SAT llegó al óptimo exacto en 0.113 s; QAOA quedó a 42.8% en 45 s. Veredicto: todavía no — exactamente lo que la teoría predice a esta escala. El run quedó sellado con hash SHA-256 y archivado por triplicado. Esta es la entrada 001 del catálogo.
→ Read in English
Estado a: 2026-07-23

Qué corrimos

Una instancia de optimización de portafolio con restricciones — elegir 5 de 12 activos balanceando retorno esperado contra riesgo — codificada como QUBO y entregada a ambos contendores a la vez:

Misma instancia. Mismo presupuesto de 120 segundos. Semilla 42 en todo. Versiones de librerías congeladas y registradas.

El resultado

Distancia al óptimo exacto · menor es mejor portafolio · 12 activos · seed 42 · presupuesto igual de 120 s 0% = óptimo exacto (el árbitro) 50% CP-SAT clásico 0% — óptimo · 0.113 s QAOA p=2 cuántico · sim CPU 42.8% · 45.1 s PennyLane 0.45.1 · OR-Tools 9.15 · veredicto: todavía no — gana el clásico
Resultado medido, archivo sellado EXP-0012-001. No es una ilustración.

CP-SAT encontró el portafolio probadamente óptimo en una décima de segundo. QAOA, tras 120 pasos de optimización y 2.000 mediciones, entregó un portafolio 42.8% peor que el óptimo — y tardó 400× más en hacerlo.

Por qué este era el resultado esperado

Nadie serio predice ventaja cuántica en un problema de 12 variables, y nosotros tampoco — el archivo registra nuestra hipótesis textual: “a 12 activos NO se espera ventaja cuántica; este run fija la línea base del protocolo.” Tres razones por las que el lado clásico domina aquí:

  1. El problema es diminuto. 4.096 portafolios candidatos no es nada; CP-SAT prueba optimalidad casi instantáneamente.
  2. QAOA a profundidad p=2 es una heurística superficial. Su calidad de aproximación crece con la profundidad del circuito — y la profundidad es justo lo que escasea, en simuladores y en hardware real.
  3. El baseline es fuerte a propósito. Ganarle a un solver clásico debilitado es el pecado más común del benchmarking cuántico. Una victoria contra un baseline débil no es una victoria.

¿Entonces para qué correrlo?

Porque un ledger de verificación se gana la confianza con sus no antes que con sus sí. Este run establece tres activos:

Integridad de esta entrada

El run completo vive en un archivo JSON sellado con sha256:d0a207d6…bce6c, guardado simultáneamente en tres lugares (GitHub, Codeberg y nuestra base de datos) que se referencian entre sí. Si el hash de cualquier copia difiere, esa copia no es válida. El archivo responde seis preguntas — qué, cómo, cuándo, dónde, por qué, quién — para que esta entrada pueda auditarse sin confiar en este post.

Qué no sabemos

Si — y dónde — las recetas de la familia QAOA cruzan a CP-SAT en problemas de portafolio a medida que crecen las instancias: eso es exactamente lo que miden los próximos runs. Tampoco sabemos aún cómo estos resultados de simulador CPU se trasladan a hardware con ruido. Publicaremos ambas cosas, caigan donde caigan.

Contenido medido del archivo sellado EXP-0012-001. Rosetta Quantum publica veredictos con datos crudos reproducibles — incluidos los que el cuántico pierde.

Fuentes:
· Archivo sellado EXP-0012-001 (sha256:d0a207d6…bce6c), RosettaQ evidence ledger" }