Pillar D · Estado a 2026-07-23

Runs 003–008: la varianza disuelve la tendencia (y eso es el sistema funcionando)

Corrimos 3 semillas nuevas por tamaño. A n=12 la brecha de QAOA va de 23.4% a 53.7% (media ≈40.9%); a n=16, de 20.7% a 42.3% (media ≈28.8%). Los rangos se solapan: el aparente 'la brecha se achica con el tamaño' del run 002 no sobrevive la medición. CP-SAT llegó al óptimo probado en los 8 runs acumulados. Veredicto, todos: todavía no. Seis archivos sellados, EXP-0012-003 a -008.
→ Read in English
Estado a: 2026-07-23

Por qué existió esta tanda

El run 002 mostró una brecha menor a n=16 que a n=12 (20.7% vs 42.8%) y nos negamos explícitamente a llamarlo tendencia: una semilla por tamaño, varianza sin medir. Esta tanda mide esa varianza — tres semillas frescas (43, 44, 45) por tamaño, protocolo congelado byte a byte: mismos presupuestos, misma profundidad, mismo solver, óptimo exacto como árbitro.

El resultado

QAOA p=2 · brecha al óptimo exacto · 4 semillas por tamaño seeds 42–45 · presupuestos iguales de 120 s · CP-SAT: óptimo probado en los 8 runs 0% 60% n=12 n=16 máx 53.7% mín 23.4% media 40.9% máx 42.3% mín 20.7% media 28.8% puntos teal = semillas individuales · marca dorada = media rangos solapados → efecto tamaño sin resolver con n=4 semillas
Resultados medidos, archivos sellados EXP-0012-001 … -008.
n=12  brechas: 42.8 · 53.7 · 43.7 · 23.4   media 40.9   rango 30.3
n=16  brechas: 20.7 · 42.3 · 21.3 · 31.0   media 28.8   rango 21.6

Qué resuelve la tanda — y qué mata

Mata la historia del run 002. “La brecha se achica al crecer la instancia” parecía plausible con una semilla por tamaño. Con cuatro, los rangos se solapan por 19 puntos: la semilla 45 a n=12 (23.4%) le gana a la semilla 43 a n=16 (42.3%). Las medias siguen difiriendo (40.9 vs 28.8), pero con n=4 semillas y esta dispersión, esa diferencia aún no se distingue del ruido. Dijimos que dos puntos definen cualquier historia; aquí está la prueba, a costa nuestra.

Resuelve que la varianza es de primer orden. La dispersión semilla-a-semilla de QAOA (~20–30 puntos de brecha) es de la misma magnitud que cualquier efecto de tamaño que podamos aspirar a medir. Todo claim futuro sobre esta curva debe llevar barras de error o es decoración.

Y una cosa se mantuvo constante en los 8 runs: CP-SAT encontró el óptimo exacto probado todas y cada una de las veces, en ≈0.1–1.1 s. La vara clásica no se mueve. Así se ve un baseline fuerte.

Qué no sabemos

Si la brecha media realmente decrece con el tamaño — responderlo necesita más semillas por tamaño (próxima tanda: 10+) y n más grandes. Si circuitos más profundos (p=4) aprietan la dispersión o solo la desplazan. Y cómo se comporta todo esto bajo ruido de hardware. Todo medible; todo en la escalera.

Contenido medido de los archivos sellados EXP-0012-001 … -008. Rosetta Quantum publica veredictos con datos crudos reproducibles — incluidos los que disuelven nuestras propias observaciones previas.

Fuentes:
· Archivos sellados EXP-0012-003 … -008, RosettaQuantum/evidence", url: "https://github.com/RosettaQuantum/evidence" }