Auto-Plan se queda en cloud: A/B Gemma local (12B QAT / 26B QAT / 26B Q8) = MISS
Auto-Plan se queda en cloud: A/B Gemma local = MISS
Decisión (27-07-2026): el Auto-Plan sigue en
gemma-4-26b-a4b-itvía Google AI Studio (cloud). La vía self-host para el Auto-Plan queda descartada con datos — primera apuesta del wager ledger resuelta el mismo día en que se registró (WAGERS.md #2, umbral pre-declarado ≥90% del baseline).
Contexto
Edu quería sustituir el 26B cloud por Gemma 4 12B QAT servido en local (llama.cpp en el futuro servidor Proxmox de Esfericlabs, task #207) — más privado, sin dependencia del cloud, y con margen para servir a varios clientes desde una RTX 5060 Ti de 16 GB. El Auto-Plan (visión sobre planos) es la tarea de IA más exigente del producto y se eligió como banco de pruebas. Dato previo verificado: ningún proveedor cloud sirve el 12B por API (AI Studio solo tiene 26b-a4b-it y 31b-it; Hugging Face: “no Inference Provider”) — el 12B es solo self-host.
El experimento (27-07-2026, ~2 €)
Pod RunPod RTX A6000 48GB (Secure Cloud, eu-se-1), Ollama + los GGUF oficiales, réplica exacta de la receta del driver de producción (_analyze_with_ollama, commit 1a72ccb8: mismo prompt semilla prompts/blueprint_analyst.md, resize 2048, temp 1.0, top_p 0.95, top_k 64, thinking off). Baseline: el driver real google_genai_driver corrido en STAGE sobre el mismo plano (mapa1, 69 racks reales validados por Edu). Piloto previo en el portátil de Edu (CPU, 36 min) coherente con los resultados GPU.
| Configuración | Racks correctos /69 | Inventados | VRAM | Tiempo A6000 |
|---|---|---|---|---|
| 12B QAT · prompt producción (×2 corridas) | 7 | ~40 | ~14 GB | 2-3 min |
| 12B QAT · prompt anti-invención | 17 | 20 | — | 154 s |
| 12B QAT · resolución completa (2953px) | 4 | 27 | — | 191 s |
| 26B A4B QAT Q4 · prompt producción | 49 (71%) | 7 | 21,6 GB | 92 s |
| 26B A4B QAT Q4 · prompt anti-invención | 26 (precisión 90%, cobertura 38%) | 3 | — | 102 s |
| 26B A4B Q8 | 52 (75%) | 2 | pesos 28 GB | 105 s |
| 26B cloud bf16 (baseline) | 69 | 0 | — | 135 s |
Diagnóstico (hard to vary)
- El 12B tiene techo de percepción, no de prompt: su visión “unificada” (encoder-free) comprime cualquier imagen a un presupuesto fijo de ~1.260 tokens — a 2048px o a resolución nativa ve lo mismo, insuficiente para OCR de etiquetas pequeñas en planos densos. El prompt estricto mejora (7→17) pero no puede arreglar lo que el modelo no ve. Alucina esquemas de etiquetado plausibles (series C/D/G/H inventadas), distintos en cada corrida.
- La cuantización degrada exactamente lo que el Auto-Plan necesita (OCR fino de etiquetas y zonas): la calidad escala monótona con los bits — 17% (12B Q4) → 71% (26B Q4) → 75% (26B Q8) → 100% (26B bf16). Confusiones típicas:
P0→PO,P1→PI. - El prompt anti-invención convierte alucinación en miopía: menos inventos a cambio de hundir la cobertura. Útil como técnica, insuficiente como solución.
- Hardware: la 5060 Ti 16GB del spec del servidor NO puede servir ningún Gemma 26B (QAT Q4 = 21,6 GB medidos con contexto 32k; Q8 = pesos 28 GB → tarjeta de 32 GB).
Consecuencias
- Auto-Plan permanece en cloud (26B bf16 AI Studio). Sin cambios en código ni config: el A/B se hizo con scripts standalone.
- La razón “IA para clientes” del servidor Proxmox (task #207) queda tocada; la decisión del servidor pasa a apoyarse en su otro papel (VMs Windows del equipo). Decisión de Edu pendiente.
- Hipótesis abierta NO cubierta por esta apuesta: los callsites de solo texto (CNS Insight, Tutor, Explain, Oráculo WS) no necesitan visión — el 26B QAT podría superar allí el umbral. Sería apuesta nueva + test de ~2 € en RunPod (misma mecánica).
- Datos crudos y scripts:
C:\dev\miscelanea\ab-gemma-local-2026-07-27\(portátil de Edu). Veredicto formal:public/supercontext/WAGERS.mdapuesta #2.
Véase también
- [[crearack-tech—admin—llama-server-runbook]]
- [[ia-tech—metodo—antesala-y-voz]]