Volver a la wiki

Auto-Plan se queda en cloud: A/B Gemma local (12B QAT / 26B QAT / 26B Q8) = MISS

Auto-Plan se queda en cloud: A/B Gemma local = MISS

Decisión (27-07-2026): el Auto-Plan sigue en gemma-4-26b-a4b-it vía Google AI Studio (cloud). La vía self-host para el Auto-Plan queda descartada con datos — primera apuesta del wager ledger resuelta el mismo día en que se registró (WAGERS.md #2, umbral pre-declarado ≥90% del baseline).

Contexto

Edu quería sustituir el 26B cloud por Gemma 4 12B QAT servido en local (llama.cpp en el futuro servidor Proxmox de Esfericlabs, task #207) — más privado, sin dependencia del cloud, y con margen para servir a varios clientes desde una RTX 5060 Ti de 16 GB. El Auto-Plan (visión sobre planos) es la tarea de IA más exigente del producto y se eligió como banco de pruebas. Dato previo verificado: ningún proveedor cloud sirve el 12B por API (AI Studio solo tiene 26b-a4b-it y 31b-it; Hugging Face: “no Inference Provider”) — el 12B es solo self-host.

El experimento (27-07-2026, ~2 €)

Pod RunPod RTX A6000 48GB (Secure Cloud, eu-se-1), Ollama + los GGUF oficiales, réplica exacta de la receta del driver de producción (_analyze_with_ollama, commit 1a72ccb8: mismo prompt semilla prompts/blueprint_analyst.md, resize 2048, temp 1.0, top_p 0.95, top_k 64, thinking off). Baseline: el driver real google_genai_driver corrido en STAGE sobre el mismo plano (mapa1, 69 racks reales validados por Edu). Piloto previo en el portátil de Edu (CPU, 36 min) coherente con los resultados GPU.

ConfiguraciónRacks correctos /69InventadosVRAMTiempo A6000
12B QAT · prompt producción (×2 corridas)7~40~14 GB2-3 min
12B QAT · prompt anti-invención1720—154 s
12B QAT · resolución completa (2953px)427—191 s
26B A4B QAT Q4 · prompt producción49 (71%)721,6 GB92 s
26B A4B QAT Q4 · prompt anti-invención26 (precisión 90%, cobertura 38%)3—102 s
26B A4B Q852 (75%)2pesos 28 GB105 s
26B cloud bf16 (baseline)690—135 s

Diagnóstico (hard to vary)

  1. El 12B tiene techo de percepción, no de prompt: su visión “unificada” (encoder-free) comprime cualquier imagen a un presupuesto fijo de ~1.260 tokens — a 2048px o a resolución nativa ve lo mismo, insuficiente para OCR de etiquetas pequeñas en planos densos. El prompt estricto mejora (7→17) pero no puede arreglar lo que el modelo no ve. Alucina esquemas de etiquetado plausibles (series C/D/G/H inventadas), distintos en cada corrida.
  2. La cuantización degrada exactamente lo que el Auto-Plan necesita (OCR fino de etiquetas y zonas): la calidad escala monótona con los bits — 17% (12B Q4) → 71% (26B Q4) → 75% (26B Q8) → 100% (26B bf16). Confusiones típicas: P0→PO, P1→PI.
  3. El prompt anti-invención convierte alucinación en miopía: menos inventos a cambio de hundir la cobertura. Útil como técnica, insuficiente como solución.
  4. Hardware: la 5060 Ti 16GB del spec del servidor NO puede servir ningún Gemma 26B (QAT Q4 = 21,6 GB medidos con contexto 32k; Q8 = pesos 28 GB → tarjeta de 32 GB).

Consecuencias

Véase también

Subir