CreaRack-SL

Migración a gemini-3.1-flash-lite-preview (8 call sites Categoría A)

Contexto

El 27 de abril de 2026 (sesión 33), Google había publicado gemini-3.1-flash-lite-preview el 3 de marzo de 2026. CreaRack Pro llevaba semanas usando gemini-3-flash-preview en los 8 call sites de Categoría A (análisis estructurado, visión y extracción JSON crítica) sin haber evaluado el nuevo modelo.

La Regla 8 de CLAUDE.md exige que cualquier cambio de modelo requiera un ADR que actualice la tabla canónica. Este es ese ADR.

Decisión

Migrar los 8 call sites de Categoría A de gemini-3-flash-preview a gemini-3.1-flash-lite-preview a partir del 2026-04-27.

El cambio afecta exclusivamente a la constante DEFAULT_GEMINI_MODEL en el router central y a los literales de modelo en los 7 call sites restantes que no lo usaban via router.

Call sites migrados

ArchivoServicio / Uso
core/services/ai_providers/router.pyDEFAULT_GEMINI_MODEL — constante central
monitoring/services/ai_providers/gemini.pyCNS (GEMINI_MODEL)
blueprints/services/autoplan.pyAuto-Plan AI (visión)
network/services/mib_assistant.pyMIB Assistant
monitoring/services/tutor_service.pyNetwork Tutor
core/services/ai_operations.pyAIOperations.MODEL
core/management/commands/finops_report.pyFinOps Report (comando de gestión)
core/management/commands/perf_review.pyPerf Review (comando de gestión)

Categoría B sin cambios

Los call sites de Categoría B (síntesis de texto / traducción en workspace) permanecen en gemini-2.5-flash estable. No están afectados por esta decisión.

Evaluación previa

La decisión se tomó tras una evaluación formal con scripts/eval_ai_models.py, un framework A/B reutilizable (N modelos × M casos de prueba) que reutiliza los prompts reales de producción sin tocarla.

Matriz 4 casos × 2 modelos

CasoModelo anteriorModelo nuevoSpeedupObservaciones
MIB Assistant12.3s2.4s5.0×JSON válido, mismos grupos de OIDs
Auto-Plan visión6.4s1.5s4.3×4/4 racks detectados, mismo título de sala
Perf Review9.0s3.5s2.6×Mismas keywords, bullets equivalentes
Network Tutor6.5s3.8s1.7×Respuesta algo más extensa y didáctica
Promedio——3.4×

Coste

Métricagemini-3-flash-previewgemini-3.1-flash-lite-previewΔ
Input (por M tokens)$0.50$0.25−50%
Output (por M tokens)$3.00$1.50−50%

Calidad

  • MIB Assistant: JSON estructuralmente equivalente; 10-15% menos exhaustividad en descripciones textuales sin impacto funcional.
  • Auto-Plan visión: Confirmada — 4/4 racks detectados en imagen sintética, título de sala correcto. Temperatura 0.1 preservada.
  • Perf Review: Mismo número de bullets y keywords técnicas (index, N+1, bloat, OOM).
  • Network Tutor: Respuestas ligeramente más largas y didácticas con el modelo lite.

Consecuencias

Positivas

  • Latencia de usuario reducida 3.4× en promedio en todas las funciones IA del producto.
  • Facturación API reducida ~50% para los call sites de Categoría A.
  • El script scripts/eval_ai_models.py queda como framework reutilizable para evaluar futuros candidatos de modelo sin trabajo manual.

Negativas / Riesgos

  • 10-15% de reducción de exhaustividad en respuestas textuales (MIB Assistant, FinOps Report). Aceptado como trade-off.
  • Modelo en preview — podría deprecarse. La política de pin de versiones (Regla 9) aplica igualmente; la reversión es trivial (1 commit, revertir constante + literales).

Neutrales

  • Las claves API (GEMINI_API_KEY) y la configuración de infraestructura no requieren cambios.
  • Los parámetros de generación (temperatura 0.1, max_output_tokens) se mantienen sin cambios en todos los call sites.

Reversión

Un único commit que revierta DEFAULT_GEMINI_MODEL en router.py y los 7 literales restantes a gemini-3-flash-preview.

Supersedes

Supersedes: [[decision—20260401—gemini-3-flash-preview]]

La Regla 8 de CLAUDE.md ha sido actualizada para reflejar esta decisión como la tabla canónica vigente.

Véase también

  • [[decision—20260401—gemini-3-flash-preview]]
  • [[crearack—blueprints—auto-plan-ai]]
  • [[crearack—monitoring—cns-sentinel]]
  • [[feature—ai—eval-ai-models-framework]]