Volver a la wiki

AI Eval Panel — Herramienta de evaluación comparativa de modelos LLM

Descripción

AiEvalPanel es una herramienta del workspace de CreaRack Pro que permite evaluar y comparar modelos de lenguaje (LLM) de múltiples proveedores de forma simultánea. El panel ejecuta un conjunto de prompts/casos contra una matriz de modelos y presenta métricas de latencia, uso de tokens y coste estimado.

Ubicación en el código: src/components/tools/AiEvalPanel.tsx


Funcionalidades principales

Matriz de evaluación

Botón Reset (commit 484feb7)

Añadido al lado del botón Run. Limpia el estado completo del panel:

Multi-expand de respuestas (commit 484feb7)

El estado expanded pasó de string | null a Set<string>, permitiendo abrir varias respuestas simultáneamente en la tabla de resultados para compararlas lado a lado visualmente.

Sección Análisis — RunSummary (commit 484feb7)

Componente nuevo renderizado tras la tabla de resultados. Incluye:

Cards globales (4)

CardDescripción
Celdas OKok / (ok + err)
Latencia totalSuma en segundos, promedio ms/celda como hint
Coste estimadoTotal USD con precios orientativos MODEL_PRICING
Más rápidoModelo con menor latencia promedio

Tabla por modelo

Columnas: Modelo · Latencia prom · Tokens (in/out) · Coste · OK/Total.
Badges inline: más rápido (accent) y más barato (success), mutuamente excluyentes cuando coinciden en el mismo modelo.

Comparativa pareja — PairComparison

Solo se renderiza cuando hay exactamente 2 modelos en el run. Calcula:


Tabla de precios orientativos (MODEL_PRICING)

Estos valores son referencia. Actualizar cuando los proveedores cambien tarifas.

ModeloUSD/1M tokens inUSD/1M tokens out
gemini-3-flash-preview$0.50$3.00
gemini-3.1-flash-lite-preview$0.25$1.50
gemini-2.5-flash$0.30$2.50
qwen/qwen-2.5-72b-instruct$0.13$0.40
anthropic/claude-haiku-4.5$1.00$5.00
meta-llama/llama-3.3-70b-instruct$0.13$0.40

La función cellCostUsd(cell, model) calcula el coste de una celda individual:

coste = (tokens_in × precio_in + tokens_out × precio_out) / 1_000_000

API relacionada

El panel consume los siguientes endpoints:

EndpointUso
GET /api/tools/ai-eval/historyListado de runs pasados
GET /api/tools/ai-eval/history?id=<n>Detalle de un run
(endpoint run)Ejecución de la matriz de eval

Arquitectura de componentes

AiEvalPanel (default export)
├── ResultsMatrix          — tabla de resultados con multi-expand
│   └── toggle(key)        — añade/quita key del Set<string> expanded
└── RunSummary             — sección de análisis post-run
    ├── SummaryCard        — card genérica con label/value/hint
    └── PairComparison     — comparativa entre 2 modelos exactamente

Historial de cambios relevantes

FechaCommitCambio
2026-04-27484feb7Botón Reset, multi-expand (Set<string>), sección Análisis con RunSummary, MODEL_PRICING embedding, PairComparison (+273/-17 LOC)

Véase también

Subir