Volver a la wiki

Servicio llama-help: llama.cpp self-host para síntesis RAG (Gemma 4 E2B Q4_0)

Servicio llama-help

⚠️ SERVICIO DADO DE BAJA · s53 (08-05-2026)

Este servicio ya no existe. El servidor pve-epyc-02 fue wipe (NIST SP 800-88) + cancelado en Hetzner Robot. El Cloudflare Tunnel llama-help.crearack.com, el DNS CNAME y el secret LLAMA_HELP_API_KEY fueron eliminados.

El backend de síntesis del Help Widget vive ahora en Google AI Studio Paid Tier (gemma-4-26b-a4b-it). Ver [[decision—20260511—cleanup-openrouter-monoproveedor-google-genai]] y el ADR superseded [[decision—20260507—gemma4-e2b-self-host-synthesis]].

Página conservada como referencia histórica.


Servidor llama.cpp self-hosted que ejecutaba Gemma 4 E2B Q4_0 en LXC 100 de pve-epyc-02, expuesto públicamente como https://llama-help.crearack.com vía Cloudflare Tunnel. Fue el backend de síntesis del Help Widget de CreaRack Pro entre el 2026-05-07 y el 2026-05-08.

Propósito

Provee un endpoint OpenAI-compatible (/v1/chat/completions) que synthesizeAnswer en archivo-core.ts llama para generar respuestas RAG a preguntas de usuarios del Help Widget. Reemplaza Google AI Studio (Gemma 4 26B-A4B-IT) como backend de síntesis.

Infraestructura

CampoValor
HostLXC 100 en pve-epyc-02 (Proxmox, EPYC)
Puerto interno8081 (localhost only)
URL públicahttps://llama-help.crearack.com/v1/chat/completions
ExposiciónCloudflare Tunnel (cloudflared)
Systemd unitllama-server-e2b.service
ModeloGemma 4 E2B Q4_0 (unsloth/gemma-4-E2B-it-GGUF)
Threads16
Contexto16384 tokens
MultimodalNo (sin mmproj, text-only)

Parámetros de sampling (oficial Gemma 4)

{
  "temperature": 1.0,
  "top_p": 0.95,
  "top_k": 64,
  "max_tokens": 1024
}

Características clave

Rendimiento observado

Integración con el código

Variable de entorno (types.ts)

export interface Env {
  // ...
  LLAMA_HELP_API_KEY?: string;
  // ...
}

Guard en endpoints

// biblioteca/ask.ts y archivo.ts
if (!env.LLAMA_HELP_API_KEY) {
  return Response.json({ error: 'LLAMA_HELP_API_KEY not configured — synthesis unavailable' }, { status: 503 });
}

Llamada en archivo-core.ts

const LLAMA_HELP_URL = 'https://llama-help.crearack.com/v1/chat/completions';
export const SYNTHESIS_MODEL = 'gemma-4-E2B-it-Q4_0';

const res = await fetch(LLAMA_HELP_URL, {
  method: 'POST',
  headers: {
    'Content-Type': 'application/json',
    Authorization: `Bearer ${apiKey}`,
  },
  body: JSON.stringify({
    messages: [
      { role: 'system', content: systemPrompt },
      { role: 'user', content: userPrompt },
    ],
    max_tokens: 1024,
    temperature: 1.0,
    top_p: 0.95,
    top_k: 64,
  }),
});
const answer = data.choices?.[0]?.message?.content || 'Sin respuesta del modelo.';

Prompt del sistema

El systemPrompt enviado instruye al modelo con estilo coloquial específico para CreaRack Pro:

Disponibilidad y riesgos

Historial de cambios

FechaEvento
2026-05-07Creado. Reemplaza Google AI Studio como backend de síntesis (commit 8600d88).
2026-05-08 (s53)Dado de baja: pve-epyc-02 wipe NIST + cancelado en Hetzner Robot. Tunnel llama-help.crearack.com + DNS CNAME + LLAMA_HELP_API_KEY eliminados. Help Widget revertido a Google AI Studio Paid Tier (gemma-4-26b-a4b-it).

Véase también

Subir