CreaRack-SL

Decisión pendiente: dimensionado del servidor self-host LLM (Help Widget)

⚠️ DECISIÓN ARCHIVADA · s53 (08-05-2026)

El status quo pve-epyc-02 ya no aplica: el servidor fue dado de baja (wipe NIST + cancelado en Hetzner Robot). Las 3 opciones de escalado planteadas (Hetzner CCX33, Ryzen 9 7950X, GPU dedicada) son irrelevantes — toda la inferencia AI corre ahora en Google AI Studio Paid Tier managed.

Documento conservado como referencia histórica del análisis pre-baja.


Estado

Archivada (s53). El status quo pve-epyc-02 referenciado abajo ya no aplica.


Contexto

El Help Widget de CreaRack Pro usa un LLM self-hosted (Gemma 4 E2B Q4_0) servido mediante Ollama en pve-epyc-02 (LXC 100, puerto 8081, expuesto vía Cloudflare Tunnel en llama-help.crearack.com). La latencia actual de respuesta es ~15 s, considerada aceptable en fase de prueba.

CNS Explain (Auto-Plan) usa AI Studio paid tier y no consume pve-epyc-02.

Coste aproximado de pve-epyc-02: €80-100/mes.


Métricas reales medidas en s52 (07-05-2026)

Medidas durante una request bib_ask completa con modelo E2B Q4_0 en el servidor actual:

MétricaValor
CPU utilizada32 cores al 100% (~11 s, pidstat 3200%)
RAM idle4,2 GB RSS
RAM pico durante inferencia4,3 GB (sin crecimiento significativo)
Throughput prompt361 tok/s
Throughput generación44 tok/s

Insight clave: el modelo E2B Q4_0 está saturado en memoria-ancho de banda con 32 cores. Escalar a 64 cores en la misma arquitectura EPYC no aceleraría la inferencia de forma apreciable.


Opciones evaluadas

Opción 1 — Mantener pve-epyc-02 (status quo)

  • Coste: €80-100/mes
  • Latencia Help: ~15 s
  • Ventaja estratégica: si en el futuro se decide self-hostar Auto-Plan visión (modelo multimodal grande), pve-epyc-02 justifica su coste por bandwidth y RAM disponibles. El EPYC tiene capacidad para modelos más grandes sin cambiar de servidor.

Opción 2a — Cancelar pve-epyc-02, Hetzner CCX33 dedicado

  • Specs: 8 cores / 32 GB RAM
  • Coste: ~€50/mes
  • Latencia estimada: ~10-11 s
  • Nota: sería exclusivo para Help Q&A; insuficiente si se quiere self-hostar modelos de visión.

Opción 2b — Cancelar pve-epyc-02, Server Auction Ryzen 9 7950X

  • Specs: 16c/32t, 64 GB DDR5
  • Coste: ~€60-80/mes
  • Latencia estimada: ~7-8 s (mejor que EPYC para E2B Q4_0 por DDR5 bandwidth)
  • Nota: buen equilibrio coste/latencia para Help solo; sin capacidad para modelos de visión grandes.

Opción 3 — Server con GPU

  • Hardware de referencia: RTX 3060 o superior (Server Auction con GPU)
  • Coste: ~€60-100/mes
  • Latencia estimada: <3 s (GPU: 200+ tok/s con E2B Q4_0)
  • Cumplimiento: GDPR EU (servidor en Europa)
  • Ventaja: resuelve el problema de latencia de forma definitiva para Help; requiere soporte CUDA en el stack Ollama.

Documentación de soporte

  • memory/project_help_widget_self_host_e2b.md — arquitectura completa del setup actual.
  • Documentation/guides/OLLAMA_SELF_HOSTED_AI.md — guía de evaluación y plan de producción (fase anterior).

Triggers para reactivar la decisión

Esta decisión se debe reactivar cuando ocurra cualquiera de estas condiciones:

  1. (a) Auto-Plan visión se decide self-hostar → entonces pve-epyc-02 se justifica económicamente.
  2. (b) La latencia de Help (~15 s) se convierte en un blocker UX → evaluar opción 2b o 3.
  3. (c) Cambio en el coste de pve-epyc-02 → renovación de Server Auction, cambio de plan, etc.

Véase también

  • [[concept—cns—markdown-render-pattern]]
  • [[feature—monitoring—cns-v1]]
  • [[concept—saas—multi-tenancy]]