Decisión pendiente: dimensionado del servidor self-host LLM (Help Widget)
⚠️ DECISIÓN ARCHIVADA · s53 (08-05-2026)
El status quo
pve-epyc-02ya no aplica: el servidor fue dado de baja (wipe NIST + cancelado en Hetzner Robot). Las 3 opciones de escalado planteadas (Hetzner CCX33, Ryzen 9 7950X, GPU dedicada) son irrelevantes — toda la inferencia AI corre ahora en Google AI Studio Paid Tier managed.Documento conservado como referencia histórica del análisis pre-baja.
Estado
Archivada (s53). El status quo pve-epyc-02 referenciado abajo ya no aplica.
Contexto
El Help Widget de CreaRack Pro usa un LLM self-hosted (Gemma 4 E2B Q4_0) servido mediante Ollama en pve-epyc-02 (LXC 100, puerto 8081, expuesto vía Cloudflare Tunnel en llama-help.crearack.com). La latencia actual de respuesta es ~15 s, considerada aceptable en fase de prueba.
CNS Explain (Auto-Plan) usa AI Studio paid tier y no consume pve-epyc-02.
Coste aproximado de pve-epyc-02: €80-100/mes.
Métricas reales medidas en s52 (07-05-2026)
Medidas durante una request bib_ask completa con modelo E2B Q4_0 en el servidor actual:
| Métrica | Valor |
|---|---|
| CPU utilizada | 32 cores al 100% (~11 s, pidstat 3200%) |
| RAM idle | 4,2 GB RSS |
| RAM pico durante inferencia | 4,3 GB (sin crecimiento significativo) |
| Throughput prompt | 361 tok/s |
| Throughput generación | 44 tok/s |
Insight clave: el modelo E2B Q4_0 está saturado en memoria-ancho de banda con 32 cores. Escalar a 64 cores en la misma arquitectura EPYC no aceleraría la inferencia de forma apreciable.
Opciones evaluadas
Opción 1 — Mantener pve-epyc-02 (status quo)
- Coste: €80-100/mes
- Latencia Help: ~15 s
- Ventaja estratégica: si en el futuro se decide self-hostar Auto-Plan visión (modelo multimodal grande), pve-epyc-02 justifica su coste por bandwidth y RAM disponibles. El EPYC tiene capacidad para modelos más grandes sin cambiar de servidor.
Opción 2a — Cancelar pve-epyc-02, Hetzner CCX33 dedicado
- Specs: 8 cores / 32 GB RAM
- Coste: ~€50/mes
- Latencia estimada: ~10-11 s
- Nota: sería exclusivo para Help Q&A; insuficiente si se quiere self-hostar modelos de visión.
Opción 2b — Cancelar pve-epyc-02, Server Auction Ryzen 9 7950X
- Specs: 16c/32t, 64 GB DDR5
- Coste: ~€60-80/mes
- Latencia estimada: ~7-8 s (mejor que EPYC para E2B Q4_0 por DDR5 bandwidth)
- Nota: buen equilibrio coste/latencia para Help solo; sin capacidad para modelos de visión grandes.
Opción 3 — Server con GPU
- Hardware de referencia: RTX 3060 o superior (Server Auction con GPU)
- Coste: ~€60-100/mes
- Latencia estimada: <3 s (GPU: 200+ tok/s con E2B Q4_0)
- Cumplimiento: GDPR EU (servidor en Europa)
- Ventaja: resuelve el problema de latencia de forma definitiva para Help; requiere soporte CUDA en el stack Ollama.
Documentación de soporte
memory/project_help_widget_self_host_e2b.md— arquitectura completa del setup actual.Documentation/guides/OLLAMA_SELF_HOSTED_AI.md— guía de evaluación y plan de producción (fase anterior).
Triggers para reactivar la decisión
Esta decisión se debe reactivar cuando ocurra cualquiera de estas condiciones:
- (a) Auto-Plan visión se decide self-hostar → entonces pve-epyc-02 se justifica económicamente.
- (b) La latencia de Help (~15 s) se convierte en un blocker UX → evaluar opción 2b o 3.
- (c) Cambio en el coste de pve-epyc-02 → renovación de Server Auction, cambio de plan, etc.
Véase también
- [[concept—cns—markdown-render-pattern]]
- [[feature—monitoring—cns-v1]]
- [[concept—saas—multi-tenancy]]