Pregunta
¿Qué página wiki existe sobre Gemma 4 thinking, hybrid thinking, llama-server o la configuración del servidor LLM self-hosted?
Respuesta
Basado en la documentación proporcionada, no existe ninguna página wiki que mencione específicamente los términos “Gemma 4 thinking” o “hybrid thinking”, ni tampoco se menciona “llama-server”.
Sin embargo, existe documentación detallada sobre la configuración del servidor LLM self-hosted (utilizando Ollama y vLLM) en el siguiente archivo:
Documentation/guides/OLLAMA_SELF_HOSTED_AI.md[1]
Esta guía contiene información técnica relevante sobre la implementación de un servidor de IA propio, incluyendo:
- Configuración de Ollama: Instrucciones para instalarlo, descargar el modelo
gemma4y crear perfiles optimizados con parámetros específicos comonum_ctx(contexto) ynum_thread(hilos) [1]. - Configuración del entorno (
.env): Cómo cambiar los proveedores de IA (AUTOPLAN_PROVIDERyEDGE_AI_PROVIDER) de Gemini a Ollama [1, 6]. - Análisis de rendimiento y costes: Comparativas de tiempos de respuesta entre CPU y servidores EPYC, así como el punto de equilibrio (breakeven) económico al escalar de Gemini a un servidor propio (7 clientes) [2].
- Plan de producción (Fase 2): La transición de Ollama a vLLM para entornos de producción, detallando ventajas como el continuous batching y la utilización óptima de la GPU [5].
- Arquitectura de red: Recomendaciones para conectar el servidor de aplicaciones con el nuevo servidor de IA mediante una red privada de Hetzner para minimizar la latencia [5].
Notas del archivador
Esta página fue archivada automáticamente por el Bibliotecario tras una consulta bib_ask. Estado draft hasta revisión humana. El Curator diario la revisará; usa /wiki-promote para pasarla a active o /wiki-delete para descartarla.