CreaRack-SL

Llama interno · cómo usar nuestro chat AI privado

Conceptoarchivedverificado 2026-05-01#workspace#guias#llama#ai#chat#gemma4#internal-tool

Llama interno · cómo usar nuestro chat AI privado

Para: Todo el equipo (Edu, Dani, Txell) Requisito: Tener Tailscale instalado y logueado con CreaRackSL@ Coste: 0 € por mensaje (servidor pagado mensual fijo)


¿Qué es esto?

Tenemos un servidor Hetzner solo para nosotros con un modelo IA grande corriendo dentro: Gemma 4 26B (26 mil millones de parámetros, con visión). Es comparable en calidad a GPT-4o-mini para muchos usos, completamente nuestro y sin enviar nada a terceros.

Lo usamos en producción para Auto-Plan (cuando subes un plano a CreaRack y la IA detecta los racks). Pero también puedes hablar con él directamente como con ChatGPT, sin pagar por mensaje y sin que tus conversaciones salgan de Hetzner.


Cómo abrir el chat

  1. Asegúrate que Tailscale está corriendo en tu equipo y estás logueado con la cuenta CreaRackSL@. En la barra de tareas debe aparecer el icono de Tailscale en activo.

  2. Abre cualquier navegador moderno (Chrome, Firefox, Edge) y entra a:

    http://crearack-llama-epyc-02:8080
  3. Si por lo que sea ese nombre no resuelve (le pasa a algún Windows con DNS rancio), usa la IP directa:

    http://100.80.142.60:8080

Lo verás abrir un chat tipo ChatGPT casi al momento.


Cómo se chatea

Igual que en ChatGPT. Escribes abajo, le das a Enter o al botón de enviar, y te responde.

El historial se guarda en tu propio navegador (localStorage). Si cambias de PC o vacías la caché, las conversaciones desaparecen — son solo locales tuyas, no se sincronizan con ningún servidor central.

Cada conversación nueva la creas con el botón de ”+” o similar arriba a la izquierda.


Casos de uso prácticos

Resumir documentos largos

Pegas el texto y le pides “resúmeme esto en bullet points”. Aguanta hasta unos 16 mil tokens de contexto (~12 000 palabras). Para textos más largos, trocéalos.

Traducir entre idiomas

Habla bien español, inglés, catalán, francés, alemán. Italiano y portugués se le dan razonable.

Redactar emails / textos formales

Le das el contexto + a quién va dirigido + el tono que quieres (“formal”, “directo”, “amigable”) y te lo escribe. Después editas a tu gusto.

Reescribir notas técnicas en lenguaje claro

Útil para cuando tienes que mandar algo técnico a un cliente no técnico.

Explicar errores de software

Pegas el log o el mensaje de error y pregúntale qué significa y cómo se arregla.

Lluvia de ideas

“Dame 10 ideas para X”. Sale un listado decente al primer intento.

Subir imágenes (multimodal)

¡Importante! Este modelo lee imágenes. Arrastra una imagen al chat o pulsa el botón de adjuntar. Útil para:

  • Pasar un screenshot de un dashboard y pedir que te lo explique.
  • Pasarle un plano y preguntarle qué ve.
  • Pasarle una foto de un dispositivo y pedirle que identifique modelo y conexiones.
  • Pasarle un dibujo a mano y pedir que te lo formalice.

Puede tardar más cuando hay imagen (procesar la imagen lleva ~15-20 segundos con planos densos, menos con imágenes simples).


Trucos de configuración

Arriba a la derecha hay un botón de ajustes (⚙ o similar). Las opciones que más afectan:

  • Temperature: 0 = respuestas muy deterministas, repetitivas si haces la misma pregunta. 1 = respuestas más creativas, varía cada vez. Para uso “asistente productivo” prueba 0.3-0.7.
  • Max tokens: cuántos tokens (≈ palabras) puede escribir como máximo. Si te corta respuestas largas, súbelo.
  • System prompt: el “rol” que le das al modelo al inicio. Por defecto está en blanco. Si quieres, le puedes meter “Eres un asistente que responde siempre breve, en bullets, en español” y se comportará así toda la conversación.
  • Top_k / Top_p / Min_p: parámetros de muestreo. Si no sabes lo que son, no los toques.

Limitaciones que vas a notar

  • Conocimiento del mundo cortado en algún punto del entrenamiento (probablemente principios 2025). No conoce noticias recientes ni cambios de software después.
  • No tiene acceso a internet. No puede buscar cosas en Google ni leer URLs. Si le pegas el texto sí lo procesa.
  • Está en un servidor de Alemania (Hetzner). Latencia de unos milisegundos desde España, imperceptible.
  • Velocidad de respuesta: mucho más lenta que ChatGPT online. Una respuesta de párrafo tarda 5-15 segundos. Una respuesta larga (lista de 50 cosas) puede tardar 1-2 minutos. Es lo que tiene self-hosting en CPU.
  • Calidad ~70 % del nivel ChatGPT-4o en tareas complejas; equivalente o mejor en cosas simples (resumen, traducción, redacción).
  • Multimodal limitado: ve imágenes pero a baja resolución internamente. Para detalles muy pequeños (texto en planos de 70 racks, números en gráficos densos) le cuesta.

Cuándo NO usarlo

  • Cosas con datos privados de clientes que no debas usar para inferencia (chequeo legal/RGPD del cliente concreto).
  • Cosas que requieren conocimiento muy reciente o real-time (precios actuales, noticias, etc.).
  • Cosas críticas que requieren 100 % precisión sin fallo (lo mismo que ChatGPT — siempre verificar).

Si va lento, no responde, o algo falla

  1. Comprueba que Tailscale está activo en tu equipo (icono en tray).
  2. Refresca la página del chat.
  3. Si sigue fallando, pregunta a Edu o Dani — probablemente el servicio se reinició por alguna actualización y vuelve solo en 1 minuto.

Para usuarios técnicos: la guía con detalles de infra y troubleshooting está en [[crearack-tech—admin—llama-server-runbook]].


Privacidad — qué hace y qué no hace nuestro llama

  • Sí guarda tu conversación en tu navegador, en localStorage. Si quieres borrarla: F12 → Application → Local Storage → eliminar entradas. O simplemente vacía la caché del sitio.
  • No envía las conversaciones a ningún servidor central. La conversación nunca sale del cifrado WireGuard de Tailscale entre tu equipo y Hetzner.
  • No registra logs detallados de qué preguntas hacéis. El servidor solo loga métricas de rendimiento (tokens/segundo, duración) — no el contenido de los prompts ni respuestas.
  • No entrena con vuestros datos. Es un modelo congelado descargado, no aprende de vosotros.

Para la cabeza: qué pone “bajo el capó”

El servidor es un AMD EPYC de 32 cores con 256 GB de RAM. El modelo (16 GB en disco) se carga entero en RAM al arrancar. Cada respuesta requiere leer todo el modelo desde RAM mientras genera tokens — por eso el cuello de botella es el ancho de banda de RAM, no la CPU. Por eso elegimos un servidor con 8 módulos de RAM en lugar de 4.

Si quieres saber más, lee [[crearack-tech—admin—proxmox-epyc-setup]] (técnico).


Véase también

  • [[workspace—que-es-workspace]] — qué es el workspace en general
  • [[workspace—agentes-ia]] — agentes IA disponibles para el equipo (Claude, ChatGPT, Gemini, este Llama)
  • [[crearack-tech—admin—llama-server-runbook]] — guía técnica del llama-server
  • [[crearack-tech—admin—proxmox-epyc-setup]] — el servidor que lo aloja