Volver a la wiki

Llama interno · cómo usar nuestro chat AI privado

Llama interno · cómo usar nuestro chat AI privado

Para: Todo el equipo (Edu, Dani, Txell) Requisito: Tener Tailscale instalado y logueado con CreaRackSL@ Coste: 0 € por mensaje (servidor pagado mensual fijo)


¿Qué es esto?

Tenemos un servidor Hetzner solo para nosotros con un modelo IA grande corriendo dentro: Gemma 4 26B (26 mil millones de parámetros, con visión). Es comparable en calidad a GPT-4o-mini para muchos usos, completamente nuestro y sin enviar nada a terceros.

Lo usamos en producción para Auto-Plan (cuando subes un plano a CreaRack y la IA detecta los racks). Pero también puedes hablar con él directamente como con ChatGPT, sin pagar por mensaje y sin que tus conversaciones salgan de Hetzner.


Cómo abrir el chat

  1. Asegúrate que Tailscale está corriendo en tu equipo y estás logueado con la cuenta CreaRackSL@. En la barra de tareas debe aparecer el icono de Tailscale en activo.

  2. Abre cualquier navegador moderno (Chrome, Firefox, Edge) y entra a:

    http://crearack-llama-epyc-02:8080
  3. Si por lo que sea ese nombre no resuelve (le pasa a algún Windows con DNS rancio), usa la IP directa:

    http://100.80.142.60:8080

Lo verás abrir un chat tipo ChatGPT casi al momento.


Cómo se chatea

Igual que en ChatGPT. Escribes abajo, le das a Enter o al botón de enviar, y te responde.

El historial se guarda en tu propio navegador (localStorage). Si cambias de PC o vacías la caché, las conversaciones desaparecen — son solo locales tuyas, no se sincronizan con ningún servidor central.

Cada conversación nueva la creas con el botón de ”+” o similar arriba a la izquierda.


Casos de uso prácticos

Resumir documentos largos

Pegas el texto y le pides “resúmeme esto en bullet points”. Aguanta hasta unos 16 mil tokens de contexto (~12 000 palabras). Para textos más largos, trocéalos.

Traducir entre idiomas

Habla bien español, inglés, catalán, francés, alemán. Italiano y portugués se le dan razonable.

Redactar emails / textos formales

Le das el contexto + a quién va dirigido + el tono que quieres (“formal”, “directo”, “amigable”) y te lo escribe. Después editas a tu gusto.

Reescribir notas técnicas en lenguaje claro

Útil para cuando tienes que mandar algo técnico a un cliente no técnico.

Explicar errores de software

Pegas el log o el mensaje de error y pregúntale qué significa y cómo se arregla.

Lluvia de ideas

“Dame 10 ideas para X”. Sale un listado decente al primer intento.

Subir imágenes (multimodal)

¡Importante! Este modelo lee imágenes. Arrastra una imagen al chat o pulsa el botón de adjuntar. Útil para:

Puede tardar más cuando hay imagen (procesar la imagen lleva ~15-20 segundos con planos densos, menos con imágenes simples).


Trucos de configuración

Arriba a la derecha hay un botón de ajustes (⚙ o similar). Las opciones que más afectan:


Limitaciones que vas a notar


Cuándo NO usarlo


Si va lento, no responde, o algo falla

  1. Comprueba que Tailscale está activo en tu equipo (icono en tray).
  2. Refresca la página del chat.
  3. Si sigue fallando, pregunta a Edu o Dani — probablemente el servicio se reinició por alguna actualización y vuelve solo en 1 minuto.

Para usuarios técnicos: la guía con detalles de infra y troubleshooting está en [[crearack-tech—admin—llama-server-runbook]].


Privacidad — qué hace y qué no hace nuestro llama


Para la cabeza: qué pone “bajo el capó”

El servidor es un AMD EPYC de 32 cores con 256 GB de RAM. El modelo (16 GB en disco) se carga entero en RAM al arrancar. Cada respuesta requiere leer todo el modelo desde RAM mientras genera tokens — por eso el cuello de botella es el ancho de banda de RAM, no la CPU. Por eso elegimos un servidor con 8 módulos de RAM en lugar de 4.

Si quieres saber más, lee [[crearack-tech—admin—proxmox-epyc-setup]] (técnico).


Véase también

Subir