Cómo configurar en local un compañero de IA gratuito y sin censura (sin GPU)
Escrito por Clement

¿Quieres un compañero de IA totalmente privado que te siga el juego en lo que le propongas, gratis e ilimitado? Estás en la guía correcta. Esta instala en unos diez minutos un modelo de chat 100 % local y sin censura en tu propio equipo, sin necesidad de GPU.
¡Pruébalo ahora!
Esto es exactamente lo que obtienes con esta guía. El servidor detrás de esta demo es un portátil viejo con 8 GB de RAM.
Lo que necesitas
Funciona solo con CPU. En un portátil con apenas 8 GB de RAM conseguí unos 10 tokens por segundo.
- Sistema operativo
- Windows, Mac o Linux
- GPU
- No hace falta. Funciona solo con CPU.
- RAM
- Mínimo 4 GB de RAM disponibles.
- Espacio en disco
- El propio Ollama más unos 3,3 GB para el archivo del modelo
Scripts de un clic
Pon en marcha Ollama y el modelo abliterated. El script te ahorra tiempo; si prefieres no ejecutar uno, usa la tarjeta "Hazlo a mano".
Script para Windows
Instala Ollama, descarga el modelo y comprueba que responde. Basta con hacer doble clic en el archivo descargado para ejecutarlo, sin pasos de clic derecho.
Script para Mac / Linux
Instala Ollama, descarga el modelo y comprueba que responde. Tras descargarlo, abre una terminal en esa carpeta y ejecuta: bash setup-local-uncensored-companion.sh
¿Atascado en algún punto de esta guía?
Un compañero necesita una personalidad encima del modelo.
Puedes probar el modelo ahora mismo con comandos de ollama. Pero la terminal olvida cada mensaje, y lo que instalaste es un modelo en blanco, sin nombre ni personalidad.
Así que te preparé una pequeña página de chat. Se ejecuta en tu navegador, habla directamente con tu Ollama local y lo mantiene todo en local. Defines una sola vez un nombre, un avatar y una personalidad.
- 2
Descarga la página de chat del compañero
Un único archivo HTML. Sin paso de compilación, sin servidor, sin cuenta. Una vez guardado, puedes abrirlo sin internet.
Descargar la página de chat del compañero - 3
Ábrela en tu navegador
Haz doble clic en el archivo guardado. Se abre en una pestaña normal del navegador, directamente desde tu disco, en una pantalla de configuración: nombre, URL de la imagen del avatar, prompt de personalidad.
- 4
Empieza a chatear
Pulsa Start chatting. La configuración de tu compañero se guarda en tu navegador para la próxima vez.
Si algo falla
- La página de chat dice "Ollama unreachable"
- Asegúrate de que Ollama se esté ejecutando en segundo plano y de que el campo de URL del servidor coincida con donde escucha (http://localhost:11434 por defecto)
- Las respuestas nunca terminan, CPU al 100 %
- El modo de razonamiento está activado. La página de chat y los dos scripts ya lo desactivan; en una sesión ollama run sin más, escribe /set nothink primero
Si tienes GPU: hay un nivel intermedio entre esto y una API alojada
Todo lo anterior supone solo CPU, que es deliberadamente el mínimo común denominador: funciona en un portátil de hace diez años. Si tienes una GPU parada, un modelo local más grande se vuelve realista, y el atractivo es el mismo que el de la configuración con CPU, nada sale de tu equipo, y encima tienes una memoria y una coherencia claramente mejores en una sesión larga de rol de lo que puede dar un modelo de 4B.
El modelo al que apuntar aquí es Qwen 3.8 27B, un escalón por encima del 4B abliterated que esta guía instala por defecto. Con cuantización Q4_K_M (unos 14 GB) cabe en una sola GPU de consumo de 16 GB de VRAM junto a 32 GB de RAM del sistema, y rinde unos 25 a 35 tokens por segundo. Si pasas a Q3_K_M (unos 12,5 a 13 GB) en esa misma tarjeta de 16 GB, el rendimiento sube a unos 41 tokens por segundo, con un pequeño coste en calidad. Ejecutarlo en la RAM del sistema en vez de en una GPU (los pesos BF16 de precisión completa, unos 55 GB, que necesitan 64 GB o más de RAM) baja el rendimiento a unos 4 tokens por segundo, un cuello de botella de ancho de banda que lo hace más lento que la configuración de 4B solo con CPU de arriba en vez de una mejora sobre ella, así que este modelo solo merece la pena con una GPU a la que descargar trabajo.
En cuanto al coste, ejecutar Q3/Q4 en una sola tarjeta de clase RTX 3090/4090 a unos 250 W supone unos 0,37 USD por millón de tokens de salida con tarifas eléctricas residenciales típicas de EE. UU., frente a unos 3,00 USD por millón de tokens de salida en un endpoint cloud FP8 comparable con menor rendimiento. Lo confirmamos nosotros mismos en una sesión de rol con la versión abliterated, y no únicamente en el benchmark de programación/agentes en el que se midió al principio: misma velocidad por nivel, mismo coste, y usarlo como compañero en lugar de como asistente de código no cambia las cifras.
Cuándo tiene más sentido una API alojada que lo local
Lo local es la opción por defecto correcta para la privacidad, y es la única configuración con la que puedes seguir chateando sin conexión, con CPU o GPU. Pero no es automáticamente la mejor experiencia. Incluso un modelo local acelerado por GPU se queda por debajo de lo que puedes alquilar por token, y en conversaciones largas esa diferencia se nota en una memoria más escasa y respuestas más planas.
Elige lo local cuando la privacidad es lo importante, cuando quieres coste de funcionamiento cero o cuando quieres que funcione sin conexión. Elige una API alojada cuando quieras un modelo más grande de lo que cabe en tu propio hardware.
Qué modelos alojados permiten rol sin censura es una cuestión aparte, así que escribimos qué APIs alojadas permiten de verdad el rol sin censura para dar algunas soluciones.
Preguntas frecuentes
- ¿Por qué ejecutarlo en local?
- Nada de tu equipo se transfiere a internet, así que puedes cortar la conexión y seguir usándolo. Es la única forma de tener privacidad total.
- ¿Por qué tiene que ser sin censura?
- Todo modelo base se entrena para rechazar ciertas peticiones. A una versión sin censura (abliterated) se le ha quitado ese comportamiento de rechazo de los pesos, no se rodea con el prompt. Probé primero el mismo modelo base sin abliteration y rechazó de plano cosas que la versión abliterated maneja sin problema. Sigue siendo un modelo de chat general, no una herramienta para generar contenido explícito.
- ¿Es privado de verdad?
- Sí. Una vez descargado el modelo, no se envía nada a ningún sitio. Se ejecuta como un proceso local y la página de chat habla con él a través de la dirección de bucle local de tu propio equipo.
- ¿Por qué enseñar tu propia página de chat en lugar de la instalación básica de Ollama?
- La instalación básica te da un modelo en blanco sin personaje. La página de chat añade encima un nombre, un avatar y un prompt de personalidad persistente, así que tienes un compañero de verdad en lugar de rehacerlo en la terminal cada vez.
Seguir leyendo

Cómo instalar un modelo de imágenes NSFW en local: tutorial completo
Instala un flujo de trabajo de generación de imágenes para adultos en una GPU de la nube alquilada: RunPod, ComfyUI, un archivo de workflow real y cada paso intermedio, captura por captura.

Cómo ejecutar MiniMax H3 en local con ComfyUI
Instala MiniMax H3 en ComfyUI: los archivos FP8/INT8 adecuados para tu GPU, la restricción de licencia que debes revisar primero y los tres workflows, paso a paso.

What is a LoRA and when do you need one
A plain-language explanation of LoRAs for AI image generation: what they add to a base model, why they only work on open-weight models, and what weight to load one at.
Recibe las nuevas guías por email
Un email cuando publicamos nuevas guías y análisis de modelos. Sin spam, cancela cuando quieras.
