Comment installer en local un compagnon IA gratuit et sans censure (sans GPU)
Écrit par Clement

Vous voulez un compagnon IA entièrement privé qui suit tout ce que vous lui proposez, gratuit et illimité ? Vous êtes au bon endroit. Ce guide installe en une dizaine de minutes un modèle de chat 100 % local et sans censure sur votre propre machine, sans GPU.
Essayez maintenant !
C'est exactement ce que vous obtenez avec ce guide. Le serveur derrière cette démo est un vieux portable avec 8 Go de RAM.
Ce dont vous avez besoin
Il tourne sur CPU seul. Sur un portable avec seulement 8 Go de RAM, j'obtenais environ 10 tokens par seconde.
- Système
- Windows, Mac ou Linux
- GPU
- Aucun nécessaire. Tourne sur CPU seul.
- RAM
- Minimum 4 Go de RAM disponibles.
- Espace disque
- Ollama lui-même plus environ 3,3 Go pour le fichier du modèle
Scripts en un clic
Lancez Ollama et le modèle abliterated. Le script vous fait gagner du temps ; si vous préférez ne pas en exécuter, utilisez la carte « Le faire à la main ».
Script pour Windows
Installe Ollama, récupère le modèle et vérifie qu'il répond. Double-cliquez simplement sur le fichier téléchargé pour l'exécuter, aucune étape de clic droit.
Script pour Mac / Linux
Installe Ollama, récupère le modèle et vérifie qu'il répond. Après le téléchargement, ouvrez un terminal dans ce dossier et lancez : bash setup-local-uncensored-companion.sh
Bloqué quelque part dans ce guide ?
Un compagnon a besoin d'une personnalité par-dessus le modèle.
Vous pouvez tester le modèle tout de suite avec des commandes ollama. Mais le terminal oublie chaque message, et ce que vous avez installé est un modèle vierge, sans nom ni personnalité.
J'ai donc construit une petite page de chat pour vous. Elle tourne dans votre navigateur, parle directement à votre Ollama local et garde tout en local. Vous définissez une fois un nom, un avatar et une personnalité.
- 2
Télécharger la page de chat du compagnon
Un seul fichier HTML. Pas d'étape de build, pas de serveur, pas de compte. Une fois enregistré, vous pouvez l'ouvrir sans connexion internet.
Télécharger la page de chat du compagnon - 3
L'ouvrir dans votre navigateur
Double-cliquez sur le fichier enregistré. Il s'ouvre dans un onglet de navigateur normal, directement depuis votre disque, sur un écran de configuration : nom, URL de l'image d'avatar, prompt de personnalité.
- 4
Commencer à discuter
Cliquez sur Start chatting. La configuration de votre compagnon est enregistrée dans votre navigateur pour la prochaine fois.
En cas de problème
- La page de chat affiche « Ollama unreachable »
- Vérifiez qu'Ollama tourne en arrière-plan et que le champ d'URL du serveur correspond à l'adresse où il écoute (http://localhost:11434 par défaut)
- Les réponses ne se terminent jamais, CPU à 100 %
- Le mode réflexion est activé. La page de chat et les deux scripts le désactivent déjà ; dans une session ollama run brute, tapez d'abord /set nothink
Si vous avez un GPU : il existe un palier intermédiaire entre ceci et une API hébergée
Tout ce qui précède suppose le CPU seul, ce qui est volontairement le plus petit dénominateur commun : cela tourne sur un portable d'il y a dix ans. Si vous avez un GPU qui dort, un modèle local plus gros devient réaliste, et l'intérêt est le même que pour l'installation CPU, rien ne quitte votre machine, avec en plus une mémoire et une cohérence nettement meilleures dans une longue session de jeu de rôle que ce qu'un modèle 4B peut offrir.
Le modèle à viser ici est Qwen 3.8 27B, un cran au-dessus du 4B abliterated que ce guide installe par défaut. En quantification Q4_K_M (environ 14 Go), il tient sur un seul GPU grand public de 16 Go de VRAM avec 32 Go de RAM système, à environ 25 à 35 tokens par seconde. Passez à Q3_K_M (environ 12,5 à 13 Go) sur cette même carte de 16 Go et le débit monte à environ 41 tokens par seconde, avec un petit coût en qualité. Le faire tourner sur la RAM système plutôt que sur un GPU (les poids BF16 en pleine précision, environ 55 Go, qui exigent 64 Go ou plus de RAM) fait tomber le débit à environ 4 tokens par seconde, un goulot de bande passante qui le rend plus lent que l'installation 4B sur CPU seul ci-dessus au lieu d'en être une amélioration : ce modèle ne vaut donc la peine qu'avec un GPU sur lequel décharger.
Côté coût, faire tourner du Q3/Q4 sur une seule carte de classe RTX 3090/4090 à environ 250 W revient à environ 0,37 USD par million de tokens de sortie aux tarifs d'électricité résidentiels américains typiques, contre environ 3,00 USD par million de tokens de sortie sur un point d'accès cloud FP8 comparable à plus faible débit. Nous l'avons confirmé nous-mêmes dans une session de jeu de rôle sur la version abliterated, pas seulement sur le benchmark code/agentique où il avait été mesuré à l'origine : même vitesse par palier, même coût, rien dans l'usage en compagnon plutôt qu'en assistant de code ne change les chiffres.
Quand une API hébergée est plus pertinente que le local
Le local est le bon choix par défaut pour la confidentialité, et c'est la seule configuration où vous pouvez continuer à discuter hors ligne, sur CPU ou GPU. Mais ce n'est pas automatiquement la meilleure expérience. Même un modèle local accéléré par GPU plafonne en dessous de ce qu'on peut louer au token, et dans les longues conversations cet écart se voit : mémoire plus mince, réponses plus plates.
Choisissez le local quand la confidentialité est l'enjeu, quand vous voulez un coût de fonctionnement nul ou que cela doit marcher hors ligne. Choisissez une API hébergée quand vous voulez un modèle plus grand que ce que votre matériel peut contenir.
Savoir quels modèles hébergés autorisent le jeu de rôle sans censure est une question à part, nous avons donc rédigé quelles API hébergées autorisent réellement le jeu de rôle sans censure pour donner quelques pistes.
Questions fréquentes
- Pourquoi l'exécuter en local ?
- Rien de votre machine n'est transféré en ligne : vous pouvez couper internet et continuer à l'utiliser. C'est la seule façon d'obtenir une confidentialité totale.
- Pourquoi faut-il qu'il soit sans censure ?
- Tout modèle de base est entraîné à refuser certaines demandes. Une version sans censure (abliterated) a ce comportement de refus retiré des poids, pas contourné par le prompt. J'ai d'abord testé le même modèle de base sans abliteration et il a refusé tout net des choses que la version abliterated gère sans problème. Cela reste un modèle de chat généraliste, pas un outil pour générer des médias explicites.
- Est-ce privé pour de bon ?
- Oui. Une fois le modèle téléchargé, rien n'est envoyé nulle part. Il tourne comme un processus local et la page de chat lui parle via l'adresse de bouclage de votre propre machine.
- Pourquoi proposer votre propre page de chat plutôt que l'installation Ollama brute ?
- L'installation brute vous donne un modèle vierge sans personnage. La page de chat ajoute par-dessus un nom, un avatar et un prompt de personnalité persistant, vous avez donc un vrai compagnon au lieu de tout refaire dans le terminal à chaque fois.
Continuer la lecture

Comment installer un modèle d'images NSFW en local : tutoriel complet
Installez un workflow de génération d'images pour adultes sur un GPU cloud loué : RunPod, ComfyUI, un vrai fichier de workflow, et chaque étape entre les deux, capture d'écran par capture d'écran.

Comment faire tourner MiniMax H3 en local dans ComfyUI
Installez MiniMax H3 dans ComfyUI : les bons fichiers FP8/INT8 pour votre GPU, la restriction de licence à vérifier d'abord, et les trois workflows, étape par étape.

What is a LoRA and when do you need one
A plain-language explanation of LoRAs for AI image generation: what they add to a base model, why they only work on open-weight models, and what weight to load one at.
Recevez les nouveaux guides par email
Un email quand nous publions de nouveaux guides et analyses de modèles. Pas de spam, désinscription à tout moment.
