Aller au contenu
GenLovers

Comment installer en local un compagnon IA gratuit et sans censure (sans GPU)

Dernière mise à jour: 6 min de lectureDifficulté: Accessible aux débutants

Écrit par Clement

Une image promotionnelle portant le texte NO GPU et NSFW à côté d'un portrait stylisé, pour un guide d'installation d'un compagnon IA local gratuit et sans censure.

Vous voulez un compagnon IA entièrement privé qui suit tout ce que vous lui proposez, gratuit et illimité ? Vous êtes au bon endroit. Ce guide installe en une dizaine de minutes un modèle de chat 100 % local et sans censure sur votre propre machine, sans GPU.

Essayez maintenant !

C'est exactement ce que vous obtenez avec ce guide. Le serveur derrière cette démo est un vieux portable avec 8 Go de RAM.

Ce dont vous avez besoin

Il tourne sur CPU seul. Sur un portable avec seulement 8 Go de RAM, j'obtenais environ 10 tokens par seconde.

Système
Windows, Mac ou Linux
GPU
Aucun nécessaire. Tourne sur CPU seul.
RAM
Minimum 4 Go de RAM disponibles.
Espace disque
Ollama lui-même plus environ 3,3 Go pour le fichier du modèle
Le tutoriel complet, détaillé étape par étape plus bas. Watch on YouTube
1

Scripts en un clic

Lancez Ollama et le modèle abliterated. Le script vous fait gagner du temps ; si vous préférez ne pas en exécuter, utilisez la carte « Le faire à la main ».

Bloqué quelque part dans ce guide ?

Un compagnon a besoin d'une personnalité par-dessus le modèle.

Vous pouvez tester le modèle tout de suite avec des commandes ollama. Mais le terminal oublie chaque message, et ce que vous avez installé est un modèle vierge, sans nom ni personnalité.

J'ai donc construit une petite page de chat pour vous. Elle tourne dans votre navigateur, parle directement à votre Ollama local et garde tout en local. Vous définissez une fois un nom, un avatar et une personnalité.

  1. 2

    Télécharger la page de chat du compagnon

    Un seul fichier HTML. Pas d'étape de build, pas de serveur, pas de compte. Une fois enregistré, vous pouvez l'ouvrir sans connexion internet.

    Télécharger la page de chat du compagnon
  2. 3

    L'ouvrir dans votre navigateur

    Double-cliquez sur le fichier enregistré. Il s'ouvre dans un onglet de navigateur normal, directement depuis votre disque, sur un écran de configuration : nom, URL de l'image d'avatar, prompt de personnalité.

  3. 4

    Commencer à discuter

    Cliquez sur Start chatting. La configuration de votre compagnon est enregistrée dans votre navigateur pour la prochaine fois.

En cas de problème

La page de chat affiche « Ollama unreachable »
Vérifiez qu'Ollama tourne en arrière-plan et que le champ d'URL du serveur correspond à l'adresse où il écoute (http://localhost:11434 par défaut)
Les réponses ne se terminent jamais, CPU à 100 %
Le mode réflexion est activé. La page de chat et les deux scripts le désactivent déjà ; dans une session ollama run brute, tapez d'abord /set nothink

Si vous avez un GPU : il existe un palier intermédiaire entre ceci et une API hébergée

Tout ce qui précède suppose le CPU seul, ce qui est volontairement le plus petit dénominateur commun : cela tourne sur un portable d'il y a dix ans. Si vous avez un GPU qui dort, un modèle local plus gros devient réaliste, et l'intérêt est le même que pour l'installation CPU, rien ne quitte votre machine, avec en plus une mémoire et une cohérence nettement meilleures dans une longue session de jeu de rôle que ce qu'un modèle 4B peut offrir.

Le modèle à viser ici est Qwen 3.8 27B, un cran au-dessus du 4B abliterated que ce guide installe par défaut. En quantification Q4_K_M (environ 14 Go), il tient sur un seul GPU grand public de 16 Go de VRAM avec 32 Go de RAM système, à environ 25 à 35 tokens par seconde. Passez à Q3_K_M (environ 12,5 à 13 Go) sur cette même carte de 16 Go et le débit monte à environ 41 tokens par seconde, avec un petit coût en qualité. Le faire tourner sur la RAM système plutôt que sur un GPU (les poids BF16 en pleine précision, environ 55 Go, qui exigent 64 Go ou plus de RAM) fait tomber le débit à environ 4 tokens par seconde, un goulot de bande passante qui le rend plus lent que l'installation 4B sur CPU seul ci-dessus au lieu d'en être une amélioration : ce modèle ne vaut donc la peine qu'avec un GPU sur lequel décharger.

Côté coût, faire tourner du Q3/Q4 sur une seule carte de classe RTX 3090/4090 à environ 250 W revient à environ 0,37 USD par million de tokens de sortie aux tarifs d'électricité résidentiels américains typiques, contre environ 3,00 USD par million de tokens de sortie sur un point d'accès cloud FP8 comparable à plus faible débit. Nous l'avons confirmé nous-mêmes dans une session de jeu de rôle sur la version abliterated, pas seulement sur le benchmark code/agentique où il avait été mesuré à l'origine : même vitesse par palier, même coût, rien dans l'usage en compagnon plutôt qu'en assistant de code ne change les chiffres.

Quand une API hébergée est plus pertinente que le local

Le local est le bon choix par défaut pour la confidentialité, et c'est la seule configuration où vous pouvez continuer à discuter hors ligne, sur CPU ou GPU. Mais ce n'est pas automatiquement la meilleure expérience. Même un modèle local accéléré par GPU plafonne en dessous de ce qu'on peut louer au token, et dans les longues conversations cet écart se voit : mémoire plus mince, réponses plus plates.

Choisissez le local quand la confidentialité est l'enjeu, quand vous voulez un coût de fonctionnement nul ou que cela doit marcher hors ligne. Choisissez une API hébergée quand vous voulez un modèle plus grand que ce que votre matériel peut contenir.

Savoir quels modèles hébergés autorisent le jeu de rôle sans censure est une question à part, nous avons donc rédigé quelles API hébergées autorisent réellement le jeu de rôle sans censure pour donner quelques pistes.

Questions fréquentes

Pourquoi l'exécuter en local ?
Rien de votre machine n'est transféré en ligne : vous pouvez couper internet et continuer à l'utiliser. C'est la seule façon d'obtenir une confidentialité totale.
Pourquoi faut-il qu'il soit sans censure ?
Tout modèle de base est entraîné à refuser certaines demandes. Une version sans censure (abliterated) a ce comportement de refus retiré des poids, pas contourné par le prompt. J'ai d'abord testé le même modèle de base sans abliteration et il a refusé tout net des choses que la version abliterated gère sans problème. Cela reste un modèle de chat généraliste, pas un outil pour générer des médias explicites.
Est-ce privé pour de bon ?
Oui. Une fois le modèle téléchargé, rien n'est envoyé nulle part. Il tourne comme un processus local et la page de chat lui parle via l'adresse de bouclage de votre propre machine.
Pourquoi proposer votre propre page de chat plutôt que l'installation Ollama brute ?
L'installation brute vous donne un modèle vierge sans personnage. La page de chat ajoute par-dessus un nom, un avatar et un prompt de personnalité persistant, vous avez donc un vrai compagnon au lieu de tout refaire dans le terminal à chaque fois.

Continuer la lecture

Recevez les nouveaux guides par email

Un email quand nous publions de nouveaux guides et analyses de modèles. Pas de spam, désinscription à tout moment.

Ajouter GenLovers comme source préférée sur Google