Intermédiaire·2 min·29 juin 2026

Qwen 3.6 27B : le modèle local qui tient enfin ses promesses

🎧 Résumé audio0:00 / 0:00
Enfin un modèle local gratuit qui code aussi bien que Claude, sans passer par une API.
Qwen 3.6 27B : le modèle local qui tient enfin ses promesses

Pourquoi ça compte pour toi

Si tu développes seul ou en petite équipe, tu peux arrêter de payer OpenAI pour chaque requête. Qwen 3.6 27B tourne sur ta machine (même un MacBook), génère du code fiable au premier coup, et tes données ne quittent jamais ton ordi. Pour un créateur ou une startup, c'est l'indépendance technique à zéro coût.

Ce qu'il faut retenir

  • 1.Génère du code complexe (Node.js, hexagonal minesweeper) en une seule tentative, sans correction.
  • 2.Tourne à ~30 tokens/seconde sur MacBook M5 avec llama.cpp, nécessite 28 Go de RAM en 8-bit.
  • 3.Performance équivalente à GPT-5 mi-2025 selon les benchmarks (Artificial Analysis).
  • 4.Installation : 3 lignes de CLI, zéro dépendance propriétaire (llama.cpp, pas Ollama).

Tu galères avec le jargon ?

Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.

Pourquoi cette fois c'est différent

L'auteur a testé des dizaines de modèles locaux. Tous déçoivent : soit ils hallucinent, soit ils ratent les instructions. Qwen 3.6 27B change la donne. Les tests parlent d'eux-mêmes :

  • Prompt en poésie : demande un poème de 8 lignes sur la danse Zouk et la physique quantique → le modèle réfléchit aux termes, aux rimes, et produit quelque chose de cohérent.
  • Code au premier essai : "Crée un minesweeper hexagonal en Node.js avec pnpm" → il sort un package fonctionnel, pas du HTML bricolé.
  • Tâches réelles : configuration d'infra, diagnostic d'erreurs → ça marche, c'est rapide, les paramètres par défaut sont sensés.

Le truc fou : il y a un an, faire ça coûtait des centaines d'euros en appels GPT-4.5.

Mise en route en 3 minutes

llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
  --spec-type draft-mtp -ngl 999 -fa on -c 65536 --jinja --port 8080

C'est tout. L'option -ngl 999 envoie tout sur le GPU, -fa on active la flash attention (plus vite), -c 65536 = contexte de 64k tokens (tu peux monter à 256k si tu as assez de RAM).

Ensuite, deux chemins :

  • Chat simple : ouvre http://127.0.0.1:8080.
  • Intégration dev : connecte-le à OpenCode, Hermes, ou autre outil natif IA en changeant le baseURL.

La vraie question : est-ce assez rapide ?

Sur MacBook Max M5 (128 Go) :

  • Qwen 3.6 35B A3B (mixture-of-experts) : 105 tokens/seconde, mais moins rigoureux sur les instructions.
  • Qwen 3.6 27B (dense) : 32 tokens/seconde avec la prédiction multi-token activée.
  • DeepSeek V4 Flash (quantisé agressivement) : 33 tokens/seconde, mais une qualité dégradée.

30 tokens/seconde, c'est largement dans la plage des API de référence. Sur une RTX 5090 (GPU Nvidia), ça monte à 50 tokens/seconde.

Pourquoi 27B et pas 35B ?

Le 35B est plus rapide (105 vs 32 tokens/sec). Mais pour du code, l'auteur préfère 27B : "Je génère trois fois moins de code, mais il est meilleur."

C'est un choix conscient. Moins de bruit, plus de densité.

Ce que ça change vraiment

Les modèles propriétaires coûtent cher, tombent en panne (Claude Fable 5 a été désactivé), et envoient tes données aux États-Unis ou en Chine. Qwen 3.6 27B, tu l'héberges. Tu peux l'affiner sur tes données. Il ne peut pas disparaître du jour au lendemain.

C'est le début d'une ère : où chacun peut avoir son propre modèle, sans facture mensuelle, sans dépendre de personne.

Et concrètement pour toi ?

Choisis ton profil — la lecture de l'article change selon qui tu es.

🔭 Curieux

Pour toi, l'enjeu : pendant que ChatGPT te lock dans une API payante, des modèles libres de 27B rivalisent en qualité. Demande-toi si tu veux rester dépendant de corporations ou si la démarche "sur ta machine, rien en ligne" te parle vraiment.

📊 Cours en bourse

Newsletters Noésis

3 minutes d'IA dans ta boîte mail, chaque matin.

Rejoins les francophones qui comprennent, essaient et progressent avec l'IA. Choisis ce que tu veux recevoir. Désabonnement en 1 clic.

Explorer les thèmes de cet article :