Hy4 : le monstre de 770B de Tencent qui raisonne

Pourquoi ça compte pour toi
Hy4 représente une vraie montée en puissance : 2,6× plus gros que Hy3, avec un contexte 4× plus long (1M tokens). Pour toi qui construis ou expérimentes avec des LLMs, c'est une référence librement accessible sur Hugging Face. Et surtout, son architecture de raisonnement (activable/désactivable) montre comment les modèles évoluent au-delà du simple chat.
Ce qu'il faut retenir
- 1.770B paramètres totaux, 49B actifs par token, contexte d'1 million de tokens
- 2.Deux modes de raisonnement : 'high' (par défaut) et 'no_think' pour le désactiver
- 3.Le modèle pense en anglais approximatif pour économiser des tokens (la grammaire n'est pas la priorité)
- 4.Disponible en open-weight sur Hugging Face, testable via OpenRouter
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Ce qui change avec Hy4
Tencent vient de doubler la mise. Hy3 (juillet) avait 295B paramètres. Hy4 en a 770B — un bond massif qui place le modèle dans la cour des grands, aux côtés d'OpenAI o1 et DeepSeek.
Mais le vrai apport, ce n'est pas la taille : c'est l'architecture de raisonnement intégré. Le modèle expose deux modes via sa configuration :
- ▸'high' : le modèle raisonne, monologue intérieurement, puis répond.
- ▸'no_think' : tu sautes le raisonnement (plus rapide, moins de tokens).
Le raisonnement, c'est du charabia utile
Quand on demande à Hy4 en mode "high" de générer un SVG d'un pélican à vélo, sa trace de raisonnement ressemble à ça :
Maybe add a helmet? Could improve riding theme, but may obscure head.
Remarque : grammaire bâclée intentionnellement. Tencent accepte que la langue "de penser" du modèle soit bancale parce que c'est plus efficace en tokens. Tu ne paies pas pour la poésie cachée — tu paies pour le résultat.
Pourquoi tu devrais regarder
- ▸C'est open-weight : pas de verrou sur l'API, juste Hugging Face et tu récupères les poids.
- ▸1M tokens de contexte : tu peux envoyer 4× plus de docs ou de conversation qu'avant.
- ▸Le fonctionnement est transparent : tu vois exactement comment il raisonne (chat_template.jinja disponible).
Les limites
- ▸Pas de multimodal (texte uniquement, pas d'images).
- ▸Aucune comparaison de performances fournie (impossible de savoir si c'est mieux qu'o1 ou Gemini 2.0).
- ▸Mode raisonnement = plus lent (classique).
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, l'intérêt : Tencent montre qu'on peut rendre la 'pensée' optionnelle dans un LLM. Demande-toi : pourquoi un modèle aurait-il besoin de 'réfléchir' sur certaines questions mais pas d'autres ? C'est la clé pour comprendre où les IA vont au-delà du chat.
Essayer maintenant
Tester Hy4 sur Hugging Face →Source
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :
Explorer les thèmes de cet article :