Intermédiaire·2 min·30 août 2026

Hy4 : le monstre de 770B de Tencent qui raisonne

🎧 Résumé audio0:00 / 0:00
Tencent sort Hy4, un modèle ouvert de 770 milliards de paramètres capable de raisonner en deux modes.
Hy4 : le monstre de 770B de Tencent qui raisonne

Pourquoi ça compte pour toi

Hy4 représente une vraie montée en puissance : 2,6× plus gros que Hy3, avec un contexte 4× plus long (1M tokens). Pour toi qui construis ou expérimentes avec des LLMs, c'est une référence librement accessible sur Hugging Face. Et surtout, son architecture de raisonnement (activable/désactivable) montre comment les modèles évoluent au-delà du simple chat.

Ce qu'il faut retenir

  • 1.770B paramètres totaux, 49B actifs par token, contexte d'1 million de tokens
  • 2.Deux modes de raisonnement : 'high' (par défaut) et 'no_think' pour le désactiver
  • 3.Le modèle pense en anglais approximatif pour économiser des tokens (la grammaire n'est pas la priorité)
  • 4.Disponible en open-weight sur Hugging Face, testable via OpenRouter

Tu galères avec le jargon ?

Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.

Ce qui change avec Hy4

Tencent vient de doubler la mise. Hy3 (juillet) avait 295B paramètres. Hy4 en a 770B — un bond massif qui place le modèle dans la cour des grands, aux côtés d'OpenAI o1 et DeepSeek.

Mais le vrai apport, ce n'est pas la taille : c'est l'architecture de raisonnement intégré. Le modèle expose deux modes via sa configuration :

  • 'high' : le modèle raisonne, monologue intérieurement, puis répond.
  • 'no_think' : tu sautes le raisonnement (plus rapide, moins de tokens).

Le raisonnement, c'est du charabia utile

Quand on demande à Hy4 en mode "high" de générer un SVG d'un pélican à vélo, sa trace de raisonnement ressemble à ça :

Maybe add a helmet? Could improve riding theme, but may obscure head.

Remarque : grammaire bâclée intentionnellement. Tencent accepte que la langue "de penser" du modèle soit bancale parce que c'est plus efficace en tokens. Tu ne paies pas pour la poésie cachée — tu paies pour le résultat.

Pourquoi tu devrais regarder

  1. C'est open-weight : pas de verrou sur l'API, juste Hugging Face et tu récupères les poids.
  2. 1M tokens de contexte : tu peux envoyer 4× plus de docs ou de conversation qu'avant.
  3. Le fonctionnement est transparent : tu vois exactement comment il raisonne (chat_template.jinja disponible).

Les limites

  • Pas de multimodal (texte uniquement, pas d'images).
  • Aucune comparaison de performances fournie (impossible de savoir si c'est mieux qu'o1 ou Gemini 2.0).
  • Mode raisonnement = plus lent (classique).

Et concrètement pour toi ?

Choisis ton profil — la lecture de l'article change selon qui tu es.

🔭 Curieux

Pour toi, l'intérêt : Tencent montre qu'on peut rendre la 'pensée' optionnelle dans un LLM. Demande-toi : pourquoi un modèle aurait-il besoin de 'réfléchir' sur certaines questions mais pas d'autres ? C'est la clé pour comprendre où les IA vont au-delà du chat.

Newsletters Noésis

3 minutes d'IA dans ta boîte mail, chaque matin.

Rejoins les francophones qui comprennent, essaient et progressent avec l'IA. Choisis ce que tu veux recevoir. Désabonnement en 1 clic.

Explorer les thèmes de cet article :