Sur cette page
Notre avis sur Tencent HY3
HY3 est un grand modèle Mixture-of-Experts dont l’intérêt tient au contexte long, aux poids publiés et au choix entre API et auto-hébergement.
L’architecture annonce 295 milliards de paramètres totaux, 21 milliards actifs par token et un module MTP de 3,8 milliards. Ces chiffres décrivent la structure, pas la qualité sur votre code, votre langue ou vos agents.
Le dépôt final utilise Apache 2.0 et documente vLLM ainsi que SGLang. Les poids BF16 restent lourds : pour la plupart des équipes, un endpoint tiers est la voie de qualification avant tout investissement matériel.
Nature et accès de Tencent HY3
La version HY3 du grand modèle de langage MoE de Tencent, et non une application Tencent.
Interfaces : API.
Le critère qui compte
HY3 mérite une évaluation pour son architecture et son ouverture, jamais une adoption fondée uniquement sur les benchmarks de son éditeur.
Capacités et déploiement de Tencent HY3
Les éléments différenciants concernent l’activation parcimonieuse, le contexte, l’écosystème d’inférence et la licence du modèle final.
Mixture-of-Experts 295B avec 21B actifs
Le routeur n’active qu’une fraction des paramètres à chaque token. Cette architecture réduit le calcul face à un modèle dense de taille totale comparable, mais ne supprime ni la mémoire des poids ni les contraintes de communication entre GPU.
Module MTP de 3,8B paramètres
Le module Multi-Token Prediction participe à la stratégie d’inférence décrite par Tencent. Son intérêt opérationnel dépend du support du moteur, de la précision choisie et du serveur ; il ne constitue pas à lui seul une garantie de débit.
Fenêtre de contexte annoncée à 256K
Le contexte long permet d’envoyer davantage de code ou de documents. Il faut mesurer rappel, position des informations, coût d’entrée et taux d’erreur lorsque la fenêtre se remplit, plutôt que de traiter la capacité maximale comme une qualité constante.
Raisonnement et appels d’outils
Tencent positionne HY3 sur le raisonnement, le code et les agents. Les tableaux du dépôt sont des résultats éditeur ; un protocole interne doit rejouer les outils, erreurs de schéma, reprises et limites de temps qui existent dans votre produit.
Déploiement avec vLLM ou SGLang
Le dépôt fournit des commandes pour des moteurs d’inférence établis. Le dimensionnement dépend de la précision, de la longueur de contexte, de la concurrence et des objectifs de délai ; les poids BF16 ne visent pas une station de travail ordinaire.
Poids finaux sous Apache 2.0
La licence facilite usage, modification et redistribution selon ses termes. Conservez notices et licence, contrôlez les données envoyées à un fournisseur d’API et ne transposez pas au modèle final les conditions d’une ancienne Preview.
Tencent HY3 n’est pas une application prête à l’emploi. C’est un modèle que l’on consomme par un fournisseur ou que l’on déploie avec une pile d’inférence. Cette distinction détermine le budget, les responsabilités de sécurité et le niveau de contrôle réellement obtenu.
Lire les chiffres 295B, 21B et 256K
Dans un Mixture-of-Experts, tous les paramètres ne participent pas à chaque token. HY3 annonce 295 milliards de paramètres totaux et 21 milliards actifs, auxquels s’ajoute un module MTP de 3,8 milliards. L’activation parcimonieuse vise un compromis entre capacité et coût de calcul, mais les poids complets doivent toujours être stockés et servis.
La fenêtre de 256K tokens est une capacité maximale, pas une promesse de rappel parfait. Un document long peut augmenter la facture d’entrée, ralentir la réponse et diluer les passages importants. Pour un agent de code, commencez par un contexte réduit et des outils de recherche ciblés, puis augmentez la fenêtre seulement lorsque les erreurs viennent d’informations absentes.
La licence du modèle final est Apache 2.0. Elle simplifie l’usage et la modification, sous réserve de conserver les mentions requises. Cette ouverture ne fixe pas les conditions d’un endpoint tiers : journalisation, région, disponibilité, modération et rétention appartiennent au contrat du fournisseur.
Évaluer HY3 sur un workload réel
Construisez une trentaine de cas couvrant vos tâches fréquentes et vos échecs coûteux. Pour le code, incluez lecture de dépôt, modification multi-fichier, exécution d’outils et correction après échec. Pour les documents, placez les preuves à différentes positions et exigez une citation vérifiable. Notez exactitude, format, reprises, délai et tokens.
Comparez ensuite l’API et, si nécessaire, un déploiement contrôlé. L’API permet une décision rapide avec peu de capital ; le local apporte maîtrise de l’infrastructure au prix des GPU, de la supervision et des mises à jour. Le seuil de bascule doit intégrer la charge de l’équipe, pas uniquement un prix par token.
Les benchmarks du dépôt sont utiles pour former une shortlist. Ils ne constituent pas une validation indépendante de votre usage. Conservez le commit des poids, la version du serveur, la précision, les paramètres de génération et le corpus : sans cette trace, une comparaison devient impossible à reproduire.
HY3 vaut donc surtout comme candidat technique à mesurer. Son contexte et sa licence ouvrent des options réelles, tandis que sa taille impose de rester discipliné sur l’infrastructure et les preuves.
À qui Tencent HY3 convient-il ?
HY3 s’adresse aux équipes techniques capables de mesurer qualité, coût, débit et gouvernance sur une API ou une infrastructure GPU.
Particulièrement adapté
- Équipes comparant des modèles ouverts pour agents
- Organisations disposant d’une infrastructure GPU adaptée
- Produits voulant qualifier un endpoint à long contexte
Moins adapté
- Utilisateurs cherchant une application grand public
- Petites équipes voulant charger les poids sur un seul GPU
- Projets adoptant un modèle sur les seuls benchmarks éditeur
Le fournisseur de l’endpoint détermine aussi région, journalisation, disponibilité et prix ; l’ouverture des poids ne garantit pas l’accès API.
En bref
Forces et limites de Tencent HY3
Ce qu’on aime
- Architecture et contexte documentés
- Licence Apache 2.0 sur le modèle final
- Support vLLM et SGLang
Ce qui peut frustrer
- Poids BF16 très lourds
- Benchmarks principalement fournis par l’éditeur
- Prix et gouvernance variables selon le fournisseur
Prix Tencent HY3 : poids ouverts, API ou infrastructure
Télécharger les poids ne coûte pas de licence logicielle, mais calcul, stockage et exploitation restent à financer. Le 14 septembre 2026, la page OpenRouter dédiée à tencent/hy3 affiche 0,0825 $ par million de tokens en entrée et 0,33 $ en sortie ; ce tarif tiers peut varier avec les fournisseurs.
Poids officiels0 $ de licence+
Contrôle maximal avec infrastructure adaptée
Capacité : Selon usage
API tierce HY3Notre choix0,0825 $ / M entrée · 0,33 $ / M sortie observés+
Qualifier le modèle sans acheter l’infrastructure
Capacité : Selon usage
Infrastructure dédiéeSur chiffrage+
Exploiter les poids avec gouvernance et capacité maîtrisées
Capacité : Selon usage
Le prix OpenRouter est un tarif tiers daté et non un prix universel de Tencent
Le coût local dépend fortement de la précision du contexte et de la concurrence
Alternatives à Tencent HY3
Qwen, GLM et DeepSeek offrent d’autres compromis entre taille, code, contexte et hébergement. La bonne comparaison utilise le même corpus et le même endpoint.
Tencent HY3, Qwen3, GLM ou DeepSeek ?
Comparez des versions précises avec la même précision, le même serveur et les mêmes cas.
| Outil | Atout à vérifier | Accès | Point de vigilance |
|---|---|---|---|
| Tencent HY3Notre choix | MoE 295B et 256K | Poids et API tierces | Infrastructure lourde |
| Qwen3 | Famille et écosystème | Poids et services | Variante à choisir |
| GLM | Code et agents | Poids et fournisseurs | Licence et endpoint exacts |
| DeepSeek | Écosystème d’inférence | Poids et API | Version et gouvernance |
Avant le déploiement
Évaluez Tencent HY3 sur un workload représentatif
Commencez par un endpoint, mesurez qualité, coût et appels d’outils, puis chiffrez l’auto-hébergement uniquement si les poids apportent un contrôle nécessaire.
À savoir : Le tarif d’un agrégateur peut changer ; lisez prix, région, rétention et modèle exact avant d’envoyer des données.
Questions fréquentes sur Tencent HY3
Tencent HY3 est-il open source ?
Le modèle final et ses poids sont publiés avec une licence Apache 2.0. L’expression poids ouverts reste utile pour distinguer cette licence de la transparence complète sur les données d’entraînement.
Que signifient 295B et 21B pour HY3 ?
295B désigne les paramètres totaux du MoE et 21B la fraction active annoncée par token. La mémoire des poids et le calcul actif restent deux contraintes différentes.
Tencent HY3 accepte-t-il 256K tokens ?
Le dépôt annonce une fenêtre de 256K. Mesurez rappel, erreurs et coût sur vos documents longs avant d’utiliser la limite maximale.
Peut-on auto-héberger Tencent HY3 ?
Oui avec les poids et les recettes vLLM ou SGLang. La taille BF16 impose toutefois une infrastructure multi-GPU sérieuse et une équipe d’exploitation.
Combien coûte l’API Tencent HY3 ?
Le prix dépend du fournisseur. La page tencent/hy3 d’OpenRouter affichait 0,0825 dollar par million de tokens en entrée et 0,33 dollar en sortie le 14 septembre 2026 ; vérifiez le tarif avant chaque déploiement.
Tencent HY3 est-il meilleur que Qwen ou GLM ?
Aucune réponse universelle. Rejouez les mêmes tâches, outils, longueurs de contexte et critères d’erreur sur les versions exactes.

