Le 20 août 2026, un nouveau modèle d’IA est apparu sur OpenRouter et OpenCode, et personne ne sait qui l’a construit. Il porte le nom de code Ox Alpha, accepte le texte, les images et la vidéo, lit jusqu’à un million de tokens à la fois et, pendant environ une semaine, il ne coûte rien. Un jour après le lancement, les agents de programmation avaient déjà fait transiter des milliards de tokens par le modèle, et Reddit s’est transformé en forum de détectives : les utilisateurs dissèquent son tokenizer, ses messages d’erreur et même la langue de ses logs backend pour deviner quel laboratoire se cache derrière cette sortie.
Voici tout ce que l’on sait pour l’instant : les spécifications, les premiers chiffres de tests et ce qu’ils prouvent réellement, ce que rapportent les utilisateurs de Reddit, les principales théories sur son identité, et comment essayer le modèle avant la fermeture de la fenêtre gratuite.
Qu’est-ce qu’Ox Alpha ?
Ox Alpha est ce que le secteur appelle un modèle stealth : un système d’IA de classe frontier publié anonymement via une plateforme d’API, afin que le laboratoire qui l’a conçu puisse recueillir des retours du monde réel avant un lancement public. La fiche officielle sur OpenRouter le décrit comme « un modèle de raisonnement conçu pour la programmation, le travail agentique soutenu et les charges de production ».
En clair, il est fait pour les tâches longues : programmation en plusieurs étapes, exécutions autonomes d’agents et raisonnement sur d’énormes volumes de matière en une seule session.
Pas de nom, pas d’entreprise, pas de communiqué
Le modèle est répertorié sous le nom de fournisseur « stealth », et OpenRouter précise clairement qu’il ne fait qu’acheminer les requêtes. Le système a été développé et est exploité par un tiers qui a choisi de rester anonyme pendant la préversion. Au 21 août, aucune entreprise ne l’a revendiqué.
Le cinquième modèle mystère en six mois
Le scénario est désormais bien rodé. Ox Alpha est la cinquième sortie anonyme en environ six mois, et les quatre précédentes ont toutes suivi le même script : des débuts discrets, une vague de trafic gratuit, puis une entreprise qui se dévoile. Les quatre venaient finalement de laboratoires chinois, dont GLM-5 de Zhipu AI, MiMo-V2-Pro de Xiaomi, Ling-2.6-flash d’Ant Group et LongCat-2.0 de Meituan. Ce précédent oriente l’essentiel des spéculations actuelles.
Les spécifications d’Ox Alpha en un coup d’œil
| Spécification | Détail |
|---|---|
| Fenêtre de contexte | 1 048 576 tokens |
| Sortie maximale | 131 072 tokens |
| Entrées | Texte, images, vidéo |
| Sortie | Texte uniquement |
| Support d’outils | Function calling, sortie JSON structurée |
| Tarification | Tokens d’entrée et de sortie gratuits pendant la préversion |
| Débit | 28 tokens par seconde (médiane) |
| Latence | Environ 4 secondes (médiane) |
| Disponibilité | 99,99 % sur les premiers jours |
| Capacité annoncée | 100 000 milliards de tokens par jour pendant la semaine gratuite |
Deux détails se démarquent. L’entrée vidéo est une première pour une sortie stealth, et seule une poignée de modèles frontier connus la gère bien. Et la fenêtre de contexte d’un million de tokens pourrait, en théorie, contenir une base de code entière de taille moyenne ou des mois de documents en une seule requête. Une réserve toutefois : une grande fenêtre de contexte ne signifie pas automatiquement que le modèle exploite chaque token efficacement, et personne n’a encore vérifié de façon indépendante les performances d’Ox Alpha sur des entrées extrêmement longues.
Ox Alpha bat-il vraiment GPT-5.6 Sol et Claude Fable ?
L’affirmation qui se propage le plus vite sur les réseaux sociaux est un résultat de benchmark : Ox Alpha aurait dépassé 80 % sur des tâches d’ingénierie logicielle DeepSWE, contre environ 65 % pour Claude Fable et 52 % pour GPT-5.6 Sol.
Ces chiffres demandent du contexte. Le résultat provient d’un test mené par un utilisateur avec seulement 10 tâches. Le benchmark officiel DeepSWE compte 113 tâches d’ingénierie de longue haleine, écrites de zéro sur 91 dépôts open source actifs dans cinq langages de programmation, précisément conçues pour que les solutions de référence ne fuient jamais dans les données d’entraînement. Un échantillon trié sur le volet de 10 tâches peut favoriser un modèle par le simple choix des sujets.
La conclusion exacte est plus modeste : Ox Alpha a impressionné dans un petit test préliminaire, et c’est tout. À l’heure où nous écrivons, le modèle n’a aucun résultat publié sur un grand classement indépendant.
Ce que suggère l’usage réel
L’adoption raconte sa propre histoire. Des agents de programmation comme Claude Code et les harnais Hermes Agent ont fait transiter au total 18 milliards de tokens par Ox Alpha presque immédiatement : de vrais développeurs le traitent donc comme un outil de travail quotidien et non comme une curiosité. Pour un déploiement anonyme tout neuf, les métriques de plateforme ci-dessus sont de solides chiffres de production.
Ce que disent les utilisateurs de Reddit
Les premières réactions sont franchement mitigées, ce qui les rend plus utiles que le battage médiatique.
Les éloges
Certains développeurs rapportent d’excellents résultats précisément sur le travail que le modèle prétend viser. Un utilisateur raconte qu’Ox Alpha a trouvé deux vrais bugs dans un projet Python que d’autres outils d’audit avaient manqués. Un autre lui a demandé de construire une application météo interactive : le modèle a d’abord raisonné plusieurs minutes puis répondu sans faire le travail, mais après un second prompt, il a produit une application que le testeur a jugée plus précise et moins boguée qu’une version de DeepSeek V4 Flash. Les utilisateurs d’OpenCode le décrivent comme efficace pour construire des interfaces frontend, faire des corrections basiques côté backend, travailler à partir de captures d’écran, planifier des tâches de programmation plus vastes, tout en consommant moins de tokens que d’autres modèles gratuits.
Les critiques
Les retours négatifs comptent tout autant. Des utilisateurs signalent que le modèle peut raisonner pendant des minutes sans passer à l’action, peine sur les projets backend complexes et se montre irrégulier quand il construit à partir de rien. Dans une comparaison, il a échoué sur un problème que GPT-5.6 Sol a résolu proprement. D’autres trouvent sa prose plate et mécanique et préfèrent toujours DeepSeek pour l’écriture du quotidien.
La question économique
Reddit pose aussi la question évidente : servir gratuitement un modèle de classe frontier à cette échelle coûte cher — qu’obtient donc le fournisseur anonyme en retour ? La réponse réaliste : des données, des retours et de l’attention. Les testeurs exécutent en réalité gratuitement le programme d’évaluation du laboratoire. Cet échange peut rester avantageux, à condition de comprendre qu’on en fait partie.
Qui l’a construit ? Les théories dominantes
Il n’y a pas de réponse confirmée, mais l’enquête communautaire a produit plusieurs candidats.
| Théorie | Indices |
|---|---|
| Variante multimodale de GLM-5.3 (Z.ai) | Tokenizer correspondant à la famille GLM, messages backend en chinois, code d’erreur API 1210 déjà associé à Z.ai, profils de vitesse et de cache similaires |
| Xiaomi MiMo V3 | Xiaomi a déjà mené des préversions anonymes, et la capacité annoncée de 100 000 milliards de tokens rappelle d’anciennes promotions MiMo |
| Tencent Hy4 | Proposé dans un fil d’enquête dédié sur Reddit |
| MiniMax | Chronologie circonstancielle ; un modèle non annoncé collerait |
| Un routeur alternant plusieurs modèles | Expliquerait le comportement irrégulier selon les types de tâches |
La théorie GLM est en tête pour l’instant. Les testeurs ont aussi remarqué qu’Ox Alpha trébuche sur les mêmes rares anomalies de tokens qui touchent les modèles GLM, MiMo et Qwen, ce qui pointe à nouveau vers un laboratoire chinois. Un bémol subsiste : le GLM-5.3 disponible publiquement est uniquement textuel, alors qu’Ox Alpha accepte les images et la vidéo ; si la théorie tient, il s’agirait donc d’une variante multimodale non publiée. Tant que le développeur ne se manifeste pas, tout cela reste du fingerprinting officieux.
Comment essayer Ox Alpha gratuitement
Il existe trois portes d’entrée, selon votre niveau technique.
Option 1 : discuter sur OpenRouter, sans code
- Ouvrez la page du modèle Ox Alpha sur OpenRouter.
- Sélectionnez Try this model ou Playground.
- Connectez-vous avec un compte OpenRouter gratuit.
- Soumettez une tâche sous forme de texte, d’image ou de clip vidéo.
C’est la meilleure voie pour simplement prendre le modèle en main.
Option 2 : l’appeler via l’API
Les développeurs peuvent utiliser l’API d’OpenRouter compatible OpenAI avec l’identifiant de modèle stealth/ox-alpha. Générez une clé API dans le tableau de bord OpenRouter, pointez n’importe quel SDK standard vers l’URL de base d’OpenRouter et renseignez le champ model en conséquence. Pendant la préversion, les tokens de prompt comme de complétion sont facturés zéro.
Option 3 : l’utiliser dans OpenCode
Le lancement est une promotion conjointe avec OpenCode, l’agent de programmation open source, qui propose le modèle pendant environ une semaine avec des limites si généreuses que l’équipe parle d’un usage quasi illimité. Connectez le fournisseur OpenCode Zen, ouvrez le catalogue de modèles avec la commande /models et sélectionnez Ox Alpha.
Quelle que soit la voie choisie, une tâche réelle mais non sensible en révèle bien plus qu’un prompt de chat : corrigez un bug dans un petit projet, ajoutez une fonctionnalité avec ses tests, ou confiez au modèle la capture d’écran d’une interface à analyser. Ces exercices testent la planification, l’usage des outils et la capacité à mener un long travail à son terme.
Lisez les petites lignes avant de coller quoi que ce soit de sensible
Le calcul frontier gratuit s’accompagne toujours de conditions, et ce lancement comporte une subtilité à comprendre. L’annonce d’OpenCode met en avant une conservation nulle des données, mais la fiche OpenRouter indique que le fournisseur anonyme conserve bel et bien les prompts et les réponses, simplement sans les utiliser pour l’entraînement. La politique applicable peut dépendre de votre mode d’accès au modèle et, tant que le développeur n’aura pas publié des conditions claires, l’hypothèse prudente est que vos saisies sont stockées par une entreprise qui ne vous a pas dit son nom.
Les règles pratiques : ne soumettez ni mots de passe, ni informations personnelles, ni documents confidentiels, ni code source propriétaire. Rappelez-vous aussi que la période gratuite n’a pas de date de fin publiée et peut changer du jour au lendemain, et qu’aucun benchmark audité n’existe encore : chaque affirmation de performance repose sur de petits échantillons communautaires.
Pourquoi les sorties stealth se multiplient
Les lancements anonymes résolvent de vrais problèmes pour les laboratoires d’IA. Ils génèrent des retours sans biais, puisque les testeurs ne peuvent pas projeter d’attentes de marque sur un modèle sans marque. Ils éprouvent l’infrastructure avec du trafic réel avant le lancement officiel. Et ils créent une attention organique : un modèle mystère qui bat des concurrents connus dans les tests communautaires s’offre des semaines de couverture gratuite qu’aucune campagne publicitaire ne pourrait acheter. Attendez-vous à ce que le schéma se poursuive — savoir évaluer rapidement un modèle inconnu devient une compétence réellement utile.
L’expérience de l’app et de la plateforme Coursiv
Des lancements comme celui-ci illustrent exactement pourquoi apprendre les fondamentaux de l’IA rapporte. De nouveaux modèles sortent désormais chaque mois, et ce sont les personnes capables d’ouvrir un outil inconnu, d’en sonder les forces en un après-midi et d’intégrer les meilleurs à leur flux de travail qui en profitent. Cette compétence s’apprend. Coursiv l’enseigne à travers de courtes leçons quotidiennes structurées : prompting pratique, comparaison et choix des outils d’IA, et application aux tâches de travail du quotidien — le tout pensé pour des personnes occupées sans bagage technique. L’app vous guide pas à pas, pour qu’au prochain Ox Alpha, vous sachiez exactement comment le mettre à l’épreuve. Comme pour tout produit de formation, vérifiez sur le site officiel les détails et tarifs à jour.
Ce qu’il faut surveiller maintenant
Si l’histoire se répète, le laboratoire derrière Ox Alpha se dévoilera d’ici quelques jours ou semaines, très probablement à l’occasion d’un lancement officiel avec un vrai nom, des benchmarks publiés et des tarifs. La première chose que tout le monde vérifiera : les détectives du fingerprinting ont-ils vu juste sur GLM ? La deuxième question, c’est le coût : les précédents modèles stealth ont converti leurs préversions gratuites en tarifs publics agressivement bas — c’est en partie ainsi que les laboratoires chinois ont mis la pression sur leurs concurrents occidentaux toute l’année. Un codeur de niveau frontier à une fraction des prix frontier aurait des répercussions bien au-delà de ce seul modèle.
En résumé : Ox Alpha est une occasion rare de tester un possible modèle frontier à coût nul, avec en petites lignes le fait que vous faites partie de l’expérience. Essayez-le cette semaine sur un projet non critique ; mais ne bâtissez pas un flux de production sur une préversion anonyme.