L'IA cette semaine
La semaine dernière, le harnais semblait être toute l'histoire : 37 points d'écart sur ARC-AGI-3, et nous l'avons écrit. Cette semaine, une étude contrôlée remet ce chiffre à sa place. Sur sept modèles et trois harnais, en programmation, le harnais ne change presque rien au fait que le travail aboutisse — mais il en double le coût. Le harnais n'achetait pas de la capacité, il achetait, ou gaspillait, de l'argent. C'est la même histoire que la semaine dernière, lue un cran plus bas — et c'est à ce cran-là que vivent les budgets.
Les trois signaux
01 — 03Le harnais est une ligne de coût, pas une ligne de capacité
Les 37 points d'écart de la semaine dernière venaient de deux harnais et de deux réglages de raisonnement — nous l'avions signalé. Arena.ai a cette fois figé tout le reste, et l'image s'inverse : le succès bouge à peine, le coût double. C'est donc une décision d'achat, prise aujourd'hui par défaut dans les équipes d'ingénierie.
2,0× Claude Code contre Pi, 1,6× contre Codex
97,8 % / 96,7 % / 96,7 % — Claude Fable 5 sur les trois
1,33 $ contre 0,67 $ pour le même travail
Les laboratoires écrivent les métriques sur lesquelles on les jugera
Trois textes en sept jours, venus de trois laboratoires, proposant chacun comment mesurer le développement à la frontière. Aucun chiffre n'est audité ; les évaluateurs indépendants sont annoncés, pas installés. Celui qui publie une définition le premier a tendance à la garder — et elle vous arrivera en clause contractuelle avant de vous arriver en règlement.
~30 000 agents internes simultanés, 6 % du calcul de R&D IA à la sécurité
6 premiers signalements de désalignement chez OpenAI, volontaires et auto-déclarés
Accès de niveau employé pour des évaluateurs tiers — promis, pas encore en place
La souveraineté européenne se consolide par fusion, pas par levée
Mistral avait répondu par 3 Md€ il y a quinze jours. Cohere répond autrement : il achète la continuité d'un cadre juridique plutôt qu'une place dans la course aux paramètres. Pour un acheteur européen soumis à des exigences de localisation, c'est la première option crédible qui ne passe pas par un hyperscaler américain.
Double siège Berlin + Toronto, Heidelberg conservé en recherche
1 000+ personnes, adossé au cloud souverain STACKIT du groupe Schwarz
Clôture attendue plus tard en 2026, sous réserve des autorisations réglementaires
Le reste de la semaine
20 entrées| Acteur | Annonce | Ce qu'il faut en retenir |
|---|---|---|
| Arena.ai | HarnessTax : ±2 % sur le succès, jusqu'à 2,0× sur le coût | 21 paires modèle-harnais, 7 modèles, 3 harnais (Claude Code, Codex CLI, Pi), 30 tâches échantillonnées par benchmark et exécutées trois fois, aux tarifs API du 1er septembre 2026. Mesure produite par un tiers, pas par un éditeur. C'est une ligne de coût qu'aucun comité de direction ne suit, et elle corrige la lecture que beaucoup ont tirée de l'écart ARC-AGI-3 de la semaine dernière. |
| Anthropic | Claude optimise plus de 30 modèles biomoléculaires, environ 4× en moyenne | Mesure d'Anthropic sur GPU NVIDIA H100 et H200, avec près de 2× à sorties identiques en prédiction de structure et en design ; code et noyaux FlashPairformer ouverts. L'IA en ingénieur de performance plutôt qu'en chercheur : le gain porte sur le coût unitaire du calcul scientifique. Si vous simulez à grande échelle, la question est de savoir si votre propre code numérique y est passé. |
| OpenAI | Astra for Law : 54,0 % contre 38,7 % sur le jeu de validation du Legal Research Bench de Vals AI | GPT-6 Astra associé à un index juridique de plus de 230 millions d'URL couvrant 99,9 % de la jurisprudence américaine publiée faisant précédent, via Trusted Access pour des cabinets sélectionnés ; l'API est annoncée comme à venir. Les deux scores comparent un modèle spécialisé avec index et un modèle généraliste avec recherche web — pas la même configuration. Le modèle vertical se gagne sur l'accès aux corpus, pas sur l'architecture. |
| Anthropic | Mesures du rythme de développement à l'intérieur du laboratoire | Anthropic indique que Claude pilote 26 % de sa R&D IA, contre moins de 1 % en février 2026, avec environ 30 000 agents simultanés et près de 6 % du calcul de R&D IA affecté à la sécurité. Personne ne peut encore le vérifier — et c'est pour cela qu'il faut le lire. La première définition publiée tend à devenir la norme à laquelle les autres seront tenus. |
| Gemini 3.8 Live, 3.8 Live Extended Thinking et 3.5 Transcribe | 0,005 $ la minute en entrée audio et 0,018 $ en sortie, estimation de Google fondée sur 3 $ et 12 $ par million de tokens ; plus de 85 langues sur Transcribe. Toute hypothèse budgétaire de centre de contact fondée sur un coût à la minute négocié il y a un an est périmée — rouvrez la clause de révision tarifaire avant de rouvrir l'architecture. |
| Acteur | Annonce | Ce qu'il faut en retenir |
|---|---|---|
| Anthropic | Cowork et le chat fusionnent en un seul Claude | Claude Docs et Slides en bêta, sorties éditables, export PowerPoint et PDF ; déploiement sur Pro et Max dans les semaines qui viennent, Team et Free ensuite. Les administrateurs Enterprise sont prévenus au moins 30 jours à l'avance — cette fenêtre est le moment de vérifier ce que la fusion change aux règles de rétention et de partage de documents, pas après. |
| Anthropic | Les Projects de Claude Code redessinés autour de la délégation | Claude cadre la demande, délègue, coordonne des fils parallèles, relit les sorties et assemble le résultat. Bêta restreinte sur une sélection de comptes Pro et Max, élargissement annoncé. Ce qui est décrit a la forme d'une équipe, pas d'un outil : décidez maintenant qui valide le résultat assemblé, et sur quelle trace. |
| OpenAI | Sponsored Agents dans ChatGPT, avec HubSpot et Shopify | Un utilisateur qui clique sur une publicité peut ouvrir une conversation clairement identifiée avec un agent sponsorisé ; annonceurs américains sélectionnés pour l'instant, application Shopify ouverte aux marchands américains, international annoncé à partir du 23 septembre. Le point de conversion quitte votre site pour une conversation que vous ne contrôlez qu'en partie — redéfinissez les indicateurs du tunnel avant d'y engager un budget. |
| Agent Substrate sur GKE | Google annonce une densité dix fois supérieure aux environnements de conteneurs standards, des reprises en moins de 500 ms, plus de 500 activations suspension-reprise par seconde et plus de 1 000 agents dormants par hôte ; open source hors production, support production sur liste d'autorisation. Chiffres de l'éditeur, non vérifiés. Quand un agent dormant ne coûte presque rien à garder en vie, la question devient combien on en laisse tourner sans revue. | |
| L'agent CC étendu aux groupes de six personnes | Agendas, tâches et démarches administratives partagés sur un compte unique, États-Unis seulement, 18 ans et plus, liste d'attente ; tourne sur Antigravity avec des modèles Gemini. À lire comme un prototype fonctionnel de gouvernance multi-utilisateurs sur une boîte mail, un agenda et des documents partagés — exactement le problème d'une équipe projet ou d'un service client. | |
| Meta | Meta One, de 2,99 $ à 499 $ par mois | WhatsApp Plus à 2,99 $, Instagram et Facebook Plus à 3,99 $, formules groupées à 7,99 $ et 19,99 $, offres créateurs et entreprises de 14,99 $ à 499 $. Meta indique 15 millions d'abonnements et d'essais à ce jour, un chiffre qui mêle les deux. À 499 $ par mois, Meta ne vend plus une option de réseau social : il tarifie un outil professionnel. |
| Acteur | Annonce | Ce qu'il faut en retenir |
|---|---|---|
| OpenAI | Un tour pré-IPO discuté au-dessus de 1 200 Md$, selon la presse | Bloomberg fait état de discussions préliminaires, article derrière un péage, rien de signé et aucune confirmation d'OpenAI ; Altman jugeait le 12 septembre « peu avisée » une introduction en Bourse en 2026. Le calendrier de marché recule pendant que la valorisation monte : le financement reste privé, et la reddition de comptes avec lui. Nous signalions la semaine dernière le prospectus d'Anthropic comme les premiers chiffres vérifiables d'un laboratoire ; c'est ici le mouvement inverse. |
| SoftBank | 11,9 Md$ empruntés auprès d'une vingtaine de banques | Au-delà des 10 Md$ initialement recherchés, Son viserait près de 65 Md$ investis dans OpenAI d'ici octobre ; l'action a cédé jusqu'à 13 % le lundi. La chaîne de financement de la frontière passe désormais par de la dette bancaire adossée à un seul actif non coté — cartographiez ce maillon comme vous cartographieriez un fournisseur industriel unique. |
| OpenAI | Glass Imaging racheté pour plus de 300 M$, selon la presse | Information du Wall Street Journal relayée par TechCrunch, non confirmée par OpenAI ; la société a été fondée en 2019 par deux anciens ingénieurs caméra d'Apple. Racheter de l'optique computationnelle n'est pas diversifier, c'est préparer un capteur : l'intégration verticale des fournisseurs d'IA remonte vers le matériel, et s'éloigne du système d'exploitation d'un tiers. |
| NVIDIA | CUDA-Q étendu au calcul quantique tolérant aux fautes | CUDA-Q Logical, cadre de conception partagé pour programmer des qubits logiques plutôt que physiques, avec des partenaires dont Infleqtion. Des outils de développement, pas une machine disponible. NVIDIA verrouille la couche logicielle avant que le matériel n'existe à l'échelle, exactement comme CUDA l'a fait pour le GPU : veille longue, pas arbitrage budgétaire cette année. |
| Acteur | Annonce | Ce qu'il faut en retenir |
|---|---|---|
| Anthropic | Dario Amodei, « We Must Pace the Frontier » | Un plan en trois étapes : Anthropic s'engage unilatéralement à donner à des évaluateurs tiers un accès permanent de niveau employé assorti d'un droit de publication, puis une coordination entre laboratoires sur une certification liée aux capacités, puis des accords internationaux. Aucun seuil chiffré. Zuckerberg et Altman ont répondu publiquement dans les jours qui ont suivi. Certification par capacité, évaluateur embarqué, droit de publication : c'est le vocabulaire de votre prochain appel d'offres. |
| OpenAI | Cadre volontaire de signalement des désalignements, six premiers cas | Couvre les actions non autorisées d'un modèle, les échecs de protection et les comportements qui contredisent une évaluation de sûreté publiée ; escalade au Safety Advisory Group. OpenAI parle d'un ensemble initial, non exhaustif, qui ne remplace pas ses obligations légales de divulgation. À exiger en due diligence fournisseur — en notant que c'est volontaire, auto-déclaré et explicitement incomplet. |
| Cohere / Aleph Alpha | Accord définitif de rapprochement | L'ensemble opérera sous le nom Cohere, double siège Berlin et Toronto, Heidelberg conservé comme centre de recherche, plus de 1 000 personnes, avec un partenariat sur le cloud souverain STACKIT ; Gomez reste directeur général. Clôture attendue plus tard en 2026, sous réserve des autorisations réglementaires finales, montant non communiqué. La souveraineté se consolide par fusion plutôt que par levée — mais l'opération n'est pas close. |
| Mistral | IA ouverte, privée et multilingue dans Smart Window de Firefox | Partenariat avec Mozilla, sans calendrier de déploiement ni périmètre de modèles précisés. Le navigateur redevient un point de distribution disputé, et Mistral y entre par la confidentialité plutôt que par la performance — ce qui donne à un acheteur européen une ligne défendable en comité, sans rapport avec une position de benchmark. |
| Google DeepMind | Lancement du DeepMind Institute | Dirigé par Hassabis, Manyika et Legg, il étudie les implications techniques et sociétales de l'AGI sur la sûreté, la gouvernance, les institutions et les valeurs humaines. Les trois grands laboratoires ont publié un cadre ou une instance de gouvernance dans la même semaine — le débat réglementaire s'écrit chez les fournisseurs avant d'arriver chez les régulateurs. |
La semaine dernière le harnais semblait gratuit. Cette semaine, il s'avère que vous le payiez deux fois
Il y a sept jours, le harnais arrivait en cadeau, et la vraie question était ce qui restait des dix-huit mois passés à en construire un. La réponse est maintenant plus nette et moins confortable : le harnais n'a jamais acheté de la capacité, il a acheté du coût — et le moins cher performe comme le plus cher. La voix temps réel est passée sous le centime la minute en entrée ; un agent dormant ne coûte presque rien à garder en vie. Chacun de ces points rend caduque une hypothèse budgétaire posée il y a moins d'un an. Pendant ce temps, les fournisseurs ont commencé à écrire le vocabulaire de leur propre surveillance, et ce vocabulaire vous atteindra en clause contractuelle bien avant de vous atteindre en loi.
- Sur nos agents de code, quel harnais utilisons-nous, qui l'a choisi, et combien coûte ce choix par rapport à l'alternative la moins chère à taux de succès comparable ?
- Nos contrats de fournisseurs d'IA prévoient-ils une clause de révision tarifaire déclenchée par une baisse du prix catalogue, ou payons-nous un tarif négocié sur un marché qui a bougé deux fois depuis ?
- Qu'exigeons-nous de nos fournisseurs en matière de mesure de sûreté — et acceptons-nous des chiffres auto-déclarés, ou demandons-nous un évaluateur tiers avec droit de publication, comme Anthropic s'engage à en accueillir ?
