Claude Sonnet 5 : Anthropic relance ses modèles IA avancés

Claude Sonnet 5 : Anthropic relance ses modèles IA avancés

Claude Sonnet 5 arrive avec des gains pour les agents autonomes, tandis qu'Anthropic rouvre Fable et Mythos après un examen réglementaire.

Publié le 1 juillet 20265 min de lecturepar ZoneIA

Claude Sonnet 5 marque une étape importante pour Anthropic dans la course aux modèles d'IA capables d'exécuter des tâches complexes. Son lancement intervient en parallèle du rétablissement de l'accès à Fable 5 et Mythos 5, deux modèles frontières temporairement suspendus après un examen lié au contrôle des exportations aux États-Unis.

Claude Sonnet 5, un lancement sous surveillance

Anthropic a remis en service Fable 5 et Mythos 5 après une interruption opérationnelle de 18 jours. Cette pause avait été déclenchée par une directive américaine de contrôle des exportations, à la suite d'un problème de sécurité identifié sur Fable 5.

Des chercheurs d'Amazon avaient documenté une méthode permettant de contourner certains garde-fous du modèle. Dans ce scénario, Fable 5 pouvait être amené à identifier des vulnérabilités logicielles et à fournir du code d'exploitation. La suspension a donc touché les systèmes les plus avancés de l'entreprise, le temps de renforcer les protections.

Cette séquence illustre la pression réglementaire croissante autour des modèles frontières. Faute de mécanismes de vérification de nationalité en temps réel, Anthropic a dû appliquer une coupure totale d'accès pour l'ensemble des utilisateurs, quels que soient leur pays ou leur usage.

Le retour commercial de ces modèles repose désormais sur une couche de sécurité automatisée, conçue pour repérer les requêtes ambiguës ou potentiellement malveillantes. Cette évolution permet à Anthropic de relancer ses modèles sur sa plateforme, ses infrastructures cloud et ses réseaux partenaires.

Des agents autonomes plus efficaces avec Claude Sonnet 5

Si Fable 5 et Mythos 5 concentrent l'attention réglementaire, la priorité commerciale immédiate se porte sur Claude Sonnet 5. Ce modèle vise les équipes d'ingénierie qui déploient des agents autonomes capables d'agir dans des environnements logiciels réels.

Les données de performance indiquent une progression nette par rapport à Sonnet 4.6. Claude Sonnet 5 atteint 63,2 % sur SWE-bench Pro, contre 58,1 % pour son prédécesseur. Sur Terminal-Bench 2.1, il obtient 80,4 %, contre 67,0 % pour Sonnet 4.6. Opus 4.8 reste plus performant sur certains benchmarks, mais avec un coût supérieur.

Le positionnement tarifaire renforce l'intérêt du nouveau modèle. Le coût de base est annoncé à 3 dollars par million de tokens en entrée et 15 dollars en sortie, avec un tarif de lancement réduit à 2 dollars en entrée et 10 dollars en sortie jusqu'au 31 août 2026.

Dans les usages réels, plusieurs entreprises ont déjà testé cette architecture. Rakuten l'a utilisée sur des pull requests complexes en production, avec exécution de tests et validation des résultats avant revue humaine. Zapier l'a intégrée à des flux administratifs multi-étapes, notamment pour mettre à jour des comptes Salesforce et générer des communications clients.

Zed a de son côté exploité le modèle pour le débogage. Lors d'essais internes, le système a généré un test de reproduction, appliqué un correctif, puis vérifié que le bug réapparaissait en l'absence du patch. Factory rapporte également une meilleure stabilité sur des tâches longues dans de grands dépôts de code.

Une sécurité renforcée, mais avec des compromis

Pour répondre aux exigences fédérales, les ingénieurs d'Anthropic ont entraîné un classificateur de sécurité ciblant le mécanisme de contournement signalé. Selon les validations internes, ce système bloque la technique d'exploitation documentée dans plus de 99 % des essais.

Ce filtre fonctionne avec une marge de prudence élevée. Lorsqu'une requête développeur franchit une limite statistique jugée risquée, la plateforme redirige automatiquement la charge vers l'architecture Opus 4.8, plus ancienne. L'objectif est de maintenir la continuité du service sans exposer les modèles les plus sensibles.

Ce choix crée toutefois un compromis pour les équipes techniques. En élargissant la marge de sécurité, le système peut signaler plus souvent des demandes légitimes, notamment lors du débogage ou du développement d'applications. Les développeurs devront donc composer avec une IA plus prudente, parfois moins fluide dans certains contextes.

Les évaluations menées pendant l'arrêt temporaire ont également montré que le comportement problématique n'était pas propre à Fable 5. Des architectures plus anciennes ou moins puissantes, issues de plusieurs fournisseurs, dont Claude Opus 4.8, GPT-5.5 et Kimi K2.7, ont reproduit les mêmes résultats dans certains tests.

Cybersécurité : des capacités offensives limitées

La carte système formelle indique que Claude Sonnet 5 améliore ses capacités d'action sans accroître proportionnellement les risques de sécurité. Les audits comportementaux automatisés montrent un taux plus faible de comportements non conformes que Sonnet 4.6.

Anthropic précise que le modèle ne dispose pas de capacités avancées en cybersécurité offensive. Les équipes ont volontairement exclu des jeux de données spécialisés en exploitation informatique lors de l'entraînement, afin de limiter le modèle à des tâches techniques courantes et défensives.

Des évaluations publiques menées avec Mozilla ont testé la capacité du modèle à produire des exploits fonctionnels pour des vulnérabilités connues dans le coeur du navigateur Firefox 147. Claude Sonnet 5 n'a généré aucun exploit fonctionnel sur l'ensemble des fenêtres d'évaluation, avec un taux de réussite de 0 %.

Le modèle affiche toutefois 13,2 % de réussite partielle, une légère hausse par rapport à Sonnet 4.6. Les ingénieurs attribuent cette progression à de meilleurs raisonnements généraux, plutôt qu'à un entraînement offensif spécialisé. Par prudence, les versions commerciales intègrent par défaut des classificateurs de sécurité en temps réel comparables à ceux d'Opus 4.8.

Vers un cadre commun pour évaluer les modèles IA

L'incident autour de Fable 5 a accéléré la mise en place d'un partenariat entre Anthropic, Amazon, Microsoft et Google. L'objectif est de définir un cadre industriel plus objectif pour qualifier la gravité des failles de sécurité dans les modèles IA.

Aujourd'hui, les fournisseurs ne disposent pas encore d'une métrique commune pour classer les contournements de sécurité. Cette absence de référence crée de l'incertitude réglementaire lorsqu'une nouvelle vulnérabilité de prompt est découverte.

Le cadre proposé repose sur quatre critères techniques :

  • Gain de capacité : mesure l'écart entre l'exploitation et les outils logiciels ordinaires.
  • Étendue du gain : évalue le nombre d'opérations offensives rendues possibles.
  • Facilité de militarisation : estime l'effort humain requis pour obtenir un résultat dangereux.
  • Découvrabilité : mesure l'accessibilité de la technique dans les cercles de recherche publics.

Ce dispositif doit aider les développeurs et professionnels de la cybersécurité à coordonner leurs réponses. Pour les failles les plus graves, capables par exemple de perturber des systèmes financiers ou électriques, les fournisseurs prévoient des mesures automatisées immédiates.

Anthropic s'appuie aussi sur un programme de recherche de vulnérabilités via HackerOne et sur une équipe interne chargée de surveiller les signaux de menace en continu. L'entreprise a par ailleurs formalisé des accords permettant à des chercheurs fédéraux d'auditer les modèles frontières avant leur mise sur le marché.

Conclusion

Claude Sonnet 5 confirme l'évolution rapide des modèles IA vers des agents capables d'agir dans des environnements logiciels complexes. Son lancement montre aussi que la performance ne peut plus être dissociée de la gouvernance, de la cybersécurité et du contrôle réglementaire.

Pour les entreprises, l'enjeu sera d'exploiter ces gains d'automatisation tout en acceptant des garde-fous plus stricts. Anthropic tente ainsi de concilier productivité, sécurité et conformité dans un marché où les modèles frontières sont désormais surveillés de très près.

Partager

Articles connexes

Outils recommandés