Claude Fable 5.1 est arrivé, les résultats des tests dépassent Fable 5

Ne manquez pas l'actualité !
Faites de Teknoblog votre source préférée dans la recherche Google et consultez-nous plus souvent dans Top News.

Anthropique, Claude Fable 5.1 et Claude Mythe 5.1 a présenté ses modèles pour le travail de codage et d'information le 1er septembre. Fable 5.1 dans les tests Terminal-Bench-Science 0.1 52,6 pour cent tandis que Fable 5 est resté à 24,7 pour cent. En revanche, si Anthropic met Fable 5.1 à la disposition du grand public, il limite l'accès à Mythos 5.1 aux organisations agréées. Les deux modèles utilisent le même modèle de base, mais Anthropic implémente des contraintes de sécurité différentes dans les domaines de la cybersécurité et des sciences de la vie.

D’après les résultats partagés par Anthropic Claude Fable 5.1Il obtient un score de 55,8 % au test de codage Terminal-Bench 4.0. Fable 5 obtient un score de 42,0 pour cent dans le même test, tandis que Opus 5 enregistre 52,3 pour cent et GPT-5.6 Sol enregistre 37,3 pour cent. En revanche, Mythos 5.1, qui utilise moins de restrictions de sécurité, a été testé dans le test Terminal Bench 4.0. 60,9 pour cent arrive à la conclusion. Anthropic précise que la différence entre les deux modèles est due au fait que les systèmes de sécurité interfèrent avec certaines tâches de cybersécurité.

De plus, CursorBench 3.2.0 affiche un succès de codage de 73,4 % pour Fable 5.1. Dans le même test, Fable 5 donne un résultat de 70,5 pour cent, Opus 5 donne un résultat de 70,0 pour cent et GPT-5.6 Sol donne un résultat de 67,2 pour cent. Du côté d'AutomationBench, Fable 5.1 a atteint 31,4 pour cent, tandis que le précédent Fable 5 est resté à 17,1 pour cent. Lors du dernier examen de l'humanité, la Fable 5.1 sans conduite a obtenu un score de 60,9 pour cent, tandis que la version avec conduite 65,0 pour cent prend. Anthropic rapporte également qu'avec des réglages d'effort faibles et moyens, Fable 5.1 fournit des résultats similaires ou supérieurs à ceux de son prédécesseur à un coût inférieur.

Claude Fable 5.1aux développeurs Fenêtre contextuelle de 1 million de jetons et prend en charge la génération de jusqu'à 128 000 jetons en une seule requête. Anthropic facture 10 $ pour un million de jetons d'entrée et 50 $ pour un million de jetons de sortie. D’autre part, la société a réduit les frais de lecture du cache de 75 % par million de jetons. pour 0,25 $ téléchargement. Anthropic estime que ce changement permettra d'économiser environ 25 % sur les charges de travail standard et environ 45 % sur l'utilisation intensive des agents. La société maintient les frais de base des jetons d’entrée et de sortie au même niveau que Fable 5.

Claude Fable 5.1 élargit l'espace de travail sur les missions de longue durée

Fable 5.1 peut continuer à fonctionner sur différentes applications et outils pour des tâches de plusieurs heures. Le modèle peut développer des fonctionnalités qui couvrent l'ensemble de la base de code, écrire ses propres tests et enquêter sur les causes profondes des problèmes logiciels. Il compare également les résultats qu'il prépare en utilisant des entrées visuelles avec la cible ou la conception donnée. De plus, les tâches d'agent géré sur Claude Cowork, le navigateur et la Plateforme Claude permettent au modèle de fonctionner longtemps sans intervention humaine. MongoDB a publié Fable 5.1 sur un prototype complexe lors d'un accès anticipé. trois jours Il déclare mener des travaux de recherche et développement.

Du côté de la recherche scientifique, Anthropic a testé Fable 5.1 et Mythos 5.1 dans des domaines allant de la conception moléculaire à la cartographie planétaire. Mythos 5.1 a testé des études de conception de protéines sur 12 cibles avec env. Taux de liaison valide de 50 pour cent atteint. De plus, le modèle a atteint une affinité de liaison pour trois cibles environ 10 fois supérieure à celle des meilleurs modèles des concours Adaptyv Bio. De plus, Mythos 5.1 améliore la vitesse de fonctionnement en écrivant des cœurs GPU spéciaux pour sept modèles d'apprentissage profond open source. jusqu'à 2,5 fois augmenté. Anthropic note que ces optimisations ont réduit les coûts estimés du GPU de 30 à 60 % dans certaines analyses à l'échelle du génome.

Fable 5.1, quant à lui, a préparé une nouvelle carte d'élévation d'environ un tiers de Vénus à l'aide d'images radar de la mission Magellan de la NASA. Le modèle a traité des données radar collectées il y a plus de 30 ans ainsi que des mesures d'élévation existantes. La nouvelle carte réduit ainsi le niveau de détail précédent de 10 à 20 kilomètres à une portée d'environ 2 à 3 kilomètres. Anthropic explique également que la nouvelle carte offre une précision jusqu'à 25 % supérieure sur certaines mesures d'altitude par rapport aux données précédentes. La société met la carte à la disposition des chercheurs sous licence Creative Commons avant les missions NASA VERITAS et ESA EnVision.

Côté sécurité, Anthropic travaille sur le code source de Fable 5.1 trouver des vulnérabilités logicielles Tout en le permettant, il limite certaines opérations de cybersécurité. Le modèle n'utilise pas le même niveau d'autorité pour des tâches telles que les tests d'intrusion, le développement d'exploits et l'analyse des vulnérabilités qui reposent sur des fichiers binaires. En revanche, Anthropic affirme que les nouveaux filtres de cybersécurité empêchent les fausses interventions par rapport au système précédent. réduit de 60 pour cent explique. Les filtres côté biologie interfèrent également 85 % moins avec les requêtes inoffensives par rapport au système de sécurité de la première version de Fable 5. Pour certaines questions à double usage de biologie et de chimie, le système dirige la requête vers les modèles Opus.

Bien que Mythos 5.1 utilise le même modèle de base, il donne accès à des capacités plus larges aux chercheurs en cybersécurité et en sciences de la vie. C'est pourquoi Anthropic ne rend Mythos 5.1 disponible que via des programmes d'accès sécurisés aux organisations qui ont réussi le processus d'examen. La société lance également un programme bêta sur invitation destiné aux chercheurs en sciences de la vie, appelé Life Sciences Verification Program. Le programme de cybervérification donne accès à des études défensives sur la cybersécurité avec des restrictions moindres et ajoutera la prise en charge de Mythos à l'avenir. Les prix du Mythos 5.1 commencent également à 10 $ pour un million de jetons d'entrée et à 50 $ pour un million de jetons de sortie.

Fable 5.1 est accessible aux abonnés Pro, Max, Team et Enterprise via les applications web, mobiles et de bureau de Claude. De plus, le modèle fonctionne dans les outils de développement sur Claude Code, Cowork et Claude Platform. Développeurs ClaudeAPIpeut accéder à Fable 5.1 via Amazon Web Services, Google Cloud et Microsoft Foundry. Modèle côté API claude-fable-5-1 et Anthropic propose la fenêtre contextuelle d'un million de jetons comme capacité par défaut. Alors qu'Anthropic décrit Fable 5.1 comme le modèle Claude le plus performant en usage général, Mythos 5.1 limite son accès aux organisations vérifiées.