Aller au contenu

Le média des artisans du web dimanche 6 septembre 2026

IA pour le web

Fable 5.1 : Anthropic divise par quatre le coût des lectures de cache

Anthropic a publié le 1er septembre 2026 Fable 5.1, doté d'un contexte d'un million de tokens et d'une baisse de 75 % du prix des lectures de cache. Pour les équipes qui exploitent des agents en boucle, c'est le coût d'un run…

Couverture Fable 5.1 - baisse du coût des lectures de cache

Anthropic a publié le 1er septembre 2026 Fable 5.1, décliné en une version grand public et une version Mythos 5.1 réservée à des programmes d’accès restreint. Le modèle conserve le tarif de base de Fable 5 mais divise par quatre le prix des lectures de cache. Pour les équipes qui font tourner des agents en boucle, c’est le coût d’exécution d’un run qui bouge, davantage que le score sur les bancs d’essai.

Ce qui change au 1er septembre

Fable 5.1 arrive avec une fenêtre de contexte d’un million de tokens par défaut et une sortie maximale de 128 000 tokens. La réflexion adaptative est active en permanence, et le modèle est disponible immédiatement sous l’identifiant claude-fable-5-1 sur l’API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry. Fable 5.1 et Mythos 5.1 désignent le même modèle sous-jacent : la première est la version généralement disponible, avec les garde-fous de production, la seconde reste ouverte à des organisations vérifiées dans la cybersécurité et les sciences du vivant.

Le positionnement rejoint celui déjà observé sur la gamme, où le tarif d’introduction de Claude Sonnet 5 est devenu permanent : Anthropic ajuste désormais la grille tarifaire aussi souvent que les capacités.

Le cache, nerf de la guerre des agents

Un agent qui travaille sur une base de code, un dossier client ou un long fil de conversation relit à chaque tour un contexte stable : instructions système, définitions d’outils, fichiers de référence. Sans cache, ce contexte est refacturé au prix plein de l’entrée à chaque appel. Le prompt caching mémorise ces blocs côté serveur et les rejoue à tarif réduit, à condition de marquer les segments réutilisables.

C’est précisément ce poste que Fable 5.1 allège. La lecture de cache passe de 1,00 $ à 0,25 $ par million de tokens, soit 0,025 fois le prix de l’entrée de base. Anthropic chiffre l’effet à environ 25 % d’économie sur une charge classique, et jusqu’à 45 % sur un usage agentique, où la part relue domine la facture. Le même raisonnement structurait déjà les retours de terrain sur les agents éditoriaux en production : le poste de dépense n’est pas la génération, c’est la relecture.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-fable-5-1",
    "max_tokens": 1024,
    "system": [
      {
        "type": "text",
        "text": "Contexte stable : specs, outils, base de code...",
        "cache_control": { "type": "ephemeral" }
      }
    ],
    "messages": [
      { "role": "user", "content": "Question du tour courant" }
    ]
  }'

Le bloc marqué cache_control est facturé au prix d’écriture lors du premier appel, puis en lecture (désormais 0,25 $ par million) sur chaque tour suivant tant qu’il reste inchangé. Plus la boucle est longue et le contexte lourd, plus la baisse compte.

Ce que disent les chiffres bruts

La grille de base ne bouge pas : l’entrée reste à 10 $ et la sortie à 50 $ par million de tokens. Seule la lecture de cache est révisée.

PostePrix par million de tokens
Entrée10 $
Sortie50 $
Lecture de cache (Fable 5)1,00 $
Lecture de cache (Fable 5.1)0,25 $

Côté capacités, Anthropic met en avant un score de 52,6 % sur Terminal-Bench-Science 0.1, contre 24,7 % pour Fable 5 et 29,0 % pour Opus 5. Le gain revendiqué est net, mais il porte sur un banc d’essai maison, orienté résolution de problèmes scientifiques en terminal.

ModèleTerminal-Bench-Science 0.1
Fable 524,7 %
Opus 529,0 %
Fable 5.152,6 %

Sur un usage agentique, la lecture de cache à 0,25 $ par million de tokens pèse plus lourd dans la facture qu’un point de benchmark.

Point de vigilance. Le score de 52,6 % provient d’un banc d’essai publié par l’éditeur, et la réflexion adaptative permanente peut gonfler le nombre de tokens de sortie, facturés au prix plein. L’économie annoncée dépend de la part réellement mise en cache : une mesure sur la charge de production reste indispensable avant de généraliser un modèle à toute une flotte d’agents.

Ce qu’il faut retenir

Fable 5.1 ne change pas le prix d’entrée ni de sortie ; il rend la relecture de contexte quatre fois moins chère. Pour un site vitrine qui appelle un modèle de temps en temps, l’effet est marginal. Pour une équipe qui exploite des agents à contexte long et à boucles nombreuses, la baisse déplace le seuil de rentabilité et rend viables des architectures jusque-là trop coûteuses.

Sur mes propres pipelines d’agents, la lecture de cache représentait déjà plus de la moitié de la note mensuelle : je regarde donc cette baisse avec un intérêt très concret, mais je me méfie des chiffres d’économie « jusqu’à 45 % ». Ils supposent une discipline de cache que peu d’équipes tiennent vraiment. Avant de migrer une flotte entière, je mesure le taux de cache hit réel sur une semaine de trafic ; c’est lui qui décide, pas la fiche produit. — Simon Janvier

Pour aller plus loin

Détail des modèles et de la grille tarifaire sur la source primaire : newsroom d’Anthropic.

Partager LinkedIn Bluesky Hacker News E-mail

À lire aussi