Comment fonctionnent les mécanismes de sécurité de Claude Fable 5 (Routage expliqué)

Comment Claude Fable 5 protège les requêtes sensibles acheminées vers Opus 4.8 : les classificateurs, les trois zones protégées, et ce que la solution de repli signifie pour votre application.

INEZA Felin-Michel

INEZA Felin-Michel

10 June 2026

Comment fonctionnent les mécanismes de sécurité de Claude Fable 5 (Routage expliqué)

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Si vous avez commencé à développer avec Claude Fable 5 et que vous avez remarqué qu'une poignée de requêtes se comportent différemment des autres, vous voyez les mesures de protection de Claude Fable 5 en action. Fable 5 a été lancé le 9 juin 2026 avec l'identifiant de modèle claude-fable-5, et il est livré avec une couche de routage de sécurité intégrée car c'est un modèle de classe Mythos conçu pour être sûr pour une utilisation générale. Le mécanisme est simple une fois que vous le comprenez : des classificateurs surveillent les requêtes dans quelques domaines sensibles, et lorsqu'une est détectée, la requête est traitée par Claude Opus 4.8 au lieu du modèle Fable 5 complet. Cela se produit dans moins de 5 % des sessions en moyenne, donc la plupart des développeurs le rencontrent rarement. Cet article explique comment fonctionne le routage de sécurité, les sujets qu'il couvre, ce que cela implique en pratique, et pourquoi Anthropic a choisi de router plutôt que de refuser.

En bref

Claude Fable 5 exécute des classificateurs qui détectent les requêtes dans trois domaines sensibles et les redirigent vers Claude Opus 4.8 au lieu du modèle Fable 5 complet. Les mesures de protection se déclenchent dans moins de 5 % des sessions en moyenne. Les trois domaines protégés sont la cybersécurité, la biologie et la chimie, et la distillation de modèles. Vous ne configurez rien, et la tarification reste inchangée.

Ce que font les mesures de protection

L'idée fondamentale derrière les mesures de protection de Claude Fable 5 est une décision de routage, et non un filtre général. Chaque requête que vous envoyez à claude-fable-5 passe par un ensemble de classificateurs. Ces classificateurs examinent la requête et décident si elle relève de l'une des catégories protégées. Pour l'écrasante majorité des requêtes, la réponse est non, et la requête est traitée par le modèle Fable 5 complet exactement comme vous l'attendriez.

Lorsqu'un classificateur signale une requête comme sensible, celle-ci n'est pas rejetée purement et simplement. Au lieu de cela, elle est redirigée vers Claude Opus 4.8, qui répond à la requête à la place de Fable 5. Du point de vue de votre application, la réponse revient toujours via le même appel API et le même identifiant de modèle. La différence est que le modèle sous-jacent qui a généré la réponse était Opus 4.8 plutôt que le modèle Fable 5 complet. Cette distinction est importante car les deux modèles peuvent produire des résultats différents et se comporter différemment sur les sujets où la redirection s'applique.

Il est important de le répéter car c'est le cœur de la conception. Fable 5 est un modèle de classe Mythos, ce qui signifie qu'il se situe à l'extrémité supérieure des capacités de la gamme d'Anthropic. Rendre un modèle aussi performant sûr pour une utilisation publique générale signifie mettre en place des garde-fous autour de l'ensemble restreint de capacités qui présentent le plus de risques. Plutôt que d'essayer de faire en sorte que Fable 5 refuse lui-même ces requêtes, Anthropic a construit une couche qui les redirige discrètement vers un modèle dont le comportement sur ces sujets est bien compris et considéré comme sûr à exposer largement. Si vous souhaitez en savoir plus sur la classe de modèle elle-même, consultez l'explication sur ce qu'est un modèle de classe Mythos.

Le routage est automatique et se déroule du côté d'Anthropic. Il n'y a pas de paramètre à passer, pas d'en-tête à définir, et pas de drapeau dans votre requête pour l'activer ou le désactiver. Les classificateurs s'exécutent sur chaque session, et la redirection ne s'engage que lorsqu'un d'entre eux se déclenche.

Les trois domaines protégés

Les mesures de protection de Claude Fable 5 couvrent trois catégories. Chacune est un domaine où un modèle très performant pourrait significativement abaisser la barrière à la production de dommages, donc chacune est protégée. Les descriptions ci-dessous couvrent ce qui est protégé, et non comment faire quoi que ce soit dans ces domaines.

Cybersécurité

Le premier domaine protégé est la cybersécurité offensive. Cela couvre des choses comme le développement d'exploits, les tâches cyberoffensives et les flux de travail de piratage agentique où un modèle serait sollicité pour mener à bien ou accélérer une attaque. Lorsque les classificateurs détectent une requête de ce type, la requête est redirigée vers Opus 4.8.

Les mesures de protection de la cybersécurité sont conçues pour empêcher Fable 5 de progresser sur les tâches d'évaluation cybernétique qui mesurent la capacité offensive. Un partenaire externe qui a testé le modèle a trouvé que les mesures de protection de Fable 5 contre les requêtes cybernétiques nuisibles étaient parmi les plus « robustes » qu'ils aient testées, selon les propres termes de la source. Le cadre ici est défensif : l'objectif est d'empêcher le modèle de faire avancer le travail d'un attaquant, tout en laissant les questions de sécurité ordinaires, le travail défensif et le matériel éducatif inchangés.

Biologie et chimie

Le deuxième domaine protégé couvre les requêtes en biologie et chimie qui touchent aux capacités les plus dangereuses dans ces domaines. Les exemples incluent la conception d'AAV et les requêtes liées aux armes biologiques. Comme pour la cybersécurité, lorsqu'un classificateur signale l'une de ces requêtes, la réponse provient d'Opus 4.8 plutôt que du modèle Fable 5 complet.

L'intention est de maintenir les capacités les plus risquées en biologie et en chimie derrière un garde-fou tout en laissant la grande majorité des questions scientifiques, médicales et éducatives dans cet espace intactes. La plupart des développeurs qui créent des outils de biologie ou de chimie ne rencontreront jamais la redirection, car la barrière vise un créneau étroit de contenu véritablement dangereux.

Distillation

Le troisième domaine protégé est la distillation de modèles. Cela couvre les tentatives d'extraction du modèle afin d'entraîner des modèles concurrents, par exemple en le sondant systématiquement pour capturer son comportement et le reproduire ailleurs. Les requêtes qui ressemblent à des tentatives de distillation sont acheminées vers Opus 4.8 de la même manière que les requêtes cyber et bio.

La distillation est différente des deux autres domaines. Il ne s'agit pas de prévenir des dommages physiques réels, mais de protéger le modèle lui-même contre la copie. Mais le mécanisme de routage est identique, ce qui maintient la simplicité du système global : une couche de classificateurs, une cible de repli, trois catégories.

À quelle fréquence cela se déclenche et ce que cela implique en pratique

Le chiffre clé est que les mesures de protection de Claude Fable 5 se déclenchent dans moins de 5 % des sessions en moyenne. Pour la plupart des applications, cela signifie que le repli est un événement rare plutôt qu'une présence constante. Si vous construisez un assistant de codage à usage général, un outil d'écriture, un bot de support client ou la plupart des autres produits courants, vous pourriez passer longtemps sans jamais le rencontrer.

Que se passe-t-il lorsque cela arrive ? De l'extérieur, très peu de choses changent. Votre appel API réussit, vous obtenez une réponse, et la réponse est cohérente et pertinente. Ce que vous ne pouvez pas voir directement, c'est que la réponse a été générée par Opus 4.8 plutôt que par le modèle Fable 5 complet. Parce que les deux modèles sont différents, la sortie sur ces sujets spécifiques peut différer en ton, en profondeur ou en approche de ce que Fable 5 aurait produit.

En pratique, cela signifie plusieurs choses pour la façon dont vous observez le système :

Si votre produit ne touche jamais à la cybersécurité, à la biologie, à la chimie, ou à quoi que ce soit qui ressemble à de l'extraction de modèle, vous ne remarquerez probablement jamais les mesures de protection. Si votre produit évolue dans l'un de ces domaines, le repli fera plus régulièrement partie de votre expérience, et il est bon d'en tenir compte dans votre conception. Une façon pratique de le constater par vous-même est d'envoyer une série de prompts via l'API et d'observer ceux qui se comportent différemment. Lorsque vous testez l'API Fable 5 dans un outil comme Apidog, vous pouvez enregistrer une collection de prompts et les exécuter à plusieurs reprises pour repérer les catégories qui déclenchent le repli.

Pourquoi router au lieu de refuser

Une question naturelle est de savoir pourquoi Anthropic a construit une couche de routage au lieu de simplement faire en sorte que Fable 5 refuse les requêtes sensibles comme le font de nombreux modèles. La réponse réside dans l'objectif de conception d'une capacité avec sécurité.

Un refus est une impasse. L'utilisateur demande quelque chose, le modèle refuse, et l'interaction s'arrête. C'est le bon résultat pour les requêtes véritablement malveillantes, mais c'est un instrument brutal. De nombreuses requêtes qui touchent à un domaine sensible sont légitimes : un chercheur en sécurité posant une question défensive, un étudiant étudiant un sujet de biologie, un développeur déboguant quelque chose qui semble hostile à un classificateur. Un refus catégorique traite tous ces cas de la même manière et produit une expérience frustrante pour les personnes qui font un travail légitime.

Le routage vers Opus 4.8 est une réponse plus douce. Au lieu de refuser, le système transmet la requête à un modèle dont le comportement dans ces domaines est bien compris et considéré comme sûr à exposer au public. L'utilisateur obtient toujours une réponse ; elle provient simplement d'un modèle avec un profil de capacités différent sur cet ensemble restreint de sujets. Cela permet à Fable 5 de rester largement utile à pleine capacité pour tout ce qui se trouve en dehors des zones protégées, tout en garantissant que les capacités les plus risquées ne sont pas disponibles à pleine puissance pour le grand public.

Le cas de la cybersécurité illustre clairement le cadre. Le but de la protection n'est pas de bloquer le travail de sécurité en général, mais d'empêcher le modèle de progresser sur les tâches cyberoffensives. La sécurité défensive, l'éducation et les questions d'ingénierie ordinaires sont censées passer normalement. Le partenaire externe ayant constaté que les mesures de protection de Fable 5 contre les requêtes cybernétiques nuisibles étaient parmi les plus "robustes" qu'ils aient testées témoigne de la solidité de cette frontière défensive. Anthropic publie plus d'informations sur son approche générale sur sa page sur la sécurité et le déploiement responsable, et les détails de lancement des deux modèles se trouvent dans l'annonce de Fable 5 et Mythos 5.

Fable 5 vs Mythos 5 sur les mesures de protection

Fable 5 a un équivalent appelé Claude Mythos 5. Mythos 5 est le même modèle sous-jacent avec des mesures de protection levées dans certains domaines. Ce n'est pas une architecture différente ou un système plus performant au sens général ; c'est Fable 5 sans une partie du routage qui assure la sécurité de la version publique.

Parce que la levée de ces mesures de protection modifie le profil de risque, Mythos 5 n'est pas public. L'accès est restreint aux partenaires du Projet Glasswing, qui incluent des cyberdéfenseurs et des fournisseurs d'infrastructures, ainsi que des chercheurs en biologie sélectionnés. Ce sont des organisations et des individus dont le travail nécessite véritablement les capacités illimitées et qui opèrent sous une surveillance appropriée. Pour une comparaison côte à côte des deux modèles, consultez Fable 5 vs Mythos 5.

Le principal enseignement pratique pour la plupart des développeurs est court : vous construisez sur Fable 5, les mesures de protection en font partie, et il n'y a pas de voie publique vers la version illimitée. Si votre travail relève de l'une des catégories de partenaires, le chemin vers Mythos 5 passe par le Projet Glasswing, et non par un drapeau d'API.

Ce que cela signifie pour votre application

Pour l'application typique, les mesures de protection de Claude Fable 5 ne vous demandent rien. Il n'y a pas d'étape de configuration, pas d'interrupteur à régler, et aucune gestion spéciale à ajouter à votre code de requête. Les classificateurs et le repli résident entièrement du côté d'Anthropic. Vous appelez l'API avec l'identifiant de modèle claude-fable-5, et le routage se fait de manière transparente.

La principale chose à intégrer est qu'une petite fraction de vos requêtes peut être traitée par Opus 4.8 plutôt que Fable 5, et que cela peut affecter les sorties et le comportement sur les sujets protégés. Si votre produit touche à la cybersécurité, la biologie, la chimie, ou quoi que ce soit qui ressemble à de l'extraction de modèle, prévoyez le repli comme une partie normale de l'expérience plutôt qu'un cas limite. Pour tous les autres, c'est assez rare pour que cela nécessite rarement une attention particulière.

Quelques points concrets à garder à l'esprit :

Puisque la réponse revient par le même appel et le même identifiant de modèle, vous ne pouvez pas toujours dire à partir d'une seule réponse quel modèle l'a générée. C'est voulu et cela convient à la plupart des cas d'utilisation. Si vous avez besoin de comprendre précisément la limite de comportement, l'approche la plus fiable est de construire une suite de tests qui exerce les bords des trois zones protégées et d'observer directement les différences. Le guide d'utilisation de l'API Opus 4.8 est une référence utile, puisque Opus 4.8 est le modèle vers lequel vos requêtes sur des sujets sensibles sont redirigées.

La version courte est que les mesures de protection de Claude Fable 5 sont une couche de routage discrète et automatique qui envoie une petite partie des requêtes sensibles à Opus 4.8, laissant tout le reste à la pleine capacité de Fable 5 sans configuration et sans modification de votre coût. Si vous développez dans la cybersécurité, la biologie, la chimie, ou tout ce qui est lié à l'extraction de modèle, votre prochaine étape est de préparer un petit ensemble de prompts de test, de les exécuter via l'API, et d'observer comment les zones protégées se comportent afin que votre application soit prête pour le repli. Pour un contexte plus large sur la famille de modèles, commencez par ce qu'est Claude Fable 5 et la vue d'ensemble des modèles, puis passez à son intégration dans votre pile avec le guide de l'API Fable 5. Lorsque vous êtes prêt à tester, Apidog vous offre un endroit pour exécuter et comparer ces prompts.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API