AI · Field Notes
Den beste modellen vil ikke ta sikkerhetsgjennomgangen din
Jeg rettet den skarpeste modellen Anthropic lager mot koden min, på jakt etter sikkerhetshull. Den takket nei og ga jobben videre til den billigere - som fant en kjede av feil jeg ville vært stolt av å oppdage. Overleveringen er historien.

Jeg ba den mest kapable modellen Anthropic lager om å gå gjennom koden min for sikkerhetshull. Den takket høflig nei - og ga jobben videre til en mindre en. Den mindre modellen gikk gjennom koden og fant en kjede av feil jeg ville vært stolt av å ha oppdaget selv.
Her er utgangspunktet. Fable 5 er Anthropics flaggskip - den skarpeste, dyreste modellen de tilbyr. Opus 4.8 er hverdagens arbeidshest, den det meste av arbeidet mitt faktisk kjører på. Så jeg gjorde det opplagte og rettet det skarpeste verktøyet mot det vanskeligste problemet: en ekte sikkerhetsgjennomgang av en ekte kodebase. Det jeg fikk tilbake, var ikke akkurat et avslag. Det var en overlevering. Fable trakk seg tilbake, Opus trådte inn, og gjennomgangen kjørte på den billigere modellen uten at jeg ba om det.
Dette har et navn. Anthropic kaller det en safeguard reroute - en trygghetsstyrt omruting. Fable kjører klassifiserere over forespørselen din, og når den lander i et følsomt område med dobbel bruk - cybersikkerhet, biologi og kjemi, eller destillering (å trekke ut en modells evner for å trene en rival) - sender den i det stille forespørselen til Opus 4.8 i stedet. Du betaler ikke engang Fables tillegg for det. Den mest kapable modellen avslår ikke det farlig-nære arbeidet. Den delegerer det, nedover.
Kjenn på hvor bakvendt det føles. Jo skarpere verktøyet, jo mer låser de bladet - for en god sikkerhetsgjennomgang er ett tastetrykk unna en god angrepsplan, og den samme evnen som finner feilen din kan skrive utnyttelsen. Så Anthropic legger bånd på sin beste modell akkurat der rå kapasitet har mest dobbel bruk, og lar arbeidshesten bære den følsomme lasten. Jeg er ikke den eneste som la merke til at det er flaggskipet som er det innelukkede; en annen utvikler sa det rett ut denne uka - Opus 4.8 lot ham gå litt lenger enn Fable gjorde.
Og arbeidshesten leverte. Opus bare taklet ikke gjennomgangen - den fant den ekte varen, en kjede der én slapp sjekk slapp den neste gjennom, den typen funn jeg ville kalt Fable-nivå hvis du ikke hadde fortalt meg hvilken modell som lagde det. Noe som er spørsmålet jeg egentlig satt igjen med: hvis nedgraderingsmodellen gjør oppgraderingsarbeid, er Opus i det stille i ferd med å bli Fable?
Så vidt jeg kan se, nei. Opus er rett og slett sterk: Anthropic sier at mer enn 95 % av Fable-øktene aldri utløser et tilbakefall i det hele tatt, og Fable vinner fortsatt totalt sett. Gapet lukkes på vanlig vis, gjennom nye modeller - Opus 5 lekker allerede - ikke gjennom en stille utbytting. Og Fable selv er ikke på vei mot betal-per-bruk-eksil for alltid; Anthropic sier at målingen er midlertidig, tilbake til vanlige planer så snart kapasiteten tillater det.
Flaggskipet avslo jobben. Arbeidshesten gjorde den - og fant kjeden.

