Anthropic прадставіла Fable 5.1 і Mythos 5.1 — новыя мадэлі для кодынгу
Кампанія прадставіла Claude Fable 5.1 і Mythos 5.1 — новыя версіі мадэлі для праграмавання, агентных і навуковых задач. Fable даступная ўсім, а Mythos — толькі правераным партнёрам.
Кампанія прадставіла Claude Fable 5.1 і Mythos 5.1 — новыя версіі мадэлі для праграмавання, агентных і навуковых задач. Fable даступная ўсім, а Mythos — толькі правераным партнёрам.
Адна з галоўных змен датычыць кошту працы ШІ-агентаў з вялікім пастаянным кантэкстам. Цана чытання дадзеных з кэша для Fable знізілася з $1 да $0,25 за мільён токенаў — на 75%. Базавыя цэны пры гэтым не змяніліся: $10 за мільён уваходных і $50 за мільён выходных токенаў.
Гэта асабліва важна для агентаў, якія гадзінамі працуюць з адным рэпазіторыем, наборам дакументаў або гісторыяй дыялогу і пастаянна звяртаюцца да ўжо загружанай інфармацыі. Паводле ацэнкі Anthropic, новая цана кэша можа знізіць фактычны кошт Fable прыкладна на 25% пры тыповых сцэнарыях і да 45% пры асабліва інтэнсіўнай агентнай працы.
Кампанія таксама заяўляе, што ўдасканаліла абарончыя механізмы. У Claude Code яны цяпер умешваюцца прыкладна на 60% радзей, чым у Fable 5, пры гэтым Anthropic працягвае абмяжоўваць генерацыю эксплойтаў, некаторыя віды пентэсцінгу ды іншыя патэнцыйна небяспечныя дзеянні.
Паводле ўласных тэстаў Anthropic, Fable 5.1 прыкметна палепшылася ў працяглых задачах. У Terminal-Bench 4.0 мадэль атрымала 55,8% супраць 42% у Fable 5, а Mythos 5.1 з менш строгімі кіберабмежаваннямі — 60,9%. У навуковым Terminal-Bench-Science вынік Fable вырас з 24,7% да 52,6%. Гэтыя паказчыкі апублікаваны самой Anthropic і не з’яўляюцца незалежнай ацэнкай.
Кампанія прыводзіць і прыклады ад ранніх карыстальнікаў. У Ramp мадэль без умяшання чалавека выконвала адну ML-задачу 38 гадзін, самастойна перагледзела першапачатковы вынік і запусціла шэсць дадатковых эксперыментаў. Millennium сцвярджае, што Fable 5.1 змагла знайсці прычыну рэдкага праграмнага збою, якую не ўдавалася ўстанавіць чатыры–пяць гадоў.
Адначасова Anthropic прадставіла Enterprise Frontier Safeguards (EFS) — сістэму для кампаній, якім важна не перадаваць дадзеныя маніторынгу самой Anthropic. Логі ды іншая інфармацыя змогуць захоўвацца ў інфраструктуры кліента ў AWS, Azure або Google Cloud, а аўтаматычныя сістэмы Anthropic будуць шукаць у іх прыкметы небяспечнага выкарыстання. Разгортванне EFS пачнецца ўвосень.
Моё субьективное мнение после недолгой, но плотной работы с fable 5.1 - окно контекста стало несколько меньше, чем у fable 5. Остальное вроде норм, агентами хорошо управляет.
Рекомендую резюме в Anthropic закинуть - не сомневаюсь, что им пригодятся эксперты, способные за несоколько часов "плотной работы" с моделью вынести о ней вердикт.
Рэлацыраваліся? Цяпер вы можаце каментаваць без верыфікацыі акаўнта.
Моё субьективное мнение после недолгой, но плотной работы с fable 5.1 - окно контекста стало несколько меньше, чем у fable 5. Остальное вроде норм, агентами хорошо управляет.
Рекомендую резюме в Anthropic закинуть - не сомневаюсь, что им пригодятся эксперты, способные за несоколько часов "плотной работы" с моделью вынести о ней вердикт.