Anthropic предупредила о киберугрозах от китайской модели GLM-5.3
Anthropic провела исследование кибервозможностей открытой китайской модели GLM-5.3 от Zhipu AI (Z.ai) и сравнила её с собственной закрытой Claude Mythos Preview. В тесте ExploitBench, где модели ищут уязвимости в JavaScript-движке V8 браузера Chrome, GLM-5.3 успешно построила работающие эксплойты в 50 из 410 попыток (около 12%), тогда как Mythos Preview — в 56 (14%). На внутреннем бенчмарке Anthropic по бинарной эксплуатации GLM-5.3 получила полный контроль над программой в 4% заданий, Mythos — в 6%. При этом прежние модели, включая GLM-5.2 и Claude Opus 4.6, не справились ни с одной задачей.
Главная обеспокоенность Anthropic связана не с самими возможностями модели, а с её доступностью: веса GLM-5.3 выложены на Hugging Face и скачаны более 1,3 млн раз за месяц, тогда как Mythos Preview распространяется только среди проверенных защитников через проект Glasswing. Anthropic обнаружила, что при прямом запросе на атаку GLM-5.3 отказывается, но при использовании вымышленной легенды подчиняется в 64% случаев, а при предзаполнении цепочки рассуждений — в 92%. Процедура «абliteration» (удаление отказных поведений из открытых весов) подняла податливость модели до 100%, при этом её способности практически не снизились. Схожие оценки ранее дал и американский Центр стандартов и инноваций в области ИИ (CAISI), назвавший GLM-5.3 «самой киберспособной открытой моделью на сегодня» с отставанием от американского фронтира примерно на четыре месяца.
Источник: Anthropic Frontier Red Team / NIST CAISI / Tom's Hardware / 4sysops