跳到正文
原文
Simon Willison·· 8 小时前AI 评分62

Anthropic Frontier Red Team 评测 GLM-5.3 与 Claude Mythos Preview

Quoting Anthropic Frontier Red Team

AI 导读

Anthropic Frontier Red Team 在 100 个随机选取的二进制漏洞利用任务上评测多款模型,GLM-5.3 在 4% 试验中实现完整控制流劫持,Claude Mythos Preview 为 6%;而 Claude Opus 4.6 和 GLM-5.2 均未成功。

来源:Simon Willison · simonwillison.net