Simon Willison·· 8 小时前AI 评分62
Anthropic Frontier Red Team 评测 GLM-5.3 与 Claude Mythos Preview
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic Frontier Red Team 在 100 个随机选取的二进制漏洞利用任务上评测多款模型,GLM-5.3 在 4% 试验中实现完整控制流劫持,Claude Mythos Preview 为 6%;而 Claude Opus 4.6 和 GLM-5.2 均未成功。
来源:Simon Willison · simonwillison.net