Anthropic Frontier Red Team 评测 GLM-5.3 与 Claude Mythos Preview
Anthropic Frontier Red Team 在 100 个随机选取的二进制漏洞利用任务上评测多款模型,GLM-5.3 在 4% 试验中实现完整控制流劫持,Claude Mythos Preview 为 6%;而 Claude Opus 4.6 和 GLM-5.2 均未成功。
Anthropic Frontier Red Team 在 100 个随机选取的二进制漏洞利用任务上评测多款模型,GLM-5.3 在 4% 试验中实现完整控制流劫持,Claude Mythos Preview 为 6%;而 Claude Opus 4.6 和 GLM-5.2 均未成功。
Nathan Lambert与Florian Brand讨论了Kimi K3发布后的开源模型格局,包括GLM 5.2的持续角色、中国模型性能提升的资本与数据因素、蒸馏在RL阶段的作用争议,以及中美开放模型生态的基础设施差距。