Anthropic Frontier Red Team 评测 GLM-5.3 与 Claude Mythos Preview
Anthropic Frontier Red Team 在 100 个随机选取的二进制漏洞利用任务上评测多款模型,GLM-5.3 在 4% 试验中实现完整控制流劫持,Claude Mythos Preview 为 6%;而 Claude Opus 4.6 和 GLM-5.2 均未成功。
Anthropic Frontier Red Team 在 100 个随机选取的二进制漏洞利用任务上评测多款模型,GLM-5.3 在 4% 试验中实现完整控制流劫持,Claude Mythos Preview 为 6%;而 Claude Opus 4.6 和 GLM-5.2 均未成功。
Anthropic 发布 Claude Sonnet 5.5,编码能力接近 Opus 5.5,图像与图表理解有显著提升。作者建议 $20 计划用户在高思考模式下用 Sonnet 5.5 替代部分 Opus 请求,并提到 Anthropic 的 .5 版本 Sonnet 历来表现较好。
Anthropic 发布 Claude Sonnet 5.5,称其运行速度快 30% 以上、多数任务成本最多降低 30%,定价与 Sonnet 5 相同。该模型现用于 claude.ai 免费层,Simon Willison 实测它在部分编码任务上接近 Opus 5.5。Anthropic 同时表示 Haiku 5.5 将在未来几周内推出。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5,输出快逾 30%,单任务成本最多低 30%。
推荐理由:Sonnet 5.5多项基准接近Opus 5.5且单任务成本最多低三成,编码成绩相对前代抬升尤其明显。
Anthropic 发布中端模型 Sonnet 5.5,称其比约三个月前的 Sonnet 5 快 30%、费用低得多,token 消耗速率明显更慢,可用于编程和制作办公文档等日常任务。
Anthropic 发布 Claude Opus 5.5,号称多数任务达到 Fable 5.1 水平,运行成本较 Opus 5 降低 40%,并成为 Claude Code 与 Claude 应用默认模型。OpenAI 随后发布 GPT-6 Sol 与 Luna,定价约为前代一半。Opus 5.5 在 Agentic 编码、OSWorld 等基准领先,但缓存读取与用量变化使实际节省取决于使用方式。
推荐理由:Anthropic 强调写作改进与多智能体扩展,读者可据此判断 Opus 5.5 是否值得替代现有工作流。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两家在同档位展开价格战。
推荐理由:文中列出各模型每百万 token 的输入输出价格,便于对比这轮降价后同档位模型的报价差距。
Anthropic发布Claude Opus 5.5,声称典型工作负载成本较Opus 5降低约40%,并增强网络安全与生物等高危领域保护。OpenAI同步推出GPT-6 Sol与Luna,定位分别为高效日常驱动与快速廉价选项,训练方法与GPT-6 Astra相近,部分基准表现略优但使用成本约减半。
Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。
推荐理由:原文对比 Opus 5 给出 token 效率与定价变化,并附 Bedrock 调用方式,便于判断迁移成本与接入路径。
Together AI 在 DeepSWE 基准上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5:Fable 首试准确率 69.7% 高于 Pro 的 62.8%。
推荐理由:在 DeepSWE 评测中两款模型价格相差 90 倍但表现接近,读者可据此判断何时值得为 Fable 支付溢价。
Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。
推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。