跳到正文

#编码

今日 4 条
今天9月30日周三
  1. AWS Machine Learning Blog59

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用,为智能体工作流带来接近 Astra 的推理能力

    GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。

  2. Digital Trends · AI82

    OpenAI 发布 GPT-6.1 Sol,编码与科学推理接近 Astra 但成本约五分之一

    OpenAI 在撤回 GPT-6.1 Astra 后发布 GPT-6.1 Sol,宣称在编码、计算机使用、专业与科学任务上接近 Astra。DeepSWE 上 Sol 匹配 Astra 且成本约五分之一,OSWorld 2.0 离线集接近 Astra,Terminal-Bench Science 0.1 得分翻倍但 Astra 仍领先。

    推荐理由:原文给出具体测试分数与单价对比,读者可据此评估 Sol 在成本与能力之间是否值得替代 Astra。

9月29日周二
  1. Simon Willison62

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,称其运行速度快 30% 以上、多数任务成本最多降低 30%,定价与 Sonnet 5 相同。该模型现用于 claude.ai 免费层,Simon Willison 实测它在部分编码任务上接近 Opus 5.5。Anthropic 同时表示 Haiku 5.5 将在未来几周内推出。

9月3日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。

    推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。

8月15日周六
  1. Interconnects82

    GLM-5.3:Z.ai 发布新模型,参数更少但编码基准表现逼近前沿

    Z.ai 发布 GLM-5.3,目前仅在编码计划中可用,两周后开放权重并上线 Hugging Face。该模型在多个基准上超越 Kimi K3、Claude Fable 5 和 GPT-5.6-Sol,参数量仅约 750B,约为 Kimi K3 的三分之一。

    推荐理由:在参数规模明显更小的情况下,GLM-5.3 在智能体编码基准上逼近前沿,读者可借此观察中国实验室的训练策略与美国厂商的发布节奏差异。

8月14日周五
7月21日周二
7月17日周五
7月1日周三
5月22日周五
3月17日周二
  1. Mistral AI69

    Mistral AI 发布 Mistral Small 4

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/

    推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。

2月25日周三
12月9日周二
7月11日周五
  1. Mistral AI63

    Mistral AI 发布 Devstral Medium 与 Devstral Small 1.1 代码智能体模型

    Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。

    推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。