跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

15条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1–15 条 · 共 15 条
今天9月30日周三
  1. Digital Trends · AI82

    OpenAI 发布 GPT-6.1 Sol,编码与科学推理接近 Astra 但成本约五分之一

    OpenAI 在撤回 GPT-6.1 Astra 后发布 GPT-6.1 Sol,宣称在编码、计算机使用、专业与科学任务上接近 Astra。DeepSWE 上 Sol 匹配 Astra 且成本约五分之一,OSWorld 2.0 离线集接近 Astra,Terminal-Bench Science 0.1 得分翻倍但 Astra 仍领先。

    推荐理由:原文给出具体测试分数与单价对比,读者可据此评估 Sol 在成本与能力之间是否值得替代 Astra。

9月29日周二
9月3日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。

    推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。

7月27日周一
  1. Import AI87

    Epoch 与 METR 发布 MirrorCode 基准测试:AI 系统完成长达一周的编程任务

    Epoch 和 METR 发布 MirrorCode 基准,测试 AI 在仅通过 CLI 访问的情况下重新实现软件程序的能力。Opus 4.7 在 14 小时、$251 推理成本内完成了一个需人类 2-17 周的任务。25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100%。

    推荐理由:MirrorCode 显示 AI 已能自主重新实现大型软件项目,读者可借此评估当前模型在长程编程任务上的真实能力边界。

7月21日周二
5月28日周四
5月22日周五
  1. Mistral AI64

    Mistral Studio 发布 Connectors 支持内置与自定义 MCP

    Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。

    推荐理由:Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。

3月17日周二
  1. Mistral AI69

    Mistral AI 发布 Mistral Small 4

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/

    推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。

1月28日周三
  1. Mistral AI61

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。

    推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。

12月9日周二
7月30日周三
7月11日周五
  1. Mistral AI63

    Mistral AI 发布 Devstral Medium 与 Devstral Small 1.1 代码智能体模型

    Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。

    推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。

5月21日周三
  1. Mistral AI65

    Devstral:Mistral AI 发布开源智能体编程模型

    Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。

    推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。