跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 281–297 条 · 共 297 条
2月16日周一
  1. Ollama Blog60

    Ollama 在 Claude Code 中支持 Subagents 与网页搜索

    Ollama 在 Claude Code 中新增 Subagents 与网页搜索功能,无需 MCP 服务器或 API Key。Subagents 可并行执行文件搜索、代码探索和研究等任务;网页搜索内建于 Anthropic 兼容层,模型需要最新信息时由 Ollama 直接返回结果。推荐云端模型包括 minimax-m2.5、glm-5 与 kimi-k2.5。

    推荐理由:原文给出无需 MCP 与 API Key 的入口,读者可据此判断它能否降低 Claude Code 的接入成本。

1月28日周三
  1. Mistral AI61

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。

    推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。

1月16日周五
  1. Ollama Blog76

    Ollama 兼容 Anthropic API,Claude Code 可使用开源模型

    Ollama v0.14.0 起兼容 Anthropic Messages API,Claude Code 可通过 --model 指定本地模型(如 gpt-oss:20b、qwen3-coder)或云端模型(如 glm-4.7:cloud、minimax-m2.1:cloud)运行,并支持工具调用、流式对话、系统提示与视觉输入。

    推荐理由:Ollama 兼容 Anthropic API 后,Claude Code 可直连本地或云端开源模型,为开发者提供无需切换平台即可替换模型的选择。

1月8日周四
  1. Ethan Mollick · Notes77

    Claude Code 与下一代 AI 编码工具

    Ethan Mollick 用 Claude Code(Opus 4.5)自主开发并部署了一个卖 500 个提示词的网站,全程运行 1 小时 14 分钟。文中分析了自主纠错与 agentic harness 两项进展,并介绍紧凑上下文、技能(Skills)、子代理(subagents)和 MCP 等机制如何扩展 AI 能力。

    推荐理由:作者以亲身实验展示 Claude Code 的自主工作能力与上下文管理机制,为非程序员理解 AI 编码工具的现状与边界提供了可迁移的观察框架。

12月9日周二
12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

11月1日周六
  1. Berkeley AI Research62

    无需 TD 学习的强化学习:分治范式与 Transitive RL

    Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。

    推荐理由:提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。

10月28日周二
  1. Ollama Blog62

    MiniMax M2 上线 Ollama 云端

    MiniMax M2 在 Ollama 云端上线,主打编码与智能体工作流。Ollama 给出在 VS Code、Zed、Droid 等工具中的接入步骤,并提供云端 API 访问。

    推荐理由:原文给出模型能力变化与多工具接入入口,读者可据此判断它对现有开发工作流的影响。

7月30日周三
7月17日周四
  1. Mistral AI61

    Le Chat 新增深度研究、语音对话与项目管理功能

    Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。

    推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。

7月11日周五
  1. Mistral AI63

    Mistral AI 发布 Devstral Medium 与 Devstral Small 1.1 代码智能体模型

    Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。

    推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。

6月3日周二
  1. Ollama Blog67

    Minions:Ollama 与前沿模型的安全隐私协作协议

    Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。

    推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。

5月27日周二
  1. Mistral AI62

    Mistral 发布 Agents API

    Mistral 发布 Agents API,将语言模型与代码执行、网页搜索、图像生成及 MCP 工具等内置连接器结合,并提供持久记忆与多智能体编排能力。SimpleQA 上 Mistral Large 和 Medium 启用网页搜索后得分分别从 23%、22.08% 提升至 75%、82.32%。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

5月21日周三
  1. Mistral AI65

    Devstral:Mistral AI 发布开源智能体编程模型

    Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。

    推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。

4月10日周四
  1. Vector Institute67

    Vector Institute 发布 State of Evaluation 研究:全球11个AI模型经16项基准评估

    Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。

    推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。

3月25日周二
  1. Vector Institute62

    Vector Institute:利用大语言模型提升医学系统综述筛选效率

    Vector Applied Scientist David Emerson 等人提出通用提示模板 Abstract ScreenPrompt 和 ISO-ScreenPrompt,在 10 个临床领域的系统综述上实现 97.7% 加权灵敏度和 85.2% 加权特异性(摘要筛选),全文筛选达 96.5% 灵敏度和 91.2% 特异性。

    推荐理由:通用提示模板让大语言模型在系统综述筛选中达到高灵敏度与特异性,为自动化证据筛选提供了可迁移方法。

2月25日周二
  1. Ollama Blog74

    Minions:本地与云端大语言模型协同工作

    斯坦福 Hazy Research 团队发布 Minions 论文与开源代码,让本地小模型(如 Llama 3.2 via Ollama)与云端大模型(如 GPT-4o)协作,将大量 LLM 工作负载转移到消费设备。

    推荐理由:通过本地小模型与云端大模型协作的两套协议,在显著降低远程调用成本的同时保持较高性能。