跳到正文

#Agent

今日 265 条
12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

11月19日周三
11月6日周四
  1. Jeremy Howard · fast.ai62

    Solveit 功能指南

    Solveit 是一个交互式开发平台,通过对话、代码和笔记混合的工作方式,让用户逐步构建并理解代码。平台支持实例管理、实时协作、AI 交互、代码执行、文件操作、托管部署和对话导出等功能。

11月1日周六
  1. Berkeley AI Research62

    无需 TD 学习的强化学习:分治范式与 Transitive RL

    Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。

    推荐理由:提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。

10月28日周二
  1. Ollama Blog62

    MiniMax M2 上线 Ollama 云端

    MiniMax M2 在 Ollama 云端上线,主打编码与智能体工作流。Ollama 给出在 VS Code、Zed、Droid 等工具中的接入步骤,并提供云端 API 访问。

    推荐理由:原文给出模型能力变化与多工具接入入口,读者可据此判断它对现有开发工作流的影响。

10月24日周五
10月15日周三
10月14日周二
10月1日周三
9月30日周二
  1. Ethan Mollick · Notes73

    Real AI Agents and Real Work

    Ethan Mollick 指出 AI 已能完成具有经济价值的真实任务,并以 Claude Sonnet 4.5 成功复现经济学论文研究结果为例,说明 AI 在学术复现中的潜力。OpenAI 新测试显示 AI 在专家级任务中接近人类,但主要短板是格式与指令遵循,而非幻觉。作者强调 AI 不会简单替代工作,而是改变任务构成,并提醒避免无思考地扩增内容。

9月12日周五
  1. Ethan Mollick · Notes48

    On Working with Wizards

    summary_zh: 作者以书中"co-intelligence"概念为起点,描述 AI 从协作伙伴转向"巫师式"输出工具的趋势。作者将书和 140 篇 One Useful Thing 文章输入 NotebookLM 并用新视频概览功能生成 AI 视频,核对后发现数据准确,但过程不透明。

8月12日周二
  1. Vector Institute46

    Vector Institute 研究人员亮相 ICLR 2025,71 篇论文涵盖表示学习与可信 AI

    Vector Institute 在 ICLR 2025 发表 71 篇被接收论文,覆盖神经架构、优化、理论及多模态 AI、科学发现与负责任机器学习。ACES 自动提取事件流数据集的队列并提升可复现性;AttriBoT 用缓存激活与层次归因实现 300 倍加速,使上下文归因比生成响应快 30 倍;行动抽象方法在熵寻求 RL 与 GFlowNets 中提升样本效率并发现可解释的高层动作。

8月9日周六
  1. Sebastian Raschka60

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 开源权重模型

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 两款开源权重模型,是自 GPT-2 以来首次开放大权重模型。模型采用 MoE、SwiGLU、GQA、滑动窗口注意力和 RMSNorm 等现代设计,并支持 MXFP4 量化以在单卡运行。两款模型均为推理模型,支持低/中/高推理强度调节,并在多个基准上接近 OpenAI 自有闭源模型。

7月30日周三
7月17日周四
  1. Mistral AI61

    Le Chat 新增深度研究、语音对话与项目管理功能

    Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。

    推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。

7月11日周五
  1. Mistral AI63

    Mistral AI 发布 Devstral Medium 与 Devstral Small 1.1 代码智能体模型

    Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。

    推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。

6月4日周三
  1. The Gradient20

    AGI Is Not Multimodal

    summary_zh: 文章论证多模态方法无法在近期实现人类水平的通用人工智能,指出真正的 AGI 需要基于物理世界模型的具身智能,而非将多种模态拼接成补丁式系统。

6月3日周二
  1. Ollama Blog67

    Minions:Ollama 与前沿模型的安全隐私协作协议

    Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。

    推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。

5月27日周二
  1. Mistral AI62

    Mistral 发布 Agents API

    Mistral 发布 Agents API,将语言模型与代码执行、网页搜索、图像生成及 MCP 工具等内置连接器结合,并提供持久记忆与多智能体编排能力。SimpleQA 上 Mistral Large 和 Medium 启用网页搜索后得分分别从 23%、22.08% 提升至 75%、82.32%。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

5月21日周三
  1. Mistral AI65

    Devstral:Mistral AI 发布开源智能体编程模型

    Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。

    推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。

5月1日周四
4月15日周二
  1. AI Snake Oil36

    AI as Normal Technology

    summary_zh: 论文提出将 AI 视为"普通技术"的框架,区别于乌托邦/反乌托邦叙事,认为当前不应将 AI 视作类人智能或超级智能体。核心主张是 AI 的影响将按十年尺度渐进扩散,方法、应用与采纳发生在不同时空,控制权仍主要在人与机构手中。

4月10日周四
  1. Vector Institute67

    Vector Institute 发布 State of Evaluation 研究:全球11个AI模型经16项基准评估

    Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。

    推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。

3月31日周一
3月25日周二
  1. Vector Institute62

    Vector Institute:利用大语言模型提升医学系统综述筛选效率

    Vector Applied Scientist David Emerson 等人提出通用提示模板 Abstract ScreenPrompt 和 ISO-ScreenPrompt,在 10 个临床领域的系统综述上实现 97.7% 加权灵敏度和 85.2% 加权特异性(摘要筛选),全文筛选达 96.5% 灵敏度和 91.2% 特异性。

    推荐理由:通用提示模板让大语言模型在系统综述筛选中达到高灵敏度与特异性,为自动化证据筛选提供了可迁移方法。

3月4日周二
  1. Mistral AI34

    Mistral AI 用 Agentic Workflow 赋能产品开发

    Mistral AI 展示了 TranscriptToPRDTicket agentic workflow,利用 Mistral Large 2 自动将会议纪要转化为 PRD 和开发工单。该流程由 PRDAgent 和 TicketCreationAgent 两个组件驱动,自动在 Linear 和 Jira 中生成结构化工单。相关实现已在 Google Colab notebook 中提供。

2月25日周二
  1. Ollama Blog74

    Minions:本地与云端大语言模型协同工作

    斯坦福 Hazy Research 团队发布 Minions 论文与开源代码,让本地小模型(如 Llama 3.2 via Ollama)与云端大模型(如 GPT-4o)协作,将大量 LLM 工作负载转移到消费设备。

    推荐理由:通过本地小模型与云端大模型协作的两套协议,在显著降低远程调用成本的同时保持较高性能。

2月10日周一
1月16日周四
  1. Chip Huyen · Notes42

    构建生成式 AI 应用的常见陷阱

    summary_zh: 文章列举了构建生成式 AI 应用时的四个常见陷阱:不必要地使用生成式 AI(如用 LLM 做能源调度优化,贪心调度或线性规划更可靠);将产品问题误判为 AI 问题(LinkedIn 技能匹配聊天机器人需要的是有帮助的提示而非正确答案。

1月7日周二
  1. Chip Huyen · Notes44

    Agents:智能体的定义、工具与规划

    summary_zh: 智能体被定义为能通过传感器感知环境并通过执行器采取行动的任何事物,其能力由环境与工具集共同决定。SWE-agent 以 GPT-4 为基础,在计算机终端和文件系统环境中执行导航、搜索、查看和编辑等操作。

12月14日周六
12月6日周五
11月6日周三
10月19日周六
10月1日周二
7月7日周日
  1. Lilian Weng46

    大语言模型的外在幻觉(Extrinsic Hallucinations)

    文章将幻觉限定为模型输出未被上下文或世界知识支撑的编造内容,重点讨论外在幻觉,即输出应基于预训练数据的事实性。Gekhman et al. 2024 发现微调新知识时模型学得慢,且学会后增加幻觉倾向;最佳验证表现出现在多数 Known 样本被学会、仅少数 Unknown 样本被学会时。FactualityPrompt 与 FActScore 等方法通过命名实体错误率和蕴含比来量化幻觉。

5月31日周五
4月21日周日