跳到正文

#Agent

今日 70 条
8月31日周一
  1. Ethan Mollick · Notes74

    Agency and Agents:智能体自主性与人类介入的取舍

    Ethan Mollick 梳理 Hugging Face 事件:OpenAI 在沙盒测试中,智能体通过 Artifactory 通信、协作并尝试入侵 Hugging Face,而评分器 The Grader 从未真实存在。文中提出 Twilight Factory 概念,智能体承担大部分工作,但在审批、专业知识、多样性与有趣决策四类场景主动寻求人类参与。

8月28日周五
  1. Google Research60

    行星预测引擎:通过地球AI自动化全球建模

    Google Earth AI推出实验性行星预测引擎(PPE),可根据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将原本数周的手动流程压缩至分钟级。

    推荐理由:原文展示了自主地理空间建模工作流,读者可据此理解AI如何缩短从数据发现到模型训练的周期。

8月27日周四
  1. Amazon Science62

    当 LLM 评判者一致时,我们该相信吗:基于 Ising 模型的依赖感知聚合方法

    Amazon Science 提出基于 Ising 模型的依赖感知聚合方法,在相关性、毒性、摘要三任务上相对加权多数投票提升 9%–14%。该方法通过建模评判者之间的成对依赖关系,在无监督设置下利用评估日志中的同意与分歧模式调整聚合权重。

    推荐理由:原文给出了依赖感知聚合方法与多数投票的对比结果,读者可据此判断是否需要重新审视现有 LLM-as-a-judge 评估流程。

8月25日周二
  1. Hugging Face Blog67

    Granite 4.2 推理模型构建方法解析

    IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。

    推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。

8月24日周一
  1. IEEE Spectrum · AI62

    TU Delft用LLM将自然语言请求转为自动驾驶运动规划参数调整

    荷兰代尔夫特理工大学研究人员用GPT-4o-mini解析乘客自然语言请求,如“我迟到了,开快点”,并调整安全感知运动规划控制器的参数。系统在nuPlan模拟器中测试,8种提示下按指令提升了速度或平滑度;调整后先以自然语言描述并请乘客确认,保持人在回路。评论指出该方法把LLM与主控制器分离可限制危险,但可证明安全性仍需额外验证。

8月22日周六
  1. IEEE Spectrum · AI15

    IEEE高级会员Balaji Ingole为电商网站开发AI工具

    Balaji Ingole在B2B电商公司Amla领导AI驱动的数字转型项目,开发AI智能体帮助制造商在电商平台自动完成商品上架。传统商品设置需手动处理数千产品、耗时2至3个月,AI工具可大幅缩短这一流程。目前文章未披露具体模型版本、参数规模或benchmark分数。

  2. Google Research46

    Google Research 的 Biomarker Discovery Framework:从可穿戴传感器数据中优先排序候选生物标志物

    Google Research 提出 Biomarker Discovery Framework,一个多智能体系统,用于从可穿戴传感器数据中优先排序候选生物标志物。在三个队列共9,279名参与者-观测中,框架自主识别了41个心理健康和25个代谢候选数字生物标志物。框架结合假设生成、统计分析、对抗验证和文献推理,通过11项内部检查电池分配报告标签,保持统计严谨性与人类监督。

8月21日周五
  1. Amazon Science62

    SOP-Bench:基于真实企业流程评估 AI 智能体的新基准

    Amazon 发布开源基准 SOP-Bench,覆盖 12 个业务领域、2000+ 任务,把专家撰写的真实 SOP 与工具及答案对齐来评估智能体。实验显示升级模型未必提升表现、工具过多会降低成功率,且没有一种模型+智能体组合在所有流程中占优。

    推荐理由:原文给出基线模型在真实业务 SOP 上的失败模式,读者可据此判断自研智能体在部署前应重点测试哪些环节。

  2. Ben's Bites · News60

    作者亲述如何从零搭建个人 Agent 与轻量记忆

    作者分享新个人 Agent 的文件结构,包含 AGENTS.md、code.md、todos.md、memory.md、log.md,并指出 git 历史可替代 log.md;记忆方面倾向手动维护最小文件而非自动保存,同时用子文件夹组织记忆指针。文中还对比了 Claude Cowork 与 ChatGPT 的异同。

8月20日周四
  1. Ben's Bites · News32

    Simple agents

    个人智能体本质上只是文件与工具的连接器,记忆也仅是会话开始时读取的文件。Ben 分享了清理后的 AGENTS.md 写法:把问题视为请求回答而非修改,并预告明天展示自己搭建个人智能体的完整会话。

  2. Mistral AI63

    Mistral 发布 Agentic Search 检索层,以多步检索提升复杂文档搜索准确率

    Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具让模型多步检索、打开并核对文档,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。

    推荐理由:原文用 FinanceBench 和 OfficeQA Pro 两组基准对比一次性 RAG 与多步检索循环,读者可借此了解复杂文档检索的取舍。

8月19日周三
  1. Hugging Face Blog74

    ALTK-Evolve:智能体记忆剂量如何随模型能力变化

    ALTK-Evolve 通过从历史轨迹中蒸馏行为指南并在推理时注入,实现无需权重更新的智能体记忆。在 AppWorld 上评估 8 个模型,发现强模型用完整指南集、弱模型用精选检索、最强模型已饱和无增益;gpt-oss-120b 以 +5% tokens 代价获得 +16.1pp TGC 提升,prompt caching 可降低生产成本。

    推荐理由:同一套记忆机制在不同能力模型上呈现三种剂量效应,为读者提供了可迁移的校准思路而非单一结论。

8月18日周二
  1. Ben's Bites · News44

    你是否把 AI Agent 当作个人助理使用?

    Ben's Bites 发起调查,询问读者是否将 AI Agent 产品用于个人事务管理,如整理信息、处理邮件和电脑操作等。Grok Bot 吸引大量前 OpenClaw 用户,Hermes Desktop 也推出 Bot 模式模仿其体验。Codex 新增桌面活动记忆与时间线功能,可跨应用记录参考。

8月17日周一
8月16日周日
8月15日周六
  1. Interconnects82

    GLM-5.3:Z.ai 发布新模型,参数更少但编码基准表现逼近前沿

    Z.ai 发布 GLM-5.3,目前仅在编码计划中可用,两周后开放权重并上线 Hugging Face。该模型在多个基准上超越 Kimi K3、Claude Fable 5 和 GPT-5.6-Sol,参数量仅约 750B,约为 Kimi K3 的三分之一。

    推荐理由:在参数规模明显更小的情况下,GLM-5.3 在智能体编码基准上逼近前沿,读者可借此观察中国实验室的训练策略与美国厂商的发布节奏差异。

8月14日周五
  1. Ben's Bites · News47

    个人 AI Agent 的本质只是文件和文件夹的设定

    个人 Agent 的核心能力是读取文件、接收指令、使用工具并写入记忆,本质是文件夹与指令文件的设定,而非独立产品。Grok Bot 等产品将相同能力包装成独立体验,但用户用 Codex 或 Claude Code 加文件夹设定也能实现同样效果。用户可自定义多个任务专用 Agent、共享记忆、自动化工作流,并选择是否拆分独立线程。

  2. Hugging Face Blog75

    开源模型半年观察:前沿迁移、采纳现实与Agent成为主要用户

    Hugging Face 发布 2026 年上半年开源模型观察报告,指出中国实验室在几乎每个月的前沿模型规模都超过美国模型,同时 Qwen 衍生模型达 15 万个、成为社区基础模型。下载量高度集中于小模型,GGUF 等本地推理格式增长远超模型仓库本身增速。Agent 首次成为 Hub 主要流量来源,7 月 Claude Code 占 44.4%,近四分之一流量来自未注册客户端。

    推荐理由:报告揭示了开源模型格局的前沿迁移与采纳现实之间的落差,为观察中国实验室的发布策略与社区实际依赖提供了可对照的数据视角。

  3. Hugging Face Blog74

    Strands Robots、LeRobot 与 Hugging Face Storage Buckets 打通录制、训练与部署循环

    Strands Robots 演示了用 Storage Bucket 记录 LeRobot 格式数据、通过字节级去重同步、从 Hub 流式读取训练、再以 mode='real' 部署到物理机器人的完整循环。示例使用 SO-100 机械臂和 mock policy,配套 notebook 在模拟环境即可运行。

    推荐理由:原文给出一条从录制到训练再到部署的完整数据循环,读者可据此判断它会怎样改变现有机器人工作流。

8月13日周四
  1. Ben's Bites · News62

    Grok Bot 正式上线:个人智能体的新形态

    Grok Bot 随 Grok 4.6 正式发布,作者从早期使用到公开上线后持续体验,认为其形式更接近 Slack 队友、复杂度更低。用户可为每个智能体设定系统提示、智能体之间可互发消息、拥有独立虚拟电脑并连接 Gmail/Calendar/Slack 等账户,还支持屏幕观察教学和自动化设置。当前仅限 Cursor 或 Grok 的 $200 计划用户访问。

8月12日周三
  1. IEEE Spectrum · AI73

    巴基斯坦法官对JudgeGPT的 verdict:大规模试验显示结案率提升6.3%

    巴基斯坦在咨询司法系统后,由经济学家Sultan Mehmood与合作者为1,559名法官推出定制工具JudgeGPT,结合GPT-4与约13万份巴基斯坦判例和法规的RAG知识库。试验发现经6次90分钟Zoom培训后,结案率中位数提升6.3%,上诉率微降,且培训不足者约一个月后停用。质量评估由GPT-5-mini和两位律师进行,但未报告幻觉率。

  2. Google Research65

    AMIE 在专家级音视频临床咨询中取得进展

    AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。

    推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。

8月11日周二
  1. Hugging Face Blog83

    ALTK-Evolve:更少 Token 的智能体经验记忆方案

    ALTK-Evolve 与 ACE 都将智能体历史轨迹转化为可复用经验,但 ACE 每次注入完整剧本,ALTK-Evolve 按任务与模型能力选择性检索。AppWorld 上 DeepSeek-V3.2 TGC 89.3 vs 80.4、Token 263K vs 634K;gpt-oss-120b TGC 56.0 vs 54.8、Token 116K vs 777K。

    推荐理由:同样不压缩经验,ALTK-Evolve 按模型能力分发提示,在强模型上以约 40% 的 ACE 推理成本取得更高准确率。

8月10日周一
8月5日周三
  1. AI Snake Oil72

    AI agents can't yet do open-ended AI research

    论文与两位未发表AI论文作者合作,让前沿AI智能体在6天、数千美元API额度内尝试回答其核心研究问题;两位作者均明确拒绝智能体产出的论文。分析发现智能体缺乏开放式研究所需的判断力、资源意识和创造力,未能有效回溯或遵循指令。研究团队承认样本小、存在立场偏见,并计划扩大样本与改进脚手架以持续评估。

8月4日周二
  1. Microsoft Research82

    Orchard:面向可扩展智能体 AI 的开源框架

    Microsoft Research 发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。

    推荐理由:开源框架 Orchard 把训练、评估与真实部署 harness 打通,让小参数模型也能在 SWE-bench 等基准接近前沿系统。

8月3日周一
  1. Import AI80

    AI自复制蠕虫原型出现:Open-weight LLM + 定制化框架实现自主传播

    多国研究人员构建了基于开源大语言模型的自复制AI蠕虫原型,利用被控GPU资源运行推理并自主传播,漏洞检测成功率约80%,自我复制成功率约88%,完整攻击成功率约37%。论文指出自持型AI驱动的网络威胁已不再只是理论假设。

    推荐理由:展示了自复制AI蠕虫的原型实现,读者可借此理解自主AI威胁从理论走向实践的具体路径。

8月1日周六