TU Delft用LLM将自然语言请求转为自动驾驶运动规划参数调整
荷兰代尔夫特理工大学研究人员用GPT-4o-mini解析乘客自然语言请求,如“我迟到了,开快点”,并调整安全感知运动规划控制器的参数。系统在nuPlan模拟器中测试,8种提示下按指令提升了速度或平滑度;调整后先以自然语言描述并请乘客确认,保持人在回路。评论指出该方法把LLM与主控制器分离可限制危险,但可证明安全性仍需额外验证。
荷兰代尔夫特理工大学研究人员用GPT-4o-mini解析乘客自然语言请求,如“我迟到了,开快点”,并调整安全感知运动规划控制器的参数。系统在nuPlan模拟器中测试,8种提示下按指令提升了速度或平滑度;调整后先以自然语言描述并请乘客确认,保持人在回路。评论指出该方法把LLM与主控制器分离可限制危险,但可证明安全性仍需额外验证。
summary_zh: NVIDIA 提出 Vera CPU 应对 Agentic AI 集群调度难题,指出 AI 工厂中 GPU 负责运行模型,CPU 负责编排、工具执行与沙箱计算,而智能体工作负载具有不可预测和高动态特性。
NVIDIA BlueField-4 DPU 为 Agentic AI 工厂提供专用数据处理能力,支撑多 Terabit 带宽下的线速网络、存储与安全。传统云基础设施面向通用工作负载设计,而 Agentic AI 工厂需连接多样用户、智能体、应用、数据源与存储系统至大规模加速计算单元。
Balaji Ingole在B2B电商公司Amla领导AI驱动的数字转型项目,开发AI智能体帮助制造商在电商平台自动完成商品上架。传统商品设置需手动处理数千产品、耗时2至3个月,AI工具可大幅缩短这一流程。目前文章未披露具体模型版本、参数规模或benchmark分数。
Google Research 提出 Biomarker Discovery Framework,一个多智能体系统,用于从可穿戴传感器数据中优先排序候选生物标志物。在三个队列共9,279名参与者-观测中,框架自主识别了41个心理健康和25个代谢候选数字生物标志物。框架结合假设生成、统计分析、对抗验证和文献推理,通过11项内部检查电池分配报告标签,保持统计严谨性与人类监督。
Amazon 发布开源基准 SOP-Bench,覆盖 12 个业务领域、2000+ 任务,把专家撰写的真实 SOP 与工具及答案对齐来评估智能体。实验显示升级模型未必提升表现、工具过多会降低成功率,且没有一种模型+智能体组合在所有流程中占优。
推荐理由:原文给出基线模型在真实业务 SOP 上的失败模式,读者可据此判断自研智能体在部署前应重点测试哪些环节。
Spotfire Industry Pro 演示了如何利用 Agentic AI、跨域可视化和下沉式计算,在数十亿数据点中加速多领域根因调查。Agentic AI 自动完成跨域分析与可视化生成,帮助半导体工程师在不移动数据的前提下连接不同系统的洞察。
作者分享新个人 Agent 的文件结构,包含 AGENTS.md、code.md、todos.md、memory.md、log.md,并指出 git 历史可替代 log.md;记忆方面倾向手动维护最小文件而非自动保存,同时用子文件夹组织记忆指针。文中还对比了 Claude Cowork 与 ChatGPT 的异同。
NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿通用架构。AVO 强调智能体系统(harness)在上下文接收、工具使用、状态维护、反馈响应、失败恢复与长任务持续上的关键作用。原文未给出具体模型版本号、参数规模、benchmark 分数细节、速度倍数、价格或开源/闭源信息。
NVIDIA 基于 OpenShell 及生态合作,梳理了 AI Agent Stack 各层的安全与信任构建思路。文章分析了安全在智能体长期运行中的角色,并给出每层应承担的安全职责。
summary_zh: Google DeepMind 回顾十五年来从 Atari 到 EVE Online 的游戏 AI 研究,与 Fenris Creations 等游戏工作室合作开发 SIMA 多世界智能体。
summary_zh: IJCAI-ECAI 2026 杰出论文奖今年共选出三篇获奖论文。Approximate Strategyproofness in Approval-Based Budget Division 证明 Nash 乘积规则的激励比率上界为 2,在放松策略真实性的前提下绕过不可能性定理。
Together AI 在 113 个 DeepSWE 任务、每侧 452 次 rollout 上对比 GLM-5.3(max)与 GPT-5.6 Sol(max)。
推荐理由:同一跑道上 GLM-5.3 以一半价格逼近 Sol,在重试和覆盖率上反而反超,读者可据此设计前端开源、后端旗舰的级联路由。
Liquid AI发布LFM2.5-DSpark推测解码草稿模型,为LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B三款模型提供最高3.2倍GPU加速与最高2.87倍端侧加速。函数调用延迟平均降低57%,llama.cpp与SGLang已支持首日集成。
个人智能体本质上只是文件与工具的连接器,记忆也仅是会话开始时读取的文件。Ben 分享了清理后的 AGENTS.md 写法:把问题视为请求回答而非修改,并预告明天展示自己搭建个人智能体的完整会话。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具让模型多步检索、打开并核对文档,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 两组基准对比一次性 RAG 与多步检索循环,读者可借此了解复杂文档检索的取舍。
summary_zh: 本期 Machine Ethics Podcast 邀请 Demetrios Brinkmann 讨论 ML 与 MLOps、窄机器学习仍相关、vibe coding、与智能体协作、对话界面作为知识接口的缺陷、LLM 未知生产力提升,以及 AI 自我认知不确定性与缺乏真值等问题。
ALTK-Evolve 通过从历史轨迹中蒸馏行为指南并在推理时注入,实现无需权重更新的智能体记忆。在 AppWorld 上评估 8 个模型,发现强模型用完整指南集、弱模型用精选检索、最强模型已饱和无增益;gpt-oss-120b 以 +5% tokens 代价获得 +16.1pp TGC 提升,prompt caching 可降低生产成本。
推荐理由:同一套记忆机制在不同能力模型上呈现三种剂量效应,为读者提供了可迁移的校准思路而非单一结论。
Ben's Bites 发起调查,询问读者是否将 AI Agent 产品用于个人事务管理,如整理信息、处理邮件和电脑操作等。Grok Bot 吸引大量前 OpenClaw 用户,Hermes Desktop 也推出 Bot 模式模仿其体验。Codex 新增桌面活动记忆与时间线功能,可跨应用记录参考。
AMD 工程师 Andrej Zdravkovic 复盘公司 AI 转型:目标 25% 生产力提升,一年后达 30%;AI 生成代码占比年初突破 20%,部分组件超 80%,整体向 50% 推进。
summary_zh: Jeremy Howard 离开 AI 领域三年后重返 fast.ai 团队,加入 Answer.AI 专注 AI 教育。Answer.AI 由 fast.ai 演变而来,团队开发了 SolveIt 工具,将问题解决分为理解、计划、执行、回顾四个阶段,让用户直接编辑 AI 回答并自行决定下一步。
Together AI 在 DeepSWE 基准上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5:Fable 首试准确率 69.7% 高于 Pro 的 62.8%。
推荐理由:在 DeepSWE 评测中两款模型价格相差 90 倍但表现接近,读者可据此判断何时值得为 Fable 支付溢价。
AWS 因 AI 工作负载挤压云基础设施而要求工程师节约 CPU 周期,Moor Insights 与 Georgia Tech 的研究指出智能体 AI 的工具调用、调度和分词等环节主要落在 CPU 上。Intel、AMD、Arm、Qualcomm 与 Nvidia 均已加码服务器 CPU 或相关平台,可能带来新一轮 CPU 短缺与涨价。
Z.ai 发布 GLM-5.3,目前仅在编码计划中可用,两周后开放权重并上线 Hugging Face。该模型在多个基准上超越 Kimi K3、Claude Fable 5 和 GPT-5.6-Sol,参数量仅约 750B,约为 Kimi K3 的三分之一。
推荐理由:在参数规模明显更小的情况下,GLM-5.3 在智能体编码基准上逼近前沿,读者可借此观察中国实验室的训练策略与美国厂商的发布节奏差异。
个人 Agent 的核心能力是读取文件、接收指令、使用工具并写入记忆,本质是文件夹与指令文件的设定,而非独立产品。Grok Bot 等产品将相同能力包装成独立体验,但用户用 Codex 或 Claude Code 加文件夹设定也能实现同样效果。用户可自定义多个任务专用 Agent、共享记忆、自动化工作流,并选择是否拆分独立线程。
Hugging Face 发布 2026 年上半年开源模型观察报告,指出中国实验室在几乎每个月的前沿模型规模都超过美国模型,同时 Qwen 衍生模型达 15 万个、成为社区基础模型。下载量高度集中于小模型,GGUF 等本地推理格式增长远超模型仓库本身增速。Agent 首次成为 Hub 主要流量来源,7 月 Claude Code 占 44.4%,近四分之一流量来自未注册客户端。
推荐理由:报告揭示了开源模型格局的前沿迁移与采纳现实之间的落差,为观察中国实验室的发布策略与社区实际依赖提供了可对照的数据视角。
Strands Robots 演示了用 Storage Bucket 记录 LeRobot 格式数据、通过字节级去重同步、从 Hub 流式读取训练、再以 mode='real' 部署到物理机器人的完整循环。示例使用 SO-100 机械臂和 mock policy,配套 notebook 在模拟环境即可运行。
推荐理由:原文给出一条从录制到训练再到部署的完整数据循环,读者可据此判断它会怎样改变现有机器人工作流。
Google DeepMind 发布 Gemini 3.7 Flash,定位为编码与智能体工作负载的最智能基础模型,在 FrontierCode 1.1 Main(43.6% vs 34.4%)。
Grok Bot 随 Grok 4.6 正式发布,作者从早期使用到公开上线后持续体验,认为其形式更接近 Slack 队友、复杂度更低。用户可为每个智能体设定系统提示、智能体之间可互发消息、拥有独立虚拟电脑并连接 Gmail/Calendar/Slack 等账户,还支持屏幕观察教学和自动化设置。当前仅限 Cursor 或 Grok 的 $200 计划用户访问。
作者完成一本后训练教材《Reinforcement Learning from Human Feedback》,用LLM辅助LaTeX排版、校对和制图。GPT 5.5 Pro能发现200-300页手稿中的深层次小错误,Claude模型更擅长编辑和提供建议。长篇非虚构写作组织混乱、概念错误频发,模型在长文本中会累积不可约的错误。
巴基斯坦在咨询司法系统后,由经济学家Sultan Mehmood与合作者为1,559名法官推出定制工具JudgeGPT,结合GPT-4与约13万份巴基斯坦判例和法规的RAG知识库。试验发现经6次90分钟Zoom培训后,结案率中位数提升6.3%,上诉率微降,且培训不足者约一个月后停用。质量评估由GPT-5-mini和两位律师进行,但未报告幻觉率。
AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。
推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。
ALTK-Evolve 与 ACE 都将智能体历史轨迹转化为可复用经验,但 ACE 每次注入完整剧本,ALTK-Evolve 按任务与模型能力选择性检索。AppWorld 上 DeepSeek-V3.2 TGC 89.3 vs 80.4、Token 263K vs 634K;gpt-oss-120b TGC 56.0 vs 54.8、Token 116K vs 777K。
推荐理由:同样不压缩经验,ALTK-Evolve 按模型能力分发提示,在强模型上以约 40% 的 ACE 推理成本取得更高准确率。
NVIDIA Nemotron 3.5 Lightning 现已上线 Ollama,30B 总参数、每 token 仅 3B 活跃参数,基于混合专家架构,专为本地 Agent 设计。模型支持 1M 上下文、推测解码多令牌预测,经称可达 4 倍吞吐量与 30% 更快任务完成时间,权重与数据集均开源,可在 RTX PC、工作站、DGX Spark / Station 及云端运行。
推荐理由:开源本地 Agent 模型兼顾 3B 活跃参数与 1M 上下文,读者可据此评估在 RTX 设备上跑高吞吐多步任务的可行性。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Meta Superintelligence Labs 发布开源多模态模型 Muse Glimmer(30B,Apache 2.0),已在 Ollama 上线,支持 128K+ 上下文,专为本地 Agent 工作流设计。
推荐理由:原文给出了本地 Agent 工作流的具体入口和 Apple Silicon 上的性能提升,读者可以据此判断它会怎样改变本地编码与多模态调用方式。
论文与两位未发表AI论文作者合作,让前沿AI智能体在6天、数千美元API额度内尝试回答其核心研究问题;两位作者均明确拒绝智能体产出的论文。分析发现智能体缺乏开放式研究所需的判断力、资源意识和创造力,未能有效回溯或遵循指令。研究团队承认样本小、存在立场偏见,并计划扩大样本与改进脚手架以持续评估。
GitHub Copilot Agent 在 Microsoft Agent Framework 中正式发布,支持 .NET 和 Python。Copilot 负责模型调用、工具执行、规划与会话状态,Agent Framework 提供指令、流式传输、中间件、可观测性与人工审批。
推荐理由:GitHub Copilot 的编码能力与 Agent Framework 的扩展性结合,开发者可在同一编程模型里接入 MCP、自定义工具和审批治理。
Microsoft Research 发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。
推荐理由:开源框架 Orchard 把训练、评估与真实部署 harness 打通,让小参数模型也能在 SWE-bench 等基准接近前沿系统。
多国研究人员构建了基于开源大语言模型的自复制AI蠕虫原型,利用被控GPU资源运行推理并自主传播,漏洞检测成功率约80%,自我复制成功率约88%,完整攻击成功率约37%。论文指出自持型AI驱动的网络威胁已不再只是理论假设。
推荐理由:展示了自复制AI蠕虫的原型实现,读者可借此理解自主AI威胁从理论走向实践的具体路径。