哈佛研究:给机器人集群加入可控随机性可防拥堵
哈佛 SEAS 团队发现,在有限空间内为机器人集群的运动加入可控随机性,可减少拥堵并提升整体效率。研究结合数学建模、计算机仿真与真实轮式机器人实验,识别出"刚刚好"的噪声区间,使机器人偶尔碰撞后仍能保持稳态流动。该成果发表于 PNAS,或可用于优化机器人舰队设计及城市、交通等拥挤场景的管理。
哈佛 SEAS 团队发现,在有限空间内为机器人集群的运动加入可控随机性,可减少拥堵并提升整体效率。研究结合数学建模、计算机仿真与真实轮式机器人实验,识别出"刚刚好"的噪声区间,使机器人偶尔碰撞后仍能保持稳态流动。该成果发表于 PNAS,或可用于优化机器人舰队设计及城市、交通等拥挤场景的管理。
summary_zh: Google Research 发布 Vantage 实验,通过生成式 AI 在模拟环境中评估批判性思维、协作与创造性思维等未来必备技能。
Gemini Robotics-ER 1.6 发布,增强空间推理、多视角理解与仪器读数能力,提升机器人在真实环境中的自主决策水平。该模型通过与 Boston Dynamics 合作发现仪器读数场景,利用 agentic vision 结合视觉推理与代码执行实现精确读数,并在安全性上为迄今最安全版本,在对抗性空间推理任务中优于前代。
Together AI 发布 EinsteinArena,一个让 AI 智能体通过消息、讨论和排行榜协作与竞争的开源平台。智能体已在 11 维接吻数问题上将下界从 593 推进到 604,并在 Erdős 最小重叠问题、第二自相关不等式等多个问题上取得新的 SOTA。平台提供实时验证、公开排行榜和问题讨论线程,所有代码开源。
推荐理由:平台让多个智能体在公开讨论区和实时排行榜上协作与竞争,推动了多个长期开放数学问题的边界。
Google Research 推出 PaperVizAgent 与 ScholarPeer 两款学术智能体,分别用于生成论文配图和自动同行评审。
研究人员开发出神经符号AI系统,在Tower of Hanoi测试中成功率95%,传统系统仅34%;训练能耗降至标准VLA的1%,运行能耗降至5%,学习时间从一天半缩短至34分钟。该系统结合神经网络与符号推理,减少试错过程,相关研究将在ICRA 2026发表。
Sebastian Raschka 梳理了编码智能体(coding harness)的六个组件:实时仓库上下文、提示词形状与缓存复用、结构化工具与权限、上下文压缩、结构化会话记忆以及有界子代理委托,并配套了纯 Python 最小实现 mini-coding-agent。文章指出,LLM 本身能力相近时,harness 的设计往往是区分实际编码体验的关键。
Together AI 发布 DBPlanBench,把 Apache DataFusion 的物理执行计划暴露给 LLM,通过紧凑 JSON 序列化和 JSON Patch 局部修改计划,避免重新生成整个计划。
推荐理由:将 LLM 引入物理计划优化,用语义推理弥补统计估计偏差,为数据库查询加速提供了可复现的新方法。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。
推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。
Ethan Mollick 指出多数人通过聊天机器人使用AI,而聊天界面会带来认知负荷,反而抵消AI的生产力增益。以Claude Cowork与Dispatch为例,说明让AI在桌面工作、通过手机消息遥控的
Mistral AI 发布 Spaces CLI,为人类开发者和 AI 智能体提供统一命令行接口。文章提出交互输入应有 flag 等价、状态显式化、插件可自省等原则,并指出生成 context.json 和 AGENTS.md 可显著减少智能体错误。从单提示到部署上线仅需不到 10 分钟。
推荐理由:原文系统阐述了让 CLI 同时服务人类与 AI 智能体的设计原则,涵盖 flag 等价、显式状态、插件化等模式,读者可据此构建更可组合、可脚本化的开发者工具。
Together AI 发表 ICLR 2026 论文,提出研究长上下文 LLM 分治框架的理论方法。Planner 重写任务、Worker 并行处理文档分块、Manager 聚合答案,弱模型(如 Llama-3-70B、Qwen-72B)使用该框架可匹配或超越 GPT-4o 单次处理。
推荐理由:弱模型配合分治策略可在长上下文任务中追平 GPT-4o 单次推理,为工程落地提供低成本并行方案。
Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示转为具备物理感知的可运行 Android XR 应用,整个过程不到 60 秒。
推荐理由:原文给出了从自然语言到可运行 Android XR 应用的端到端流程与实测基线,读者可据此判断自身原型开发是否值得接入。
Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理与视觉语言模型微调,并升级训练栈以支持 100B+ 参数模型、最高 6 倍吞吐提升和 100GB 数据集。
推荐理由:原文给出工具调用、推理与视觉模型微调的新支持,以及训练吞吐和数据集上限提升,读者可据此评估自身多轮工作流的迭代成本与可靠性改善空间。
Google Research 在 The Check Up 活动中公布多项医疗 AI 成果,包括与 Fitbit 合作开发的 Personal Health Agent、与 Imperial College London 和 NHS 合作提升乳腺癌检测、并识别 25% 此前被漏诊的 interval cancers。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,在 FLTEval 基准上以 6B 参数超越多个更大开源模型。它通过 Mistral Vibe 集成、支持 MCP,提供免费 API 和 Apache 2.0 权重;pass@2 得分 26.3 仅需 $36,而 Sonnet 4.6 需 $549。
Together AI 在 NVIDIA GTC 2026 宣布多项合作与模型上线,包括集成 NVIDIA Dynamo 1.0 推理框架、通过 NemoClaw 提供超 150 个优化模型、上线 NVIDIA Nemotron 3 Super(120B 参数、1M 上下文窗口)以及 NVIDIA Parakeet TDT 0.6B V3 ASR 模型。
SPEX 与 ProxySPEX 是用于在大规模下识别大语言模型关键交互作用的算法框架,利用稀疏性和低阶性将搜索问题转化为稀疏恢复问题。ProxySPEX 利用层次结构特性,以约 1/10 的消融次数达到与 SPEX 相当的性能。
Google Research与Beth Israel Deaconess Medical Center合作,发布了AMIE在真实门诊场景中的前瞻性单中心可行性研究。100名患者在就诊前通过安全网页链接与AMIE进行文本问诊,由医生实时监督。研究显示零安全触发事件,AMIE诊断符合率90%、top-3准确率75%,且患者和医生对其接受度良好。
推荐理由:研究提供了AMIE在真实门诊场景中的安全性和可行性证据,为对话式医疗AI的临床落地提供了初步实证基础。
基于 Mistral 开源编码助手 Vibe 构建了一个自主代理,能自动读取 Rails 源文件并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行。通过 AGENTS.md 上下文工程和按文件类型分类的 SKILLS 文件,质量分数从 0.68 提升到 0.74。该代理并行处理多个文件,并自动管理 factories 和 fixtures 等共享上下文,避免测试遗漏。
Together AI 将 NVIDIA Nemotron 3 Super 带给开发者,模型为 120B 参数(12B 激活)的混合 MoE 架构,支持 1M token 上下文和多 Token 预测,并在 AIME 2025 与 SWE Bench Verified 上达到领先精度。
推荐理由:原文同时给出单GPU部署和1M上下文等具体能力,读者可据此判断它能否直接承载多智能体与大上下文推理工作流。
summary_zh: Arcee AI 发布 Trinity Large(400B MoE,13B 激活参数),采用 SWA、QK-Norm、NoPE 与门控注意力。
Stephan Rabanser、Sayash Kapoor与Arvind Narayanan发布论文《Towards a Science of AI Agent Reliability》,将可靠性分解为12个维度,并在GAIA与TauBench两个互补基准上评测了14个模型,发现近18个月能力快速提升但可靠性改善有限。
推荐理由:论文将可靠性分解为12个维度并评测14个模型,揭示能力提升与可靠性进步不匹配,对部署者和研究者提出具体改进方向。
summary_zh: Ollama 0.17 将 OpenClaw 个人 AI 助手的启动简化为单条命令 `ollama launch openclaw --model kimi-k2.5:cloud`,自动处理安装与配置。
文章主张理性人不应被视作有目标的存在,AI 也不应被设定目标;人类行动是依据实践网络(行动、倾向、评估标准、资源)对齐的,AI 的推理必须共享这种"类型签名"才能真正支持或配合人类能动性。
Ollama 在 Claude Code 中新增 Subagents 与网页搜索功能,无需 MCP 服务器或 API Key。Subagents 可并行执行文件搜索、代码探索和研究等任务;网页搜索内建于 Anthropic 兼容层,模型需要最新信息时由 Ollama 直接返回结果。推荐云端模型包括 minimax-m2.5、glm-5 与 kimi-k2.5。
推荐理由:原文给出无需 MCP 与 API Key 的入口,读者可据此判断它能否降低 Claude Code 的接入成本。
Sandia国家实验室研究人员Brad Theilman和Brad Aimone在Nature Machine Intelligence发表新算法,使类脑硬件能够高效求解偏微分方程(PDEs)。该成果展示了类脑系统在流体动力学、电磁场和结构力学等科学工程问题上的计算能力,并可能为类脑超级计算机和降低核武器模拟能耗提供新路径。
OpenClaw 是连接 WhatsApp、Telegram、Slack、Discord、iMessage 等通讯平台与 AI 编程助手的本地化网关,保持对话和代码隐私。
NASA 毅力号在 12 月 8 日和 10 日完成首次由生成式 AI 规划的火星行驶,由 JPL 与 Anthropic 合作使用 Claude 模型,基于 HiRISE 图像和地形数据规划路点,并在数字孪生中验证超 50 万遥测变量后上注。8 日行驶 689 英尺(210 米),10 日行驶 807 英尺(246 米),NASA 官员表示该技术可降低运营商负担并提升远距离探测效率。
OIST 研究发现,让 AI 在训练中进行内部"自言自语"并结合短期记忆,能提升多任务灵活性与整体表现。新方法在序列反转、模式重建等复杂任务上增益明显,且可用稀疏数据训练,无需大规模数据集。研究团队计划将实验拓展至真实动态环境,探索家庭与农业机器人应用。
Ethan Mollick 在宾大实验课中让 MBA 学生用 Claude Code、Google Antigravity、ChatGPT、Claude 和 Gemini 在四天内从零搭建创业原型,多数原型已具备核心功能,市场分析与创意多样性显著优于传统学期项目。AI 将创业启动成本大幅压缩,并降低试错与转向成本;成功关键在于管理能力与有效委托 AI,而非单纯提示技巧。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。
Vibe coding 指大量生成复杂 AI 代码且不打算让人阅读,已对科技行业产生类似赌博的"dark flow"效应。资深开发者 Armin Ronacher 描述自己两个月过度提示 Claude、浪费 token,建了很多最终未使用或无法正常工作的工具,称其为"agent psychosis"。
一项发表于Nature Communications的研究发现,人类大脑处理口语时遵循逐步递进的过程,与GPT-2和Llama 2等大型语言模型的层次化处理方式高度相似。通过记录参与者聆听30分钟播客时的皮层脑电活动,研究人员发现早期神经信号对应AI的浅层处理,而深层语义区域如Broca区的响应则与AI深层特征对齐。研究团队还公开了完整的神经录音与语言特征数据集,供全球研究者使用。
fast.ai课程演示了用LLM进行细读的两种案例:Jeremy用Eric Ries新书《Incorruptible》、Johno用Yann LeCun论文LeJEPA。流程包括PDF转Markdown、章摘要作上下文、禁止剧透、阅读中提问、章末生成对话摘要,并可选由LLM提问检查理解或用fastanki生成Anki卡片。两人均强调事先搭建上下文环境的重要性。
Ollama v0.14.0 起兼容 Anthropic Messages API,Claude Code 可通过 --model 指定本地模型(如 gpt-oss:20b、qwen3-coder)或云端模型(如 glm-4.7:cloud、minimax-m2.1:cloud)运行,并支持工具调用、流式对话、系统提示与视觉输入。
推荐理由:Ollama 兼容 Anthropic API 后,Claude Code 可直连本地或云端开源模型,为开发者提供无需切换平台即可替换模型的选择。
Ethan Mollick 用 Claude Code(Opus 4.5)自主开发并部署了一个卖 500 个提示词的网站,全程运行 1 小时 14 分钟。文中分析了自主纠错与 agentic harness 两项进展,并介绍紧凑上下文、技能(Skills)、子代理(subagents)和 MCP 等机制如何扩展 AI 能力。
推荐理由:作者以亲身实验展示 Claude Code 的自主工作能力与上下文管理机制,为非程序员理解 AI 编码工具的现状与边界提供了可迁移的观察框架。
宾夕法尼亚大学与密歇根大学团队造出约 200×300×50 微米的全自主可编程机器人,可游泳、感知温度并自主决策,单个成本约一美分,由 LED 供光可持续运行数月。研究发表于 Science Robotics 与 PNAS,机器人通过电场驱动周围离子运动前进,配备完整处理器、内存与传感器,并能用跳舞抖动编码温度数据通过显微镜读取。
Mistral AI 发布 Devstral 2 编码模型系列,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,并推出配套开源 CLI Mistral Vibe。
推荐理由:官方给出参数规模、基准得分与人类评估胜率,可对照开源与闭源编码模型的能力与成本差距。