跳到正文

#Agent

今日 70 条
9月22日周二
  1. Nature · Machine Learning25

    大语言模型时代的研究可复现性

    summary_zh: 大语言模型的输出具有概率性,相同提示词可能产生不同结果,且模型权重与训练数据不公开,导致基于旧版闭源模型的研究难以精确复现。文章建议研究者记录所用模型与版本、完整提示词、硬件与软件配置及超参数等细节,并优先测试开源模型,以提升透明度与可复现性。

  2. Weaviate Blog72

    Engram 代理记忆实战指南

    Weaviate 发布 Engram 托管记忆与上下文服务,演示如何通过主题描述、边界、作用域与检索模式控制代理记忆。原文给出从 raw 数据到记忆的流水线、主题描述决定记忆内容与形态、bounded 与 scope 的行为差异,以及四种提示词布局下的缓存与计费对比。

    推荐理由:原文通过真实输出演示了四个配置决策如何改变代理的记忆行为,读者可依此调整自己的主题描述与提示词布局。

  3. Latent Space80

    TypeSafe AI 发布 Jev:面向生产环境的 System One 模型

    TypeSafe AI 发布 Jev,定位为面向软件开发的 System One 模型,核心创新是用 RLCD 替代 RLHF/RLVR,强调校准性与可靠性。Jev 优先服务于代码调用,创始人 Diogo Almeida 主张模型应融入软件底层并最终消失于背景。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  4. Amazon Science30

    Amazon 与斯坦福大学启动研究合作,推进 AI、能源与医疗前沿研究

    Amazon 与斯坦福大学联合发起 Stanford and Amazon Research Initiative,聚焦 AI、能源和医疗领域的前沿研究。目前 Amazon 在斯坦福资助超过 10 个团队的研究和博士奖学金,涵盖人形机器人、后量子密码学、因果测量科学和 AI 放射学等方向。合作通过联合研究项目、博士奖学金和研讨会等形式,缩短从突破性研究到实际应用的路径。

  5. Amazon Science62

    Amazon Bio Discovery推进AI生物学:训练模型设计并表征抗体

    Amazon Bio Discovery团队发表三篇论文,分别提出MochiBind结合力预测、CA-MAP可开发性预测和基于智能体的纳米抗体设计流程。MochiBind在跨抗原验证中比结构基线平均提升近10%配对准确率,并在CPU上约13秒完成20万对抗体评分。

    推荐理由:三篇论文分别针对抗体设计中的结合力排序、可开发性预测和全流程设计验证,给出了可复现的评估框架与实验结果。

9月21日周一
  1. Tom's Hardware · AI73

    TypeSafe AI 发布 Jev:面向概率决策的 System One 模型,宣称比 LLM 快 193 倍、便宜 445 倍

    TypeSafe AI 推出首款 System One 模型 Jev,由前 OpenAI 工程师 Diogo Almeida 主导,针对陈述评估与决策场景设计,而非开放式对话。Jev 以结构化 JSON 返回带置信度的答案,支持并行处理、无全局记忆,宣称比 GPT-6 Astra 快 194 倍、便宜 445 倍,上下文窗口上限 64k tokens。

  2. Nature · Machine Learning74

    Co-Scientist 等 AI 共同科学家平台正改变研究流程

    Google 开发的 Co-Scientist 通过多个自主智能体搜索文献、生成并筛选假设,帮助生物化学家 Anna Pertl 找到针对 MYC 蛋白的新策略。Frontier AI 实验室与初创公司也在推出类似平台,强调人类提问与判断仍不可替代。

    推荐理由:展示了多智能体协作在科学假设生成中的实际工作流,读者可迁移其‘提问—修正—验证’方法到自身研究场景。

  3. OpenAI News24

    V7 借助 GPT-5.6 降低成本 78% 并提升准确率

    summary_zh: V7 使用 GPT-5.6 将分散的公司文件转化为上下文,供智能体完成复杂且带来源链接的工作。成本降低 78% 同时准确率提升。 V7 使用 GPT-5.6 将分散的公司文件转化为上下文,供智能体完成复杂且带来源链接的工作。成本降低 78% 同时准确率提升。

  4. Simon Willison38

    MCP 一直都是个坏主意吗?

    MCP 并非坏主意,对于需要受控访问、认证隔离和审计日志的场景,它让这些能力更易实现。具备无限制网络访问的终端智能体(如 Claude Code、Codex、Meta Muse、OpenClaw)可直接调用 API,无需 MCP;认为 MCP 因全能编程智能体而不必要的看法,忽略了其他可构建的需求。

9月19日周六
  1. Latent Space79

    Jev 发布两天内出现 6 个复现版本及 AI 行业动态汇总

    Jev 发布两天内获得 3600 万次视频观看,涌现 ModernBert、DiffusionGemmaJev、Bespoke Nimble、SemIf、Jevlike、Kev-0.5B 等复现;Bespoke Nimble 在评测中将 Qwen3.5 基线从 66% 提升至 90%,Kev-0.5B 可在 MacBook Pro 运行。数据被承认 100% 合成,且尚无该类模型的标准基准。

    推荐理由:原文梳理了 Jev 类判别式决策模型的复现生态与浏览器自动化集成路径,读者可借此判断工作流控制平面的近期走向。

9月18日周五
  1. Latent Space79

    AI 新闻速览:Agent 运行时、判断模型与垂直产品

    Anthropic 在 Claude Code 推出 Projects,支持单对话衍生多云线程并传递上下文;Google 更新 Gemini managed agents,增加 Credentials 和 Files API 并声称成本下降 30%、缓存命中提升 22%;OpenAI 发布 Astra for Law 垂直包装。

    推荐理由:多线程协调、判断原语和可验证评测等讨论,为理解 Agent 运行时架构的下一层演进提供了可迁移的技术视角。

  2. Apple Machine Learning Research34

    Dynamically Scaled Activation Steering(DSAS)方法解析

    DSAS 是一种与方法无关的激活转向框架,通过自适应调节转向强度,在仅检测出不需要的行为时才进行干预。该方法在生成时计算上下文相关的缩放因子,可与现有转向方法联合优化,在毒性缓解与效用保持之间取得更好平衡。DSAS 适用于文本到图像扩散模型,计算开销小且能定位需要转向的 token。

9月17日周四
  1. Ben's Bites · News67

    Claude Cowork 合并入 Claude Chat

    Claude Cowork 将合并到 Claude Chat,取消独立标签页,所有连接应用、技能与上下文可在普通 Claude.ai 聊天中使用,合盖后仍可继续工作。Claude Artifacts 新增 Docs 和 Slides 专用产品,Claude Design 移入对话;Claude Code 推出名为 Mods 的实验,可修改应用外观与行为。

  2. Tom's Hardware · AI48

    开发者用 GPT-6 Astra 将《使命召唤:黑色行动2》Hijacked 地图原生移植到 Minecraft

    Luckey Faraday 使用 GPT-6 Astra 将《黑色行动2》Hijacked 地图从浏览器版重建为 Java 代码,直接运行在 Minecraft 自身 OpenGL 上下文而非内嵌浏览器中。地图、碰撞、AI 寻路、武器和渲染均以 Fabric Mod 形式注入游戏,视频显示约 45 fps 流畅全屏运行。开发者表示仍有大量工作待完成,后续可能追加地图、武器和多人模式。

  3. GitHub Blog · AI & ML78

    GitHub Copilot运行时迁移至Rust,使用Copilot

    GitHub Copilot运行时从TypeScript重写为Rust,由AI代理主导完成,超过80万行Rust代码。迁移过程实现了性能提升和跨产品共享运行时。

    推荐理由:原文详细记录了使用Copilot代理将GitHub Copilot运行时从TypeScript迁移至Rust的过程,性能提升显著,并实现了多产品共享。

  4. Nature · Machine Learning65

    AI团队以虚拟生物药企发现潜在肺癌药物

    研究人员构建了由多达37,000个智能体组成的“虚拟生物药企”,由一位“首席科学家”统筹,以加速药物发现。相关论文发表于Science(doi:10.1126/science.aeg6779),并有bioRxiv预印本(doi:10.64898/2026.04.20.719538)支持。

    推荐理由:虚拟生物药企的规模化智能体架构为AI制药提供了可参考的组织范式。

  5. Apple Machine Learning Research58

    REVERSAL-BENCH:可逆性轴与重置预言机,测量无重置强化学习的悬崖

    Apple ML Research 发布 REVERSAL-BENCH 基准,通过连续参数 ρ∈[0,1] 控制环境可逆性,并在八种操作设置、五种物理引擎中提供重置预言机与可恢复性标注。评估显示无重置智能体随 ρ 增大持续陷入不可恢复状态,而回合制智能体保持稳定学习;该失效由不可逆性驱动,而非障碍物复杂度,并存在于完整物理仿真与学习操作策略中。

  6. Nature · Machine Learning62

    AI 衰老研究新工具:专用大语言模型与 17 项基准发布

    Cell 今日发表报告,公布一套面向衰老生物学的人工智能系统,包含基于衰老数据训练的 LLM、17 项基准任务,以及将模型与代理(agent)整合的接口。作者用这些基准评估了专用 LLM 和 OpenAI、DeepSeek 等公司的通用大模型,发现专用模型在多数测试中表现更优。研究指出,衰老尚未有清晰定义,如何训练 AI 理解衰老仍是关键难题。

    推荐理由:为衰老生物学专门定制 LLM 与 17 项基准,揭示专用模型在特定领域或优于通用大模型。

  7. Microsoft Semantic Kernel62

    从专家代理到基于 MCP 的分布式技能:教程与实测对比

    作者 Tommaso Stocchi 以滑雪度假村演示为例,对比 A2A 专家代理与基于 MCP 的分布式技能两种架构,并给出五步迁移流程。技能路径将专家指令移入编排器,由 SDK 直接加载 SKILL.md 并暴露 MCP 工具;实测显示技能路径模型调用更少(3 次 vs 6-7 次)、延迟更低,但总 token 数反而增加约 22%。

    推荐理由:通过同一应用的 A2A 与 MCP 两种架构对比,给出可迁移的迁移步骤与实测延迟和 token 数据,帮助读者判断是否将专家代理改为分布式技能。

  8. IEEE Spectrum · AI58

    重新思考AI时代的机器人安全

    VicOne文章指出物理AI让机器人安全面临攻击者操控感知、决策和动作的新风险。传统功能安全关注故障,而网络安全关注恶意操控且系统可能仍看似正常。文章分三层分析:BadNets与BadVLA等攻击显示模型可能在隐藏触发条件下偏离行为;UniPwn等系统漏洞可导致无线入侵和指令覆盖;RoboPAIR、VLAttack等运行时操控可让机器人执行危险动作。

9月16日周三
  1. Latent Space88

    TypeSafe 发布 Jev:专注决策而非文本生成的前沿模型

    TypeSafe 发布 Jev,基于 RLCD 训练,宣称比小型前沿 LLM 快 20–200 倍、便宜 40–400 倍,输出 token 免费。社区指出它并非通用语言模型,更接近结构化分类器或裁判模型,适合替代生产系统中的 LLM 路由与判断。

    推荐理由:原文给出 Jev 在延迟与成本上的具体倍数优势,读者可据此判断其是否值得替代现有分类器与路由策略。

  2. Together AI40

    从闭源模型迁移到开源模型,Together AI 发布迁移指南

    Together AI 发布从闭源迁移到开源模型(OSM)的策略指南,采用托管服务可将迁移时间从数月/年缩短至数周。指南建议通过定义用例、筛选相关基准(如 FrontierCode、LMArena、τ-bench 等)锁定候选模型,并基于每任务成本、token 消耗和延迟进行对比,最终用真实流量回放做准确性与性能评估。

  3. Nature · Machine Learning74

    Paper2Agent:将科研论文转化为交互式 AI 智能体

    Nature 报道了 Miao 等人提出的 Paper2Agent 框架,可自动将科研论文转化为具备问答、方法应用与协作能力的 AI 智能体,提升研究的可复现性与可复用性。

    推荐理由:将静态论文转化为可交互的智能体,为研究复用与可复现性提供了新的技术路径。

  4. Apple Machine Learning Research73

    Shared Selective Persistent Memory for Agentic LLM Systems

    Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。

    推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。