大语言模型时代的研究可复现性
summary_zh: 大语言模型的输出具有概率性,相同提示词可能产生不同结果,且模型权重与训练数据不公开,导致基于旧版闭源模型的研究难以精确复现。文章建议研究者记录所用模型与版本、完整提示词、硬件与软件配置及超参数等细节,并优先测试开源模型,以提升透明度与可复现性。
summary_zh: 大语言模型的输出具有概率性,相同提示词可能产生不同结果,且模型权重与训练数据不公开,导致基于旧版闭源模型的研究难以精确复现。文章建议研究者记录所用模型与版本、完整提示词、硬件与软件配置及超参数等细节,并优先测试开源模型,以提升透明度与可复现性。
Weaviate 发布 Engram 托管记忆与上下文服务,演示如何通过主题描述、边界、作用域与检索模式控制代理记忆。原文给出从 raw 数据到记忆的流水线、主题描述决定记忆内容与形态、bounded 与 scope 的行为差异,以及四种提示词布局下的缓存与计费对比。
推荐理由:原文通过真实输出演示了四个配置决策如何改变代理的记忆行为,读者可依此调整自己的主题描述与提示词布局。
TypeSafe AI 发布 Jev,定位为面向软件开发的 System One 模型,核心创新是用 RLCD 替代 RLHF/RLVR,强调校准性与可靠性。Jev 优先服务于代码调用,创始人 Diogo Almeida 主张模型应融入软件底层并最终消失于背景。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Amazon 与斯坦福大学联合发起 Stanford and Amazon Research Initiative,聚焦 AI、能源和医疗领域的前沿研究。目前 Amazon 在斯坦福资助超过 10 个团队的研究和博士奖学金,涵盖人形机器人、后量子密码学、因果测量科学和 AI 放射学等方向。合作通过联合研究项目、博士奖学金和研讨会等形式,缩短从突破性研究到实际应用的路径。
Amazon Bio Discovery团队发表三篇论文,分别提出MochiBind结合力预测、CA-MAP可开发性预测和基于智能体的纳米抗体设计流程。MochiBind在跨抗原验证中比结构基线平均提升近10%配对准确率,并在CPU上约13秒完成20万对抗体评分。
推荐理由:三篇论文分别针对抗体设计中的结合力排序、可开发性预测和全流程设计验证,给出了可复现的评估框架与实验结果。
TypeSafe AI 推出首款 System One 模型 Jev,由前 OpenAI 工程师 Diogo Almeida 主导,针对陈述评估与决策场景设计,而非开放式对话。Jev 以结构化 JSON 返回带置信度的答案,支持并行处理、无全局记忆,宣称比 GPT-6 Astra 快 194 倍、便宜 445 倍,上下文窗口上限 64k tokens。
Google 开发的 Co-Scientist 通过多个自主智能体搜索文献、生成并筛选假设,帮助生物化学家 Anna Pertl 找到针对 MYC 蛋白的新策略。Frontier AI 实验室与初创公司也在推出类似平台,强调人类提问与判断仍不可替代。
推荐理由:展示了多智能体协作在科学假设生成中的实际工作流,读者可迁移其‘提问—修正—验证’方法到自身研究场景。
summary_zh: V7 使用 GPT-5.6 将分散的公司文件转化为上下文,供智能体完成复杂且带来源链接的工作。成本降低 78% 同时准确率提升。 V7 使用 GPT-5.6 将分散的公司文件转化为上下文,供智能体完成复杂且带来源链接的工作。成本降低 78% 同时准确率提升。
summary_zh: voxium 透露其入职某大公司半月,团队从 L1 到 L7 工程师都在用 Claude Code 撰写规格、代码、测试、PRD、工单及报告。
MCP 并非坏主意,对于需要受控访问、认证隔离和审计日志的场景,它让这些能力更易实现。具备无限制网络访问的终端智能体(如 Claude Code、Codex、Meta Muse、OpenClaw)可直接调用 API,无需 MCP;认为 MCP 因全能编程智能体而不必要的看法,忽略了其他可构建的需求。
llm-keys-ui 0.1 发布,提供一种不把 API key 粘贴进 agent 会话或 ChatGPT app 就能将其保存到远程机器的方式。
summary_zh: GPT-6 Astra 用关键词 "TRUPPENVERSCHIEBUNG" 解密了一条 1918 年 11 月 29 日的德国无线电报文,原文为 "AN ENGLISH CRUISER ARRIVED AT SEVASTOPOL ON THE ?
Jev 发布两天内获得 3600 万次视频观看,涌现 ModernBert、DiffusionGemmaJev、Bespoke Nimble、SemIf、Jevlike、Kev-0.5B 等复现;Bespoke Nimble 在评测中将 Qwen3.5 基线从 66% 提升至 90%,Kev-0.5B 可在 MacBook Pro 运行。数据被承认 100% 合成,且尚无该类模型的标准基准。
推荐理由:原文梳理了 Jev 类判别式决策模型的复现生态与浏览器自动化集成路径,读者可借此判断工作流控制平面的近期走向。
GPT-6 Astra 与 Fable 5.1 已具备变革性能力,可可靠完成数周的人类工作,如将 Zork 文本冒险游戏转为 3D 动作游戏、从视频重建 Umberto Eco 图书馆的 3D 场景。
Anthropic 在 Claude Code 推出 Projects,支持单对话衍生多云线程并传递上下文;Google 更新 Gemini managed agents,增加 Credentials 和 Files API 并声称成本下降 30%、缓存命中提升 22%;OpenAI 发布 Astra for Law 垂直包装。
推荐理由:多线程协调、判断原语和可验证评测等讨论,为理解 Agent 运行时架构的下一层演进提供了可迁移的技术视角。
DSAS 是一种与方法无关的激活转向框架,通过自适应调节转向强度,在仅检测出不需要的行为时才进行干预。该方法在生成时计算上下文相关的缩放因子,可与现有转向方法联合优化,在毒性缓解与效用保持之间取得更好平衡。DSAS 适用于文本到图像扩散模型,计算开销小且能定位需要转向的 token。
Anthropic 为 Claude Code 云端用户重设计项目功能,支持多线程编排、共享记忆与跨仓库协作;目前仅面向部分 Pro/Max 订阅者,本地终端用户暂不包含。
Claude Cowork 将合并到 Claude Chat,取消独立标签页,所有连接应用、技能与上下文可在普通 Claude.ai 聊天中使用,合盖后仍可继续工作。Claude Artifacts 新增 Docs 和 Slides 专用产品,Claude Design 移入对话;Claude Code 推出名为 Mods 的实验,可修改应用外观与行为。
Luckey Faraday 使用 GPT-6 Astra 将《黑色行动2》Hijacked 地图从浏览器版重建为 Java 代码,直接运行在 Minecraft 自身 OpenGL 上下文而非内嵌浏览器中。地图、碰撞、AI 寻路、武器和渲染均以 Fabric Mod 形式注入游戏,视频显示约 45 fps 流畅全屏运行。开发者表示仍有大量工作待完成,后续可能追加地图、武器和多人模式。
Latent Space汇总9/15–9/16 AI新闻,包括Steve Yegge关闭Gas Town并承认高订阅投入仅产出该项目、Databricks工程师切换Astra后编码支出增加约60%。
GitHub Copilot运行时从TypeScript重写为Rust,由AI代理主导完成,超过80万行Rust代码。迁移过程实现了性能提升和跨产品共享运行时。
推荐理由:原文详细记录了使用Copilot代理将GitHub Copilot运行时从TypeScript迁移至Rust的过程,性能提升显著,并实现了多产品共享。
研究人员构建了由多达37,000个智能体组成的“虚拟生物药企”,由一位“首席科学家”统筹,以加速药物发现。相关论文发表于Science(doi:10.1126/science.aeg6779),并有bioRxiv预印本(doi:10.64898/2026.04.20.719538)支持。
推荐理由:虚拟生物药企的规模化智能体架构为AI制药提供了可参考的组织范式。
Apple ML Research 发布 REVERSAL-BENCH 基准,通过连续参数 ρ∈[0,1] 控制环境可逆性,并在八种操作设置、五种物理引擎中提供重置预言机与可恢复性标注。评估显示无重置智能体随 ρ 增大持续陷入不可恢复状态,而回合制智能体保持稳定学习;该失效由不可逆性驱动,而非障碍物复杂度,并存在于完整物理仿真与学习操作策略中。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能、定制化律所工作流、关联法律数据源以及法律级保密控制。方案面向客户保密场景设计,具体模型版本、参数规模与价格信息原文未披露。
Cell 今日发表报告,公布一套面向衰老生物学的人工智能系统,包含基于衰老数据训练的 LLM、17 项基准任务,以及将模型与代理(agent)整合的接口。作者用这些基准评估了专用 LLM 和 OpenAI、DeepSeek 等公司的通用大模型,发现专用模型在多数测试中表现更优。研究指出,衰老尚未有清晰定义,如何训练 AI 理解衰老仍是关键难题。
推荐理由:为衰老生物学专门定制 LLM 与 17 项基准,揭示专用模型在特定领域或优于通用大模型。
作者 Tommaso Stocchi 以滑雪度假村演示为例,对比 A2A 专家代理与基于 MCP 的分布式技能两种架构,并给出五步迁移流程。技能路径将专家指令移入编排器,由 SDK 直接加载 SKILL.md 并暴露 MCP 工具;实测显示技能路径模型调用更少(3 次 vs 6-7 次)、延迟更低,但总 token 数反而增加约 22%。
推荐理由:通过同一应用的 A2A 与 MCP 两种架构对比,给出可迁移的迁移步骤与实测延迟和 token 数据,帮助读者判断是否将专家代理改为分布式技能。
VicOne文章指出物理AI让机器人安全面临攻击者操控感知、决策和动作的新风险。传统功能安全关注故障,而网络安全关注恶意操控且系统可能仍看似正常。文章分三层分析:BadNets与BadVLA等攻击显示模型可能在隐藏触发条件下偏离行为;UniPwn等系统漏洞可导致无线入侵和指令覆盖;RoboPAIR、VLAttack等运行时操控可让机器人执行危险动作。
Anthropic 把 Claude Cowork 和 Claude Chat 合并为统一的 Claude,并将 Design、Slides 和 Docs 集成到同一界面,Pro 与 Max 计划率先开放。Anthropic 表示用户无需选择任务去向,Cliaude 会自动判断所需能力,且 Design 等工具仍可独立使用。
GPT-6 Astra 帮助 Hex 的数据代理将分析答案转化为可交互可视化报告,使员工愿意分享这些可视化内容。
Vals AI 记录 GPT-6 Astra 在 141 小时 Minecraft 基准测试中走得比任何 AI 都远,却因 Creeper 炸毁箱子与床而丢失全部装备和出生点。随后数小时几乎只种土豆,并出现
TypeSafe 发布 Jev,基于 RLCD 训练,宣称比小型前沿 LLM 快 20–200 倍、便宜 40–400 倍,输出 token 免费。社区指出它并非通用语言模型,更接近结构化分类器或裁判模型,适合替代生产系统中的 LLM 路由与判断。
推荐理由:原文给出 Jev 在延迟与成本上的具体倍数优势,读者可据此判断其是否值得替代现有分类器与路由策略。
Reddit 用户 Atol8 基于 OpenAI 本月发布的 GPT-6 Astra 模型构建了 Balatro 机器人,成功击败游戏中公认最难组合的 Gold Stake Black Deck。GPT-6 Astra 负责基于当前牌组做出战略决策,合法性由独立的 BalatroBot 工具评估。Reddit 评论指出机器人在对局中仍出现明显失误。
Naoki Egami 是 MIT 政治科学家,研究方向为社会科学方法论与外部效度,关注 AI 工具在研究中的准确性及误差识别。他于 2025 年加入 MIT 政治学系,同时为 IDSS 统计学与数据科学中心教员。
Together AI 发布从闭源迁移到开源模型(OSM)的策略指南,采用托管服务可将迁移时间从数月/年缩短至数周。指南建议通过定义用例、筛选相关基准(如 FrontierCode、LMArena、τ-bench 等)锁定候选模型,并基于每任务成本、token 消耗和延迟进行对比,最终用真实流量回放做准确性与性能评估。
summary_zh: Glyph 将企业数据目录的列描述生成与类型标注建模为协作 LLM 智能体图。描述器通过 active RAG 从企业 GitHub 检索管道源码;标注器并行运行描述标签器、业务正则标签器和基于微调对比编码器的元数据标签器,再用 RRF 融合输出。
Nature 报道了 Miao 等人提出的 Paper2Agent 框架,可自动将科研论文转化为具备问答、方法应用与协作能力的 AI 智能体,提升研究的可复现性与可复用性。
推荐理由:将静态论文转化为可交互的智能体,为研究复用与可复现性提供了新的技术路径。
Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。
推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。
summary_zh: DACA-GRPO 是一种轻量级即插即用的 GRPO 训练增强方法,针对扩散语言模型强化学习中去噪步骤等权处理和均值场似然估计有偏的两大缺陷,引入去噪进度分数与分层掩码似然两个互补机制。
Salesforce 在 Dreamforce 发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 后训练而来,可用 NVIDIA NeMo RL 等工具微调,训练语料覆盖 14+ 行业。
Good Start Labs 由 Alex Duffy 和 Tyler Marques 从 Every 分拆而出,获得 360 万美元融资,研究用游戏训练 AI 模型。