从 AI Copilot 到 Agent Swarm:AMD 软件工程转型复盘
AMD 工程师 Andrej Zdravkovic 复盘公司 AI 转型:目标 25% 生产力提升,一年后达 30%;AI 生成代码占比年初突破 20%,部分组件超 80%,整体向 50% 推进。
AMD 工程师 Andrej Zdravkovic 复盘公司 AI 转型:目标 25% 生产力提升,一年后达 30%;AI 生成代码占比年初突破 20%,部分组件超 80%,整体向 50% 推进。
summary_zh: Jeremy Howard 离开 AI 领域三年后重返 fast.ai 团队,加入 Answer.AI 专注 AI 教育。Answer.AI 由 fast.ai 演变而来,团队开发了 SolveIt 工具,将问题解决分为理解、计划、执行、回顾四个阶段,让用户直接编辑 AI 回答并自行决定下一步。
Together AI 在 DeepSWE 基准上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5:Fable 首试准确率 69.7% 高于 Pro 的 62.8%。
推荐理由:在 DeepSWE 评测中两款模型价格相差 90 倍但表现接近,读者可据此判断何时值得为 Fable 支付溢价。
AWS 因 AI 工作负载挤压云基础设施而要求工程师节约 CPU 周期,Moor Insights 与 Georgia Tech 的研究指出智能体 AI 的工具调用、调度和分词等环节主要落在 CPU 上。Intel、AMD、Arm、Qualcomm 与 Nvidia 均已加码服务器 CPU 或相关平台,可能带来新一轮 CPU 短缺与涨价。
Z.ai 发布 GLM-5.3,目前仅在编码计划中可用,两周后开放权重并上线 Hugging Face。该模型在多个基准上超越 Kimi K3、Claude Fable 5 和 GPT-5.6-Sol,参数量仅约 750B,约为 Kimi K3 的三分之一。
推荐理由:在参数规模明显更小的情况下,GLM-5.3 在智能体编码基准上逼近前沿,读者可借此观察中国实验室的训练策略与美国厂商的发布节奏差异。
个人 Agent 的核心能力是读取文件、接收指令、使用工具并写入记忆,本质是文件夹与指令文件的设定,而非独立产品。Grok Bot 等产品将相同能力包装成独立体验,但用户用 Codex 或 Claude Code 加文件夹设定也能实现同样效果。用户可自定义多个任务专用 Agent、共享记忆、自动化工作流,并选择是否拆分独立线程。
Hugging Face 发布 2026 年上半年开源模型观察报告,指出中国实验室在几乎每个月的前沿模型规模都超过美国模型,同时 Qwen 衍生模型达 15 万个、成为社区基础模型。下载量高度集中于小模型,GGUF 等本地推理格式增长远超模型仓库本身增速。Agent 首次成为 Hub 主要流量来源,7 月 Claude Code 占 44.4%,近四分之一流量来自未注册客户端。
推荐理由:报告揭示了开源模型格局的前沿迁移与采纳现实之间的落差,为观察中国实验室的发布策略与社区实际依赖提供了可对照的数据视角。
Strands Robots 演示了用 Storage Bucket 记录 LeRobot 格式数据、通过字节级去重同步、从 Hub 流式读取训练、再以 mode='real' 部署到物理机器人的完整循环。示例使用 SO-100 机械臂和 mock policy,配套 notebook 在模拟环境即可运行。
推荐理由:原文给出一条从录制到训练再到部署的完整数据循环,读者可据此判断它会怎样改变现有机器人工作流。
Google DeepMind 发布 Gemini 3.7 Flash,定位为编码与智能体工作负载的最智能基础模型,在 FrontierCode 1.1 Main(43.6% vs 34.4%)。
GitHub Secure Open Source Fund Session 4 覆盖 50 个项目、71 位维护者,投入超 $500,000 非稀释性资金 pairing 维护者与 GitHub Security Lab 专家、GitHub 安全工具及 AI 辅助工作流。
Grok Bot 随 Grok 4.6 正式发布,作者从早期使用到公开上线后持续体验,认为其形式更接近 Slack 队友、复杂度更低。用户可为每个智能体设定系统提示、智能体之间可互发消息、拥有独立虚拟电脑并连接 Gmail/Calendar/Slack 等账户,还支持屏幕观察教学和自动化设置。当前仅限 Cursor 或 Grok 的 $200 计划用户访问。
作者完成一本后训练教材《Reinforcement Learning from Human Feedback》,用LLM辅助LaTeX排版、校对和制图。GPT 5.5 Pro能发现200-300页手稿中的深层次小错误,Claude模型更擅长编辑和提供建议。长篇非虚构写作组织混乱、概念错误频发,模型在长文本中会累积不可约的错误。
巴基斯坦在咨询司法系统后,由经济学家Sultan Mehmood与合作者为1,559名法官推出定制工具JudgeGPT,结合GPT-4与约13万份巴基斯坦判例和法规的RAG知识库。试验发现经6次90分钟Zoom培训后,结案率中位数提升6.3%,上诉率微降,且培训不足者约一个月后停用。质量评估由GPT-5-mini和两位律师进行,但未报告幻觉率。
AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。
推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。
ALTK-Evolve 与 ACE 都将智能体历史轨迹转化为可复用经验,但 ACE 每次注入完整剧本,ALTK-Evolve 按任务与模型能力选择性检索。AppWorld 上 DeepSeek-V3.2 TGC 89.3 vs 80.4、Token 263K vs 634K;gpt-oss-120b TGC 56.0 vs 54.8、Token 116K vs 777K。
推荐理由:同样不压缩经验,ALTK-Evolve 按模型能力分发提示,在强模型上以约 40% 的 ACE 推理成本取得更高准确率。
NVIDIA Nemotron 3.5 Lightning 现已上线 Ollama,30B 总参数、每 token 仅 3B 活跃参数,基于混合专家架构,专为本地 Agent 设计。模型支持 1M 上下文、推测解码多令牌预测,经称可达 4 倍吞吐量与 30% 更快任务完成时间,权重与数据集均开源,可在 RTX PC、工作站、DGX Spark / Station 及云端运行。
推荐理由:开源本地 Agent 模型兼顾 3B 活跃参数与 1M 上下文,读者可据此评估在 RTX 设备上跑高吞吐多步任务的可行性。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Meta Superintelligence Labs 发布开源多模态模型 Muse Glimmer(30B,Apache 2.0),已在 Ollama 上线,支持 128K+ 上下文,专为本地 Agent 工作流设计。
推荐理由:原文给出了本地 Agent 工作流的具体入口和 Apple Silicon 上的性能提升,读者可以据此判断它会怎样改变本地编码与多模态调用方式。
论文与两位未发表AI论文作者合作,让前沿AI智能体在6天、数千美元API额度内尝试回答其核心研究问题;两位作者均明确拒绝智能体产出的论文。分析发现智能体缺乏开放式研究所需的判断力、资源意识和创造力,未能有效回溯或遵循指令。研究团队承认样本小、存在立场偏见,并计划扩大样本与改进脚手架以持续评估。
GitHub Copilot Agent 在 Microsoft Agent Framework 中正式发布,支持 .NET 和 Python。Copilot 负责模型调用、工具执行、规划与会话状态,Agent Framework 提供指令、流式传输、中间件、可观测性与人工审批。
推荐理由:GitHub Copilot 的编码能力与 Agent Framework 的扩展性结合,开发者可在同一编程模型里接入 MCP、自定义工具和审批治理。
GitHub 推出 stacked pull requests 原生支持与 gh-stack CLI 扩展,把单个体量庞大的 AI 生成 PR 拆成数据、API、链路、UI 四层独立可审栈。配合 gh-stack skills 让编码 Agent 按层提交、CI 逐层校验,并通过 stack map 与 rebase/sync 命令维护栈一致性。
推荐理由:原文给出分层 PR 的具体结构与 CLI 命令,读者可迁移该工作流以降低 AI 生成代码的审查负担。
Microsoft Research 发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。
推荐理由:开源框架 Orchard 把训练、评估与真实部署 harness 打通,让小参数模型也能在 SWE-bench 等基准接近前沿系统。
多国研究人员构建了基于开源大语言模型的自复制AI蠕虫原型,利用被控GPU资源运行推理并自主传播,漏洞检测成功率约80%,自我复制成功率约88%,完整攻击成功率约37%。论文指出自持型AI驱动的网络威胁已不再只是理论假设。
推荐理由:展示了自复制AI蠕虫的原型实现,读者可借此理解自主AI威胁从理论走向实践的具体路径。
Kimi K3 是 Moonshot AI 发布的 2.8 万亿参数开源模型,是全球首个 3 万亿参数量级的开源模型,支持 1M 上下文长度,在 Together AI 上提供 OpenAI 兼容 API。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google Research 提出 Science One Framework 与 Chain-of-Evidence(CoE)审计框架,在 75 篇生成论文上验证自主研究系统的可验证性。Science One Framework 在五个 ADRS 任务上实现零幻影引用、完全可复现得分,并在 MLE-Bench 与 Parameter-Golf 上达到 SOTA。
推荐理由:通过引入可验证证据链框架,为自主研究系统的可信度提供了可量化的审计方法。
Amazon在ICML发表论文提出ControlG框架,将多任务图自监督学习的梯度混合改为按时间分配计算资源,由PID控制器逐块调度目标。系统在9个图基准上平均排名1.4–1.9,ogbn-arxiv达72.86%,并开源代码。
推荐理由:将工业控制中的PID控制器引入多任务训练,为避免梯度冲突提供了可解释的新调度范式。
Microsoft Agent Framework 正式集成 GitHub Copilot CLI/SDK 与开源多智能体框架 Squad,提供 Squad.Agents.AI NuGet 包,将 Squad 团队包装为标准 MAF AIAgent。
推荐理由:MAF与Squad通过一个NuGet包和DI调用即可组合,适合已有MAF流水线的开发者低成本接入会随使用积累领域知识的多智能体团队。
Microsoft Research 发布 Echoverse,包含 10 个深度领域世界和 2 个能力世界,通过数据库锚定的真实状态与可重置环境训练计算机使用智能体。
推荐理由:高保真合成环境与模型共同进化的闭环设计,为计算机使用智能体提供了可复现的训练与评估新路径。
EvoLib是一个让大语言模型在推理过程中从自身经验自主学习的框架,无需真实标签或外部反馈,将过去尝试转化为可复用技能和反思性洞察。在数学推理、代码编写和长时序任务上,EvoLib一致优于检索式记忆方法,以更少token实现更高性能,并将测试时计算更有效地转化为性能增益。该框架无需模型更新,可应用于任何通过API部署的黑盒语言模型,且对任务顺序具有鲁棒性。
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
Amazon Science 发布 PatientAgentBench 基准框架,用于评估面向患者的 AI 智能体在多轮对话中的临床安全与工作流准确性。该基准基于合成病历与动态场景,由 LLM-as-a-jury 按六维度打分,并在千余次对话中测试前沿模型,发现模型在常规行政请求中易遗漏风险,且能力提升仍无法完全关闭临床安全缺口。框架已开源至 GitHub,包含场景生成、工具沙箱与评估系统。
推荐理由:基准揭示了即使强模型在常规病例中也易遗漏临床风险,为安全设计指明了可迁移的改进方向。
ThunderAgent 在单 8×H100 节点上相对 SGLang 达到 2.5 倍吞吐量、P50 延迟降低约 10 倍,8 节点集群实现 2.4 倍加速且接近线性扩展。
推荐理由:把多轮 agent 请求视为程序而非独立请求,让 KV cache 命中率提升并缓解多节点负载不均。
Together AI 与 Moonshot AI 达成战略合作,成为 Kimi 模型的首发平台,首发模型为 Kimi K3。Kimi K3 是迄今最大开源模型,参数规模达 2.8T 的稀疏 MoE 架构,支持原生视觉与 1M token 上下文窗口。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
Epoch 和 METR 发布 MirrorCode 基准,测试 AI 在仅通过 CLI 访问的情况下重新实现软件程序的能力。Opus 4.7 在 14 小时、$251 推理成本内完成了一个需人类 2-17 周的任务。25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100%。
推荐理由:MirrorCode 显示 AI 已能自主重新实现大型软件项目,读者可借此评估当前模型在长程编程任务上的真实能力边界。
Berkeley AI Research 提出 ABBEL 框架,将交互历史压缩为自然语言信念状态,并通过信念评分监督信念内容。在 CollabBench 协作编程中,ABBEL 恢复约一半全上下文性能差距,峰值上下文 token 数降至约 4.2 万,训练步数减半;在 Combination Lock 游戏中,结合领域知识的信念评分可接近或超越全上下文模型。
推荐理由:通过将摘要隔离为可监督的信念状态,在协作编程和组合游戏中以更少训练步数和更低显存缩小了与全上下文模型的性能差距。
作者给出 AI 工具选择建议:低 stakes 任务可用免费模型,高 stakes 任务应选 Claude Opus/Fable 或 ChatGPT GPT-5.6 Sol 并调至 High 思考级别;真正的工作负载推荐 ChatGPT 或 Claude 的代理模式,并区分公司提供虚拟计算机与授权 AI 访问自己计算机两种方式。
美国能源部在 Genesis Summit 上宣布首批资助项目,MIT 主导 6 个、参与 9 个,涉及量子传感器、稀土提取、聚变数字孪生、AI 驱动材料设计等方向。Phase I 阶段团队需展示 AI 与科学工作流整合,并评估科学价值;后续可申请进一步资助。研究经费待签订协议协议。
Google Research发布SymptomAI研究,基于Gemini Flash 2.0通过13,917人随机实验表明临床医生在超50%情况下更偏好其鉴别诊断,且主动询问策略显著优于被动回答。
推荐理由:该研究通过一万三千余人的随机对照实验,为对话式AI症状评估提供了与临床医生横向比较的基准数据,并揭示了主动询问策略对诊断准确性的提升作用。
Google DeepMind 在 DOE 的 Genesis Mission Summit 2026 上宣布投入 4000 万美元的 AI token 与云额度,支持 Genesis Mission 的科研人员。