跳到正文

全部动态

今日 125 条
8月6日周四
8月5日周三
  1. Microsoft Semantic Kernel72

    GitHub Copilot Agent 在 Microsoft Agent Framework 中正式发布

    GitHub Copilot Agent 在 Microsoft Agent Framework 中正式发布,支持 .NET 和 Python。Copilot 负责模型调用、工具执行、规划与会话状态,Agent Framework 提供指令、流式传输、中间件、可观测性与人工审批。

    推荐理由:GitHub Copilot 的编码能力与 Agent Framework 的扩展性结合,开发者可在同一编程模型里接入 MCP、自定义工具和审批治理。

  2. GitHub Engineering60

    GitHub Stacked Pull Requests:将巨型 AI 生成 PR 拆分为可审查的分层栈

    GitHub 推出 stacked pull requests 原生支持与 gh-stack CLI 扩展,把单个体量庞大的 AI 生成 PR 拆成数据、API、链路、UI 四层独立可审栈。配合 gh-stack skills 让编码 Agent 按层提交、CI 逐层校验,并通过 stack map 与 rebase/sync 命令维护栈一致性。

    推荐理由:原文给出分层 PR 的具体结构与 CLI 命令,读者可迁移该工作流以降低 AI 生成代码的审查负担。

8月4日周二
  1. Meta Engineering · AI71

    Meta GEM 训练:如何将广告推荐基础模型效率在 LLM 规模下翻倍

    Meta 发布 GEM 训练细节,通过定制推荐内核库、混合超低精度训练、拓扑感知 5D 并行与 SM-free 通信等协同设计,将端到端训练效率翻倍至 20–25% MFU,并在 12 个月内将训练 FLOPs 扩展 4 倍。

    推荐理由:Meta 分享了 GEM 在 LLM 规模下训练推荐模型的具体方法,为跨推荐与 LLM 的基础设施协同设计提供可迁移经验。

  2. Microsoft Research82

    Orchard:面向可扩展智能体 AI 的开源框架

    Microsoft Research 发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。

    推荐理由:开源框架 Orchard 把训练、评估与真实部署 harness 打通,让小参数模型也能在 SWE-bench 等基准接近前沿系统。

8月3日周一
  1. Import AI80

    AI自复制蠕虫原型出现:Open-weight LLM + 定制化框架实现自主传播

    多国研究人员构建了基于开源大语言模型的自复制AI蠕虫原型,利用被控GPU资源运行推理并自主传播,漏洞检测成功率约80%,自我复制成功率约88%,完整攻击成功率约37%。论文指出自持型AI驱动的网络威胁已不再只是理论假设。

    推荐理由:展示了自复制AI蠕虫的原型实现,读者可借此理解自主AI威胁从理论走向实践的具体路径。

8月1日周六
7月31日周五
  1. Microsoft Semantic Kernel67

    Microsoft Agent Framework 集成 GitHub Copilot CLI 与 Squad 构建智能体团队

    Microsoft Agent Framework 正式集成 GitHub Copilot CLI/SDK 与开源多智能体框架 Squad,提供 Squad.Agents.AI NuGet 包,将 Squad 团队包装为标准 MAF AIAgent。

    推荐理由:MAF与Squad通过一个NuGet包和DI调用即可组合,适合已有MAF流水线的开发者低成本接入会随使用积累领域知识的多智能体团队。

  2. Microsoft Research45

    EvoLib:将经验转化为演化知识

    EvoLib是一个让大语言模型在推理过程中从自身经验自主学习的框架,无需真实标签或外部反馈,将过去尝试转化为可复用技能和反思性洞察。在数学推理、代码编写和长时序任务上,EvoLib一致优于检索式记忆方法,以更少token实现更高性能,并将测试时计算更有效地转化为性能增益。该框架无需模型更新,可应用于任何通过API部署的黑盒语言模型,且对任务顺序具有鲁棒性。

7月30日周四
7月29日周三
  1. Berkeley AI Research62

    K-Search:从 CUDA 到 MLX 的内核优化迁移研究

    Berkeley Sky Lab 与 IBM Research 将 K-Search 进化式内核搜索框架扩展至 MLX 后端,通过结构化 CUDA-to-MLX 翻译层在 Apple Silicon 上复现专家级性能。在注意力内核上达到原生 MLX 的 0.97 倍速度,Mamba SSM prefill 相比社区 mlx-lm 提升约 20 倍;代码与后端已开源。

    推荐理由:结构化翻译层让 CUDA 经验可迁移到 Apple Silicon,读者可借此评估跨平台内核优化的可行边界。

7月28日周二
  1. Microsoft Semantic Kernel62

    .NET Agent 支持从 MCP 服务器发现和加载 Agent Skills

    Microsoft Semantic Kernel 在 .NET 中通过 Microsoft.Agents.AI.Mcp 包支持从 MCP 服务器按需发现和加载 Agent Skills。技能以 skill-md 或 archive 方式分发,通过 skill://index.json 发现,并保留渐进式披露和审批机制。archive 下载有文件数、大小和解压后大小上限,且远程脚本永不执行。

    推荐理由:让 Agent 按需从 MCP 服务器发现和加载技能,减少重复打包与重新部署,适合多 Agent 共享领域知识。

7月27日周一
  1. Import AI87

    Epoch 与 METR 发布 MirrorCode 基准测试:AI 系统完成长达一周的编程任务

    Epoch 和 METR 发布 MirrorCode 基准,测试 AI 在仅通过 CLI 访问的情况下重新实现软件程序的能力。Opus 4.7 在 14 小时、$251 推理成本内完成了一个需人类 2-17 周的任务。25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100%。

    推荐理由:MirrorCode 显示 AI 已能自主重新实现大型软件项目,读者可借此评估当前模型在长程编程任务上的真实能力边界。

  2. Hugging Face Blog64

    NVIDIA 发布 Cosmos-H-Dreams:实现手术机器人实时生成式仿真

    NVIDIA 发布 Cosmos-H-Dreams,一款基于单张 RTX PRO 6000 GPU 运行的手术机器人实时生成式仿真器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,通过 FlashDreams 推理库实现约 160 fps 的交互式操作,每潜在帧仅需 2 步去噪,支持 dVRK 桌面缝合任务,并可连接学习型手术策略形成闭环。

    推荐理由:NVIDIA将手术世界模型压缩至单卡实时推理,使外科机器人策略的闭环评估与合成数据生成不再依赖稀缺物理硬件。

7月24日周五
  1. Microsoft Semantic Kernel65

    Microsoft Agent Framework 声明式工作流 1.0 发布

    Microsoft Agent Framework 的声明式工作流(Declarative Workflows)Python 与 .NET SDK 均达到 1.0。团队可用 YAML 定义多智能体编排、状态与分支逻辑,并作为标准 Workflow 运行、流式处理和组合。示例展示支持台路由场景,并提供客户支持等可运行样例。

    推荐理由:原文给出 YAML 定义与代码加载方式,读者可据此评估声明式编排是否适配现有工作流。

7月23日周四
  1. Hugging Face Blog68

    Nunchaku Lite 正式接入 Diffusers,4-bit 量化扩散模型推理无需额外推理引擎

    Nunchaku Lite 现已原生集成到 Diffusers,用户可通过 from_pretrained() 直接加载 4-bit 量化扩散模型,无需单独推理引擎或本地 CUDA 编译。

    推荐理由:Nunchaku Lite 现已原生接入 Diffusers,无需额外引擎即可通过 from_pretrained() 加载 4-bit 量化模型,在 RTX 5090 上 VRAM 从 24GB 降至约 12GB,推理加速约 30%。

  2. Together AI73

    Together AI 推出专用模型推理平台 Dedicated Model Inference

    Together AI 发布 Dedicated Model Inference 平台,支持部署自有或开源权重模型,并提供部署配置、预热加速、Canary/蓝绿/滚动发布、A/B 与影子流量测试及 Prometheus 可观测性。平台覆盖从实验到生产的全生命周期,并同步开启自定义训练(含 LoRA 与强化学习)封闭测试。

    推荐理由:原文给出部署预热、流量切换与可观测性等具体能力,读者可以据此判断它能否降低自研推理栈的运维成本。

7月22日周三
7月21日周二
  1. Hugging Face Blog72

    Grabette:开源手持设备记录机器人操作数据

    Grabette 是 Pollen Robotics 发布的开源手持采集设备,配合 Gripette 机械爪端,能用普通相机、IMU 和深度相机记录操作演示,并自动生成 LeRobot 格式的机器人就绪数据集。

    推荐理由:原文给出了低成本的采集方案与开放数据集入口,读者可以据此判断它能否降低机器人学习的数据门槛。

7月20日周一
  1. Together AI42

    Together AI 与 Y Combinator 合作推出首个 YC 专属 GPU 集群

    Together AI 与 Y Combinator 合作推出首个 YC 专属 GPU 集群,为 YC 旗下 AI 原生初创公司提供按需 GPU 资源。创业公司可通过 Together 自助门户直接预订、配置和管理 GPU,享受长期价格而无需长期承诺,集群当前已满载运行。该集群覆盖从单节点到大规模扩展的需求,创始人还可获得 Together 团队在推理与训练方面的最佳实践支持。

7月18日周六
  1. GitHub Engineering42

    AI 编程时代“小需求”的成本结构变了

    代码生成变便宜后,“是否做这个需求”的评审成本往往高于写代码本身。用 AI 先产出最小可运行补丁,能把抽象的范围争论转为具体证据:四行代码加测试即可上线;触及权限或数据保留等核心契约的请求则暴露真实复杂度。关键区分不是“能否生成”,而是“人类能否 confidently review 并承担后续所有权”。

7月16日周四
  1. MIT News · AI60

    MIT提出GIFT系统,让视觉语言模型自动将2D设计转为更精确的CAD程序

    MIT与Red Hat、IBM合作提出GIFT(Geometric Inference Feedback Tuning)框架,通过推理时扩展利用视觉语言模型自身的近似正确答案生成训练数据,自动修正模型在图像转CAD代码任务中的错误。实验表明,GIFT仅用约20%的计算量即可生成更准确的CAD程序,且生成的3D模型几何形状与真实模型更吻合。

    推荐理由:该方法利用模型自身错误生成训练数据,以更低计算成本提升图像转CAD代码的准确性。

  2. Hugging Face Blog62

    模型路由看似简单,直到你真正做起来

    IBM Research 在 Hugging Face 博客指出,将路由引入 Agent 系统时,模型选择会迅速演变为系统优化问题。实际成本受缓存、基础设施和负载模式影响,GPT-4.1 在标价更低的情况下反而比 Claude Sonnet 4.6 更贵;路由需同时平衡成本、质量、延迟、合规与可靠性。

    推荐理由:从成本与系统优化角度重新审视路由设计,为构建 Agent 系统提供可迁移的权衡思路。

7月15日周三
  1. Hugging Face Blog60

    Hugging Face 推出 Real World VoiceEQ 语音AI人本质量评测基准

    Hugging Face 发布 Real World VoiceEQ 基准,从声学信息层面评估语音交互的人本质量,覆盖ASR、TTS、S2S与语音理解,超40款开源与闭源模型参与。评测基于超过100万条人类评分,包含78.5万条TTS与4.8万条STS评分,并指出传统基准在噪声、口音、情绪等真实场景下高估模型表现,语音模型在

    推荐理由:原文呈现了覆盖40余款模型的评测结果与关键发现,帮助读者在语音接口成为主流交互方式的背景下重新审视现有基准的局限。

  2. Together AI60

    Together GPU Clusters 新增可靠性与运维控制功能

    Together GPU Clusters 推出被动健康检查、自动节点修复、Slinky 1.0 等功能,覆盖 GPU 总线故障、热节流、Xid 错误等场景。配合集群详情页、外部 OIDC、启动脚本和验收测试选项,提升多团队场景下的可观测性、访问控制与自定义能力。

    推荐理由:原文给出了平台健康与运维控制两方面的具体能力变化,读者可以据此评估它对现有训练与推理工作流的影响。