Skip to content

#GitHub

3 today
TodayOct 7Wed
  1. GitHub Changelog60

    GitHub 堆叠式拉取请求正式可用

    GitHub 宣布堆叠式拉取请求正式可用,把大型改动拆成可独立审查、合并的多个小型拉取请求。公开预览以来,使用堆叠的仓库合并代码量较同类仓库提升 9%,超过三分之二的 Top 1% 仓库已采用,合并耗时改善 5%。

    Why it matters: 原文给出堆叠式拉取请求正式可用及合并效率数据,读者可据此评估团队代码审查流程的调整空间。

Oct 6Tue
  1. GitHub Blog · AI & ML63

    GitHub 发布开源 AI 代码审查基准 ReviewBench

    GitHub 发布开源 AI 代码审查基准 ReviewBench,基准基于 103.9M 个真实 pull request 分布构建,包含 219 个公共 pull request、19 种语言和多源 golden set。GitHub 称未参与构建的高级工程师独立复核与基准结果一致率达 96.6%,并开放数据集、评测方法、LLM judge 配置和自提交入口。

    Why it matters: GitHub 公布代码审查基准 ReviewBench 的构建方法与验证数据,并开放数据集、评测流程和自提交入口。

Oct 3Sat
Oct 2Fri
Sep 30Wed
  1. arXiv · Software Engineering42

    XRepoSkill:学习可迁移技能以提升软件工程 Agent 能力

    XRepoSkill 通过对比同一 Agent 在同一问题上的成功与失败轨迹,提取可迁移规则并经多仓库验证来学习技能。在 SWE-bench Pro 和 DeepSWE 上,基于三个不同厂商的 LLM 评测,XRepoSkill 在全部六组基准中取得最高问题解决率;在长周期 DeepSWE 上比无技能基线提升 10.3 个百分点,比最强技能学习基线提升 5.0 个百分点。

  2. arXiv · Software Engineering60

    Assay:声明随代码失效的负责任 AI 辅助交付证据图

    Assay 将 AI 编码智能体的声明绑定到代码依赖锥的 Merkle 哈希,使声明在代码或依赖变更时自动失效,并在五公开仓库上验证:600-token 简报比探索代理便宜 14–114 倍,温构建快至冷构建的 5 倍,锥绑定重验 7.9%–81.9% 声明,合并门拦截全部 9 种对抗行为。工具为无依赖 Python 包并带 MCP 服务器,所有数据由发布脚本生成。

    Why it matters: 用内容寻址证据图把智能体声明与代码依赖绑定,为代码变更时的自动失效与审核提供了可验证的工程路径。

  3. arXiv · Software Engineering42

    ReviveBench 基准测试:编码智能体能否从死代码与静态需求中重建可运行的工业软件引擎

    ReviveBench 包含复活与重建两个任务族,分别测试编码智能体在依赖不兼容、缺失模块、遗留构建及 CAD/CRM 等系统中的修复与重建能力。最强模型在复活族十项任务中每项至少一次全部通过,在重建族十三项中有两个模型全部达标,但 CFD 任务无法验证数值求解能力。基准构建与审计发现 28 个验证器缺陷(24 个假阴性、2 个假阳性),表明可执行验证本身会引入显著测量误差。

  4. Hugging Face Blog62

    NVIDIA Kumo Tabular 设定表格预测准确-效率新前沿

    NVIDIA发布开源表格预测基础模型Kumo Tabular,单次前向传播即可预测,无需训练或调优。在TabArena等四个基准上排名第一,28M至215M参数规模下准确-效率达前沿,比LimiX-2快17倍。模型基于Transformer仅在人工数据上预训练,以OpenMDW-1.1许可证商业可用。

    Why it matters: 表格预测长期依赖梯度提升树,Kumo Tabular以单次前向传播提供无需训练与调优的预测且在TabArena等基准排名第一。

Sep 26Sat
Sep 11Fri
Sep 5Sat
  1. GitHub Blog · AI & ML60

    GitHub Copilot Project HydraFusion:通过多模型编排实现前沿质量

    GitHub Copilot 发布 Project HydraFusion 研究预览,通过运行时多模型编排自动选择工作流以平衡性能、成本和延迟。在 TerminalBench 2.1 上比 Claude Opus 5 质量提升 4.9 个百分点且成本降低 67%,DeepSWE 和 CheckpointBench 上也接近 Opus 5 水平。

    Why it matters: HydraFusion通过多模型编排自动选择最优工作流,在三个编码基准中以显著成本降低逼近Claude Opus 5的性能,为开发者提供无需手动协调模型的前沿质量编码体验。

Sep 4Fri
Sep 1Tue
  1. Hugging Face Blog64

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核库支持浏览器端本地 AI 推理

    Hugging Face 发布 @huggingface/kernels 库及 Fleet 众测工具,提供 207 个 WebGPU 内核,覆盖矩阵乘法、Softmax、LayerNormalization 等操作。

    Why it matters: Hugging Face发布207个WebGPU内核库,以版本化包形式提供可复用的GPU操作原语,并搭配Fleet众测平台收集真实硬件性能证据,为浏览器端本地AI推理奠定底层基础。

Aug 1Sat
Jul 27Mon
  1. Hugging Face Blog64

    NVIDIA 发布 Cosmos-H-Dreams:实现手术机器人实时生成式仿真

    NVIDIA 发布 Cosmos-H-Dreams,一款基于单张 RTX PRO 6000 GPU 运行的手术机器人实时生成式仿真器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,通过 FlashDreams 推理库实现约 160 fps 的交互式操作,每潜在帧仅需 2 步去噪,支持 dVRK 桌面缝合任务,并可连接学习型手术策略形成闭环。

    Why it matters: NVIDIA将手术世界模型压缩至单卡实时推理,使外科机器人策略的闭环评估与合成数据生成不再依赖稀缺物理硬件。

Jun 30Tue
  1. Hugging Face Blog60

    Every Eval Ever 与 Hugging Face 社区评测实现互操作,转换器自动同步评测结果

    Every Eval Ever 与 Hugging Face 社区评测现已实现互操作,官方提供了转换器工具,可自动将 EEE 评测记录同步为模型仓库中的 YAML 文件。数据存储已收录约 22.9 万条评测结果,覆盖 2.2 万个模型和 2200 个基准。该工具支持 MMLU-Pro、GPQA、HLE 和 GSM8K 四项基准,并在写入前自动审核冲突。

    Why it matters: EEE与Hugging Face社区评测现在可互操作,转换器自动将EEE记录写入YAML文件并审核冲突,解决评测结果分散难以对比的长期问题。

May 22Fri
  1. Mistral AI64

    Mistral Studio 发布 Connectors 支持内置与自定义 MCP

    Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。

    Why it matters: Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。

Apr 22Wed
  1. Google Research59

    ReasoningBank:赋能智能体从经验中学习

    Google Research提出ReasoningBank框架,使智能体能从成功与失败经验中蒸馏推理模式并实现测试时自我进化。在WebArena和SWE-Bench-Verified上,基于Gemini-2.5-Flash的ReasoningBank相比无记忆基线分别提升8.3%和4.6%成功率。MaTTS通过并行与串行缩放进一步增强学习效果。