Skip to content

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

242 selectedRelated topics模型发布Hugging FaceAI 编码

Latest selected

21–40 of 242
Oct 4Sun
  1. Hugging Face Blog84

    Microsoft ThinkingBox:按Agent留下的数据库记录而非输出来评分

    Microsoft与Hugging Face联合发布ThinkingBox,通过隔离的MCP工具会话对Agent的终端后端状态和副作用进行可执行校验,并在507个有状态业务工作流上各运行20次。

    Why it matters: 原文给出了可复现的评估框架与成本效率对比,读者可据此把Agent的终端状态检查纳入自身工作流。

Oct 3Sat
Oct 2Fri
  1. Google Research62

    Google 发布基于 TEE 的可验证隐私联邦学习系统

    Google Research 宣布下一代联邦学习系统,利用可信执行环境(TEE)提供可验证和可审计的数据匿名化保证。系统通过访问策略、Rekor 透明日志、可复现构建和动态 sideloading 实现端到端隐私保护,Gboard 已采用该系统用于英文和日文下一个词预测模型,带来更快训练速度和更强隐私保证。

    Why it matters: 原文展示了基于 TEE 的联邦学习新系统,读者可据此理解可验证隐私保护如何影响模型训练效率与精度。

  2. NVIDIA Blog60

    NVIDIA DGX Spark 64GB 发布,为开发者提供本地 AI 构建与扩展新选择

    NVIDIA DGX Spark 将于 10 月 23 日推出 64GB 统一内存版本,由 Acer、ASUS、Dell、Gigabyte、HP、MSI 等厂商提供,售价从 $4,999 起,搭载 GB10 Grace Blackwell Superchip 与完整 NVIDIA AI 软件栈。

    Why it matters: 原文给出 64GB 新 SKU 的价格与集群能力,读者可据此判断本地 Agent 工作流的成本与扩展边界。

  3. arXiv · Artificial Intelligence69

    K-Dense BYOK:开源本地 AI 研究助手与哈希链实验记录本

    K-Dense BYOK 是开源本地 AI 研究助手,研究者自备模型密钥,在自有机器上运行,提供科学脚手架、工作流模板和不可篡改的 Living Lab Notebook。在 20 个跨学科提示的预定义评分标准下,其在科学质量与研究执行上领先两个托管平台,且是唯一记录运行软件并提供结果再生命令的方案。代码基于 MIT 许可证开放。

    Why it matters: 本地运行的科研助手通过不可篡改日志应对模型过度声称问题,为可信 AI 研究工具提供了可复现的方法。

  4. Databricks67

    Databricks 推进 Open Lakehouse:Iceberg REST Catalog 新增 Read Restrictions 与 Catalog Labels

    Databricks 介绍 Apache Iceberg REST Catalog 新增两项规范:Read Restrictions 支持目录向可信引擎委托行/列策略执行,Catalog Labels 支持在联邦目录间以键值元数据形式共享治理与业务上下文。前者适用于可信引擎直连目录场景,后者适用于异构目录联邦场景,两者与 Cross-Engine ABAC 共同构成跨引擎、跨目录的统一治理选项。

    Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流

  5. LangChain · Official74

    如何在 Harness 中构建模型路由器

    LangChain 在 Open SWE 中构建了模型路由器,根据任务类型和复杂度将请求路由到不同层级模型,中位成本降低 64%,合并 PR 率无显著变化。路由器基于线程首条用户消息进行分类,使用 Jev 作为分类模型,并将路由决策与任务层级标准深度耦合。

    Why it matters: 给出了具体路由策略与 A/B 测试结果,读者可据此在自己的代理中复现类似的中低成本路由方案。

  6. Cloudflare · AI72

    Cloudflare 开源 Clef 决策模型并推出 RL 微调平台

    Cloudflare 发布 Clef 与 Clef-flash 决策模型,托管于 Workers AI 并开源至 Hugging Face(Apache 2.0),在 Jev Decision Index 上领先,且延迟低于 Jev 等竞品。模型支持 64k 上下文与视觉编码,兼容 Jev API,并提供基于 RLCD 的强化学习微调服务。

    Why it matters: Cloudflare开源 Clef 决策模型并配套 RL 微调平台,读者可据此评估其延迟与精度优势是否值得接入现有 Agent 工作流。

Oct 1Thu
  1. Hugging Face Blog76

    Olmo-core 3 发布:面向大规模 MoE 的开放可扩展训练框架

    AllenAI 发布 Olmo-core 3,重设计 MoE 训练系统以支持万亿参数规模。在专家池从 8 扩至 128、每 token 仅选 4 个专家的配置下,总参数从 4.6B 增至 47B,训练吞吐下降不到 5%;在 8 块 NVIDIA B300 上,47B MoE 吞吐约 2.7 倍提升。

    Why it matters: 展示了专家池扩展与吞吐量保持的具体数据,为评估大规模 MoE 训练效率提供可对比的基准。

  2. The Next Web · AI77

    DeepSeek 开源华为 Ascend 芯片编程工具 TileLang

    DeepSeek 在微信宣布开源六款面向华为 Ascend 芯片的软件模块,包含 TileLang 编程语言及计算与通信库,作为 Nvidia CUDA 的替代方案。DeepSeek 表示该工具已用于 AGI 工作,并计划与华为在超级节点等更多项目上合作。

    Why it matters: DeepSeek 把为 Ascend 芯片开发的 TileLang 工具链开源,为中国 AI 开发者提供了一条不依赖 CUDA 的编程路径。

  3. Cloudflare · AI60

    Cloudflare AI Search 正式发布,支持原生图像嵌入与 PDF OCR

    Cloudflare AI Search 正式开放,集成 Workers AI、Vectorize、R2 与 Browser Run,提供全托管索引与检索管道。新增原生图像嵌入(Qwen3-VL-Embedding)、PDF OCR 以及最高 10 MiB 文件支持,11 月 1 日开始计费,免费层每月含 1000 条语义与 1000 条全文查询。

    Why it matters: 原生图像嵌入和 OCR 让多模态检索更直接,开发者可据此评估现有搜索流程的升级成本。

  4. The Decoder82

    OpenAI称阻止模型推理窃取活动,但该手段在Azure仍有效

    OpenAI披露7月起针对其模型推理的提取攻击,攻击者通过跨会话复用加密推理包让廉价模型充当解密 oracle,完整还原强模型的思维链。研究者 Joachim Schaeffer 团队在 Azure 上对 GPT-6 Astra 及 Anthropic 模型仍可成功复现,而 OpenAI 与 Anthropic 自身 API 已阻断;另一简单方法通过虚拟记事本工具亦可读取推理。

    Why it matters: 原文给出跨平台防护差异的具体案例,读者可据此评估自身部署环境是否面临同等风险。

  5. arXiv · Machine Learning Theory69

    MILO:通过协同多智能体进化实现自动化 Harness 发现

    arXiv 论文提出 MILO(Meta-evolutionary Island Orchestration)框架,协同进化智能体 harness 与搜索策略,结合分层谱系记忆、智能体重写与编排器自适应搜索。

    Why it matters: MILO 通过多智能体协同进化自动搜索智能体 harness,在多个基准上超越现有方法,为自动化 harness 设计提供了可复现的新框架。

  6. arXiv · Software Engineering62

    Zero2Repo:编码智能体能否从零构建代码仓库?

    Zero2Repo 是一个新基准,要求智能体根据产品需求文档和接口契约,从空白工作区交付完整仓库。任务由语言无关管线从真实开源项目生成,并以执行验证代替 LLM 裁判。当前版本覆盖 Python、TypeScript、Go 和 C++,最强智能体在 11 个任务中仅解决 10 个,且多数失败可归因于规范中的单一遗漏或低频规则。

    Why it matters: 给出一个可从空白工作区构建完整仓库的基准,读者可借此评估编码智能体在真实工程任务上的实际能力边界。

  7. arXiv · Multiagent Systems62

    ARCHER:用于可执行法规的智能体规则与合规框架

    论文提出 ARCHER,一种测试驱动、确定性编排的多智能体程序合成框架,可从监管规范自动生成可审计的验证代码。实验覆盖四种骨干模型,ARCHER 相比单次提示基线平均联合准确率提升 82%;自建开源模型能以约 1/4 成本达到前沿 API 97.8% 的准确率。

    Why it matters: ARCHER 通过确定性多智能体编排显著提升合规检查准确率,并为自建开源模型提供低成本高准确率的可行路径。

  8. arXiv · Information Retrieval62

    LLM 工具注册表中面向 Agent 的信息设计:修辞、位置与结构的预注册测试

    论文测试了 OpenAI 两款模型在工具注册表中的选择行为,发现堆叠赞美可使工具被选率提升约 43 个百分点,与可验证规格相当;列表首位工具被选率高出约 72 个百分点。结构化字段有助于模型选中能完成任务的工具,但附上销售文案会削弱或消除这一优势。

    Why it matters: 预注册实验揭示销售话术和列表位置会显著改变模型选工具的结果,对注册表设计有直接参考价值。