Latest selected
41–60 of 242- arXiv · Multiagent SystemsSelectedAI score6464
PANDA 是去中心化多智能体架构,通过解耦集体通信与团队通信支持数千智能体、毫秒级组队与并发负载均衡;提供星型/链型/网状三种编排模式,并基于信任网络治理交互。在 HotPotQA 上,PANDA 以最高 8 倍效率匹配 SOTA 精度,并在现有系统失效时维持 100% 任务完成率。
Why it matters: 去中心化架构在 HotPotQA 上扩展到数千智能体并维持 100% 完成率,为多智能体系统的容错与编排策略选择提供了可迁移方法。
- arXiv · Information RetrievalSelectedAI score6060
论文提出开源两阶段技能检索器 SkillSeek,基于标准 IR 配方(BGE-base 编码器加小交叉编码器)并通过 MCP 暴露。在 89 任务 SkillsBench 上,SkillSeek 在四个设置中的三个达到或超过 LLM 循环的通过率,剩余一个由交叉编码器弥补;每轮成本从 51.30 美元降至 27.54 美元,接近无技能基线。
Why it matters: 标准 IR 配方在 SkillsBench 上与 LLM 循环持平且成本减半,为智能体技能检索提供了可复现的低成本默认方案。
- arXiv · Artificial IntelligenceSelectedAI score6262
作者提出 OpenJev-RLCD,一种对推理模型进行校准决策的强化学习实现:模型先生成理由,再用严格真确评分规则对答案分布打分。实验基于 Qwen3-1.7B,在两个推理任务上 RLCD 在准确率和选择性预测上匹配或优于 SFT、RFT/STaR 与 GRPO;GSM8K 答案验证中单次查询可覆盖约 80% 项目且误差不超过 5%。代码与结果已开源。
Why it matters: 论文给出 RLCD 的两阶段实现与 GSM8K 上的可复现结果,读者可据此判断校准式强化学习是否值得替代现有 RLVR 方法。
- Apple Machine Learning ResearchSelectedAI score7373
Apple ML Research 发布 SCLATE,一个让基准和未修改智能体共用事件调度的执行框架,通过混合仿真时钟压缩长周期场景并记录每次模型调用的 token 与对数概率。
Why it matters: 提供了跨基准的统一调度框架和十种配置对比,帮助读者评估记忆系统与模型搭配的实际效果。
- LambdaSelectedAI score7979
Open Jarvis 通过模型与运行环境分离的 spec 框架,将 Qwen3.5-9B 在 PinchBench 上的准确率从 62.3% 提升到 88.4%,最佳本地模型 Qwen3.5-122B 平均距 Claude Opus 4.6 仅 3.2 个百分点。
Why it matters: 原文给出本地模型通过重配 harness 恢复性能的数据,读者可据此评估自建智能体的成本与效果。
- Hugging Face BlogSelectedAI score6262
Hugging Face 发布 Open TTS Leaderboard,使用客观指标评测开源 TTS 模型的多语言 intelligibility、速度和说话人相似度,并补充社区投票试听环节。评测基于 Seed TTS Eval 和 CV3 Eval,默认按英语宏平均 WER 排序,支持多语言和声音克隆筛选;流式标签页以 TTFA 衡量延迟。目标是通过开源评测脚本和社区反馈持续迭代。
Why it matters: 原文给出了可复用的客观评测框架,读者可据此理解开源 TTS 模型在多语言和流式场景下的相对表现。
- Cloudflare · AISelectedAI score7575
Cloudflare 指出其网络每日请求从 6300 万增至 11500 万,AI 智能体请求一年增长超 1700%,首次出现人类流量不到一半的情况。AI 回答引擎直接抓取内容导致零售、软件、金融等行业人类访问量最高下降 40%,网站面临带宽成本上升与收入下降的双重压力。
Why it matters: 从流量结构变化切入,讨论网站如何面向 AI 智能体重建发现、身份与付费体系。
- The DecoderSelectedAI score8282
Anthropic在Project Glasswing下测试GLM-5.3,在ExploitBench上构建有效漏洞利用成功率接近Mythos Preview,并在内部OSS-Fuzz基准中达到4%的完全控制率;CAISI独立评估将其列为最具网络能力的开放权重模型,约落后顶尖美国模型四个月。
Why it matters: Anthropic与CAISI的独立评估共同指向开源模型在漏洞利用能力上的快速追赶,读者可借此审视开放权重模型的安全边界与防御方工具需求。
- arXiv · Multiagent SystemsSelectedAI score6767
论文提出 GitHarness,将动态需求协作建模为需求追踪与局部更新,用可分支的版本历史组织需求状态和对应的 harness 工作状态。训练一个 Git Agent 来解析需求变更并选择语义兼容的历史版本,再通过统一版本接口恢复状态并创建新分支,使底层 harness 能剔除过时信息、继承兼容工作并聚焦受影响部分。
Why it matters: 提出类 Git 的版本控制框架,让多智能体在需求变更时只局部更新而非全局重写。
- Google Developers · AISelectedAI score6262
Google 发布 Credentio 开源 C++ 库,支持 C2PA 规范 2.2 和 2.4 的内容凭证本地校验。该库已在 Google 近 40 款合规产品中运行,处理千亿级资产。
Why it matters: Google 开放了本地 C2PA 校验库,适合在资源受限环境中构建高性能内容溯源工具。
- arXiv · RoboticsSelectedAI score6262
研究团队发布 FineART 数据集,包含 40,543 条轨迹、1,718 小时和 533,913 个子任务,覆盖 151 个双臂操作任务,并推出 FineART-VLA 视觉-语言-动作策略。
Why it matters: 论文给出了细粒度标注的双臂操作数据集和自预测子任务训练方法,读者可据此评估其对长时序操作任务的实际提升。
- Google Developers · AISelectedAI score7474
Google 总结了 2026 年 AI Agents Challenge 中的四种工程模式:双向 MCP、事件驱动并发、同标准降级、小模型前置路由。原文强调这些模式不依赖大团队或新模型,且可组合使用。
Why it matters: 四条工程模式来自真实参赛代码,可在多智能体架构、并发、降级和路由四个维度直接复用。
- Google Developers · AISelectedAI score6767
Google 宣布 ADK for Kotlin 1.0 正式发布,达到 ADK 1.0 Core 功能对齐,并提供 Android 优先的 on-device 扩展。
Why it matters: ADK for Kotlin 1.0 达到与核心版功能对齐,Kotlin 开发者可获得移动端优先的 on-device 扩展与完整多智能体编排能力。
- Google Developers · AISelectedAI score7676
Google 团队在 Google Cloud TPUs 上用 MaxText 从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,覆盖 stage-1(约 5.93T token / 1.41M 步)和 stage-2(47,684 步),在多个 held-out 指标上与 Ai2 参考曲线对齐。
Why it matters: 通过独立复现展示了跨框架验证方法与数据加载陷阱,读者可借鉴其 held-out 评估策略和 resume 校验手段。
DeepSeek正式开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang编译工具、高性能计算库、分布式通信库及DeepEP通信库。
Why it matters: DeepSeek与华为联合开放昇腾侧的基础设施与部署实践,为国产算力平台提供了可复用的软件栈参考。
OpenAI在DevDay 2026一口气公布25项更新,重点包括常驻型Agent Dots、GPT-6.1 Sol模型、Codex云端升级、Agents API开放以及两项商业化动作。
Why it matters: OpenAI把Agent从单次任务延展到长期常驻运行,并用新模型与API把成本与执行环境配套打开,读者可以据此判断其Agent产品线的整体推进方向。
- TechCrunch · AISelectedAI score7676
OpenAI 在 Dev Day 推出 ChatGPT 应用发现与分发体系,聊天中自动推荐应用并支持在 ChatGPT 内直接使用,同时引入
Why it matters: OpenAI 把 ChatGPT 变成应用发现与分发入口,开发者可在聊天界面构建交互面板,用户身份与 AI 额度可带入第三方应用。
- The DecoderSelectedAI score8888
OpenAI 在 DevDay 推出 ChatGPT 重大更新,包括开放插件系统、共享工作空间 Space、协作文档 Pages 与 Slides、Slack 和 Teams 集成、Meetings 插件、MCP Events 与 Team Tasks 自动化的新定价方案 Pro 500,以及面向企业客户的 OpenAI Marketplace。
Why it matters: 开放插件系统与共享工作空间让 ChatGPT 向平台型工具演进,读者可据此评估它对现有协作工具的替代压力。
- Hugging Face BlogSelectedAI score6262
NVIDIA发布开源表格预测基础模型Kumo Tabular,单次前向传播即可预测,无需训练或调优。在TabArena等四个基准上排名第一,28M至215M参数规模下准确-效率达前沿,比LimiX-2快17倍。模型基于Transformer仅在人工数据上预训练,以OpenMDW-1.1许可证商业可用。
Why it matters: 表格预测长期依赖梯度提升树,Kumo Tabular以单次前向传播提供无需训练与调优的预测且在TabArena等基准排名第一。
- Ollama BlogSelectedAI score7373
Ollama 0.35 推出 /v1/systemone 端点,支持 Jev 风格的决策模型,本地运行无额外成本且延迟更低。今日上线三个模型:nimble(9B,Bespoke Labs)、tev1(4B,Together AI)和 tev1:0.8b(0.8B,Together AI)。
Why it matters: 本地低延迟决策模型开放调用,对实时分拣、路由与审核场景有直接迁移价值。