Latest selected
1–8 of 206TodayOct 1Thu
Thursday
- The DecoderSelectedAI score8282
OpenAI披露7月起针对其模型推理的提取攻击,攻击者通过跨会话复用加密推理包让廉价模型充当解密 oracle,完整还原强模型的思维链。研究者 Joachim Schaeffer 团队在 Azure 上对 GPT-6 Astra 及 Anthropic 模型仍可成功复现,而 OpenAI 与 Anthropic 自身 API 已阻断;另一简单方法通过虚拟记事本工具亦可读取推理。
Why it matters: 原文给出跨平台防护差异的具体案例,读者可据此评估自身部署环境是否面临同等风险。
- arXiv · Machine Learning TheorySelectedAI score6969
arXiv 论文提出 MILO(Meta-evolutionary Island Orchestration)框架,协同进化智能体 harness 与搜索策略,结合分层谱系记忆、智能体重写与编排器自适应搜索。
Why it matters: MILO 通过多智能体协同进化自动搜索智能体 harness,在多个基准上超越现有方法,为自动化 harness 设计提供了可复现的新框架。
- arXiv · Software EngineeringSelectedAI score6262
Zero2Repo 是一个从零构建仓库的基准,智能体接收需求文档与接口契约并在空工作区交付完整仓库。任务由语言无关管线从真实开源项目生成,并以隐藏测试的执行通过与否作为唯一评判标准。当前版本覆盖 Python、TypeScript、Go 和 C++,最强智能体在 11 个任务中仅解决 10 个,且失败提交中 90-99% 的隐藏测试通过,67-100% 的失败可归因于规范中的单一遗漏或低频规则。
Why it matters: 给出了从零构建仓库的基准与评测方法,读者可据此评估现有编码智能体在真实工程任务上的完成度与薄弱环节。
- arXiv · Multiagent SystemsSelectedAI score6262
论文提出 ARCHER,一种测试驱动、确定性编排的多智能体程序合成框架,可从监管规范自动生成可审计的验证代码。实验覆盖四种骨干模型,ARCHER 相比单次提示基线平均联合准确率提升 82%;自建开源模型能以约 1/4 成本达到前沿 API 97.8% 的准确率。
Why it matters: ARCHER 通过确定性多智能体编排显著提升合规检查准确率,并为自建开源模型提供低成本高准确率的可行路径。
- arXiv · Information RetrievalSelectedAI score6262
论文测试了 OpenAI 两款模型在工具注册表中的选择行为,发现堆叠赞美可使工具被选率提升约 43 个百分点,与可验证规格相当;列表首位工具被选率高出约 72 个百分点。结构化字段有助于模型选中能完成任务的工具,但附上销售文案会削弱或消除这一优势。
Why it matters: 预注册实验揭示销售话术和列表位置会显著改变模型选工具的结果,对注册表设计有直接参考价值。
- arXiv · Multiagent SystemsSelectedAI score6464
PANDA 是去中心化多智能体架构,通过解耦集体通信与团队通信支持数千智能体、毫秒级组队与并发负载均衡;提供星型/链型/网状三种编排模式,并基于信任网络治理交互。在 HotPotQA 上,PANDA 以最高 8 倍效率匹配 SOTA 精度,并在现有系统失效时维持 100% 任务完成率。
Why it matters: 去中心化架构在 HotPotQA 上扩展到数千智能体并维持 100% 完成率,为多智能体系统的容错与编排策略选择提供了可迁移方法。
- arXiv · Information RetrievalSelectedAI score6060
论文提出开源两阶段技能检索器 SkillSeek,基于标准 IR 配方(BGE-base 编码器加小交叉编码器)并通过 MCP 暴露。在 89 任务 SkillsBench 上,SkillSeek 在四个设置中的三个达到或超过 LLM 循环的通过率,剩余一个由交叉编码器弥补;每轮成本从 51.30 美元降至 27.54 美元,接近无技能基线。
Why it matters: 标准 IR 配方在 SkillsBench 上与 LLM 循环持平且成本减半,为智能体技能检索提供了可复现的低成本默认方案。
- arXiv · Artificial IntelligenceSelectedAI score6262
作者提出 OpenJev-RLCD,一种对推理模型进行校准决策的强化学习实现:模型先生成理由,再用严格真确评分规则对答案分布打分。实验基于 Qwen3-1.7B,在两个推理任务上 RLCD 在准确率和选择性预测上匹配或优于 SFT、RFT/STaR 与 GRPO;GSM8K 答案验证中单次查询可覆盖约 80% 项目且误差不超过 5%。代码与结果已开源。
Why it matters: 论文给出 RLCD 的两阶段实现与 GSM8K 上的可复现结果,读者可据此判断校准式强化学习是否值得替代现有 RLVR 方法。