MILO:通过协同多智能体进化实现自动化 Harness 发现
arXiv 论文提出 MILO(Meta-evolutionary Island Orchestration)框架,协同进化智能体 harness 与搜索策略,结合分层谱系记忆、智能体重写与编排器自适应搜索。
Why it matters: MILO 通过多智能体协同进化自动搜索智能体 harness,在多个基准上超越现有方法,为自动化 harness 设计提供了可复现的新框架。
arXiv 论文提出 MILO(Meta-evolutionary Island Orchestration)框架,协同进化智能体 harness 与搜索策略,结合分层谱系记忆、智能体重写与编排器自适应搜索。
Why it matters: MILO 通过多智能体协同进化自动搜索智能体 harness,在多个基准上超越现有方法,为自动化 harness 设计提供了可复现的新框架。
Zero2Repo 是一个从零构建仓库的基准,智能体接收需求文档与接口契约并在空工作区交付完整仓库。任务由语言无关管线从真实开源项目生成,并以隐藏测试的执行通过与否作为唯一评判标准。当前版本覆盖 Python、TypeScript、Go 和 C++,最强智能体在 11 个任务中仅解决 10 个,且失败提交中 90-99% 的隐藏测试通过,67-100% 的失败可归因于规范中的单一遗漏或低频规则。
Why it matters: 给出了从零构建仓库的基准与评测方法,读者可据此评估现有编码智能体在真实工程任务上的完成度与薄弱环节。
PANDA 是去中心化多智能体架构,通过解耦集体通信与团队通信支持数千智能体、毫秒级组队与并发负载均衡;提供星型/链型/网状三种编排模式,并基于信任网络治理交互。在 HotPotQA 上,PANDA 以最高 8 倍效率匹配 SOTA 精度,并在现有系统失效时维持 100% 任务完成率。
Why it matters: 去中心化架构在 HotPotQA 上扩展到数千智能体并维持 100% 完成率,为多智能体系统的容错与编排策略选择提供了可迁移方法。
论文提出开源两阶段技能检索器 SkillSeek,基于标准 IR 配方(BGE-base 编码器加小交叉编码器)并通过 MCP 暴露。在 89 任务 SkillsBench 上,SkillSeek 在四个设置中的三个达到或超过 LLM 循环的通过率,剩余一个由交叉编码器弥补;每轮成本从 51.30 美元降至 27.54 美元,接近无技能基线。
Why it matters: 标准 IR 配方在 SkillsBench 上与 LLM 循环持平且成本减半,为智能体技能检索提供了可复现的低成本默认方案。
作者提出 OpenJev-RLCD,一种对推理模型进行校准决策的强化学习实现:模型先生成理由,再用严格真确评分规则对答案分布打分。实验基于 Qwen3-1.7B,在两个推理任务上 RLCD 在准确率和选择性预测上匹配或优于 SFT、RFT/STaR 与 GRPO;GSM8K 答案验证中单次查询可覆盖约 80% 项目且误差不超过 5%。代码与结果已开源。
Why it matters: 论文给出 RLCD 的两阶段实现与 GSM8K 上的可复现结果,读者可据此判断校准式强化学习是否值得替代现有 RLVR 方法。