ARCHER:用于可执行法规的智能体规则与合规框架
论文提出 ARCHER,一种测试驱动、确定性编排的多智能体程序合成框架,可从监管规范自动生成可审计的验证代码。实验覆盖四种骨干模型,ARCHER 相比单次提示基线平均联合准确率提升 82%;自建开源模型能以约 1/4 成本达到前沿 API 97.8% 的准确率。
Why it matters: ARCHER 通过确定性多智能体编排显著提升合规检查准确率,并为自建开源模型提供低成本高准确率的可行路径。
论文提出 ARCHER,一种测试驱动、确定性编排的多智能体程序合成框架,可从监管规范自动生成可审计的验证代码。实验覆盖四种骨干模型,ARCHER 相比单次提示基线平均联合准确率提升 82%;自建开源模型能以约 1/4 成本达到前沿 API 97.8% 的准确率。
Why it matters: ARCHER 通过确定性多智能体编排显著提升合规检查准确率,并为自建开源模型提供低成本高准确率的可行路径。
论文测试了 OpenAI 两款模型在工具注册表中的选择行为,发现堆叠赞美可使工具被选率提升约 43 个百分点,与可验证规格相当;列表首位工具被选率高出约 72 个百分点。结构化字段有助于模型选中能完成任务的工具,但附上销售文案会削弱或消除这一优势。
Why it matters: 预注册实验揭示销售话术和列表位置会显著改变模型选工具的结果,对注册表设计有直接参考价值。