结构化LLM群体中的集体意见动力学
研究探讨网络结构与群体组成如何影响LLM智能体在多轮辩论中的意见演化,发现低同质性促进跨群体互动与高同质性限制跨群体接触会分别导向意见收敛与分化。不同LLM模型在相同网络条件下呈现不同的意见更新模式,且智能体获取局部邻域信息会进一步调节意见转变,模型间对局部社会语境的敏感性存在显著差异。集体动态源于模型行为、网络结构、群体组成与局部社会信息的交互作用。
研究探讨网络结构与群体组成如何影响LLM智能体在多轮辩论中的意见演化,发现低同质性促进跨群体互动与高同质性限制跨群体接触会分别导向意见收敛与分化。不同LLM模型在相同网络条件下呈现不同的意见更新模式,且智能体获取局部邻域信息会进一步调节意见转变,模型间对局部社会语境的敏感性存在显著差异。集体动态源于模型行为、网络结构、群体组成与局部社会信息的交互作用。
该框架融合混合网格体重建与协调多视图设计,支持内部波的生成、传播和演化分析。领域专家评估表明,系统可识别横向波传播、能量传输路径和浅化混合等此前难以观测的现象。所提方法为不规则网格上的多尺度多变量流数据可视化提供了可泛化的技术与设计原则。
论文提出 CorpusMap,一种以实体为中心的大文档集合导航层,将重复出现的实体组织为 Entity Page 并链接所有相关文档,形成实体与文档之间的图结构供智能体遍历。实验使用 7 个模型、3 个基准数据集,CorpusMap 在证据发现和答案质量上优于原始语料智能体搜索,同时平均消耗更少 token,并胜过 4 种替代导航层。
summary_zh: 该研究为 PLS 回归的拟合结果提供基于留出 OLS 重拟合的两类检验:Nadeau-Bengio 校正渐近 t 检验与排列检验,在结果-预测变量独立与行 iid 条件下有限样本有效。
arXiv 论文 arXiv:2609.35900 提出一种框架,通过端到端复现评估 LLM 智能体重建已发表研究中的隐含推理,并以 14 篇天文学论文为案例。
MoRE 将路由器权重矩阵分解为秩 r,把路由成本从 Θ(Mh) 降到 O((h+M)r),在活跃专家数固定时,对数秩即可保证路由表达能力,且在高斯记忆模型中保持负载均衡。在匹配活跃 FLOPs 下可支持 Θ(h/r) 倍的专家数量,并配合融合 Triton 内核避免 HBM 昂贵内存操作,在电话本记忆任务和知识密集型 Q&A 上提升表现,推理能力持平。代码已开源。
该研究提出基于跌倒风险的帕累托效率框架,评估34名多发性硬化症患者在8种VR反馈条件下的步态表现与认知/体力负担。空间听觉反馈关闭72.7%速度差距且负担低于平均水平,多模态反馈关闭95.6%但负担最高。表明更大步态改善不等同于更高康复效率。
扩散语言模型通过反复更新部分掩码序列生成代码。研究者在六个扩散模型中发现,线性探针能区分通过与失败的尝试,最强信号通常出现在早期层之后。使用小语义突变作为对照,支持其与正确性相关而非仅表面风格。探针点估计相比模型置信度无一致优势,将探针方向加入残差流未带来可靠提升,反方向则降低性能。
VaccineBooster 结合 embedding 扰动与权重梯度衰减,在 Llama-2-7B + BeaverTails 微调后攻击场景下取得最低 OpenAI moderation 分数 0.315;Booster-Only 变体保留最高拒绝率 50%。实验基于 10 条提示词与单次未播种运行,揭示嵌入扰动降有害内容、梯度衰减保显式拒绝行为的权衡。
Greenpixie 提出一种估算云端大语言模型每 Token 能耗的方法论,区分输入(prefill)与输出(decode)Token 的能耗,并用贝叶斯线性回归建模能耗与模型规模、请求流量及硬件部署配置的关系。
summary_zh: GNA(Granular Neighbor Assembly)是一种检索增强预测层,在两个粒度上组装邻居:整段过去窗口保持变量间一致性,每个变量单独匹配自身最优过去。
研究基于 9,455 条已发布轨迹和新实验,对比了 LLM-Agent 社会中的个体预测与集体预测。邻居信息在 16 个公开数据集和保留问题上的集体预测中均提升个体表现,但集体增益依赖迁移条件。Qwen 在观察三轮后受益于历史信息,24 条新陈述未复现此前预测中的对比历史效应。
CTE-Bench-Core-v1 包含 255 个场景、10,200 次预测,测量模型预测干预对有状态服务未来行为影响的能力,主评分为 effect-step value match。
研究者在两门研究生研究方法课中部署采用约束优先序列的AI教学伙伴,要求学生先陈述并论证立场再接收问题。AI素养自评提升但批判性思维、元认知意识和知识无变化,且交互记录显示对话简短、约束序列执行不均、记录缺失,提示AI辅助学习需依赖交互记录而非自我报告来验证设计效果。
研究提出一个结合大语言模型与检索增强生成的多层安全网关架构,用于母婴健康资源导航。该系统整合紧急处理、领域筛选、来源追溯、匿名会话管理与操作审计日志,检索限定于机构精选资源。当前系统提供来源可信的安全边界导航,但不构成临床决策支持或逐条健康信息验证。
论文评估了单提示梯度越狱检测器 GradSafe 在多轮对话中的表现,将其扩展为 Context Window Scanner,用固定大小窗口的最大得分作为对话级分数。
推荐理由:梯度检测在合成数据上表现稳健,但在真实良性对话中大幅退化,提示实际部署需重新校准。
该研究将幂律谱理论从确定性梯度下降扩展至随机梯度下降(SGD),证明相同谱指数支配随机动力学。对各向同性高斯数据,精确分析表明 Single Shuffle 严格优于 Flip-Flop 与 IID 采样。结果统一了谱理论与实际随机训练选择,揭示数据几何如何驱动优化速度。
IMPACT 通过智能体间约束与触发机制建模社会依存运动,在庞贝晚餐五小时模拟中涉及十个智能体。三十名参与者评估显示完整架构比两种简化架构更具社会一致性与可信度,六位考古专家认为运动模式具有历史合理性。
summary_zh: WitnessGym 是一个自动化框架,通过 bug 注入为真实 Java 项目构建 bug 验证基准,自动生成 1,300 个测试用例。
CommSketch 是一种同时解析草图与语音的 AI 设计界面。N=24 的被试间实验显示,边说边画比仅用草图更能自然表达设计意图,并显著提升感知对齐(p<.05)。研究讨论了未来工具如何支持动态对齐与多人机共创。
研究覆盖2025年4月至2026年6月间十个厂商的十款大语言模型,发现性别偏见普遍存在但方向和幅度差异显著,部分模型甚至表现相反。审计应作为持续的多厂商过程,而非一次性评估。
RAVEN 训练一个四符号、一步延迟的通信信道,通过接收者中心化动作价值剖面保留关键决策信息,发送端无需知晓接收者上下文。每个消息仅花费 2 bit,比 NDQ、CACOM 和 ExpoComm 少 12-1024 倍。
LatentSift 用策略生成时的隐藏状态替代 EF-verifier 第一阶段,通过推理、观察和函数调用状态与正负样本库的距离融合评分,在 SWE-bench Verified 上为三个 Agent 削减 EF-verifier tokens 66.6–81.0%。
SkeletonDance 基于运动学习理论和舞蹈教师访谈设计,自动检测节奏缺陷并通过模仿拍手反馈辅助练习。受试者反馈该系统帮助初学者重建节奏感并提升练习信心,尤其对新手效果明显,但客观性能指标在受控测试中未一致验证这些效果。
VeriWeave Govern 将智能体动作生成与授权分离,通过版本化策略、固定拒绝>审查>允许优先级、可验证证据与不可篡改审计状态进行运行时治理。GovernBench 在 30 个种子、60,000 条标注案例上达到 0.9888 平均准确率与零误允许,并在 40,040 并发请求中零失败;EU/Austria 法规评估显示确定性引擎保守,Gemma 4 31B 更接近人类共识。
论文分析一次性补救路径在分类器决策边界上的有效性,证明当路径曲率 κ 非负时线性化分数恰好归零。在 80 个浅层模型上,落入有利侧的补救比例与 κ≥0 的比例相关系数达 r=0.985。训练时采用非对称曲率惩罚可使 Fashion-MNIST 和 COMPAS 上 99-100% 的路径在承诺步长内穿越边界,但过冲约为对称惩罚的 4-22 倍。
summary_zh: 该论文基于 APS 等科学用户设施的 LLM 智能体部署经验,提出可跨仪器复用的生产策略,涵盖推理端点、工具服务器架构、可复用技能与受控学习等设计原则。
PowerMarketJax 是一个基于 JAX 的多智能体强化学习基准套件,覆盖日前批发、实时平衡、辅助服务、点对点双拍卖和本地灵活性五种电力市场,每个环境实现各自的出清、定价与结算规则。
论文提出FORMS框架并评估其对120名青少年和25名成人的心理影响,发现高能力多智能体会引发认知失稳与规范性觉醒,且成人被试认为合成辩论比人类对话更真诚(Cohen's d=2.04)。
推荐理由:研究量化了高能力多智能体系统对认知和信任的影响,为理解对话AI的社会认知代价提供了可复现的评估框架。
该研究在合成环境中测试购物Agent的推荐行为,对比中性提问、温和商业指令和明确偏向赞助商的指令。在40个测试案例中,温和指令未改变选择,偏向指令使赞助商品被选率提升0.30,平均合成效用下降0.0547。
推荐理由:论文通过合成购物Agent实验,揭示商业激励可通过选择性提问影响推荐结果。
\framework 是一个黑盒提示词最小化框架,能将 few-shot 提示词在字符数上平均压缩 65.3% ± 15.8%,同时保持命题输出保真度。模型优先保留逻辑标识符与约束声明,丢弃自然语言散文和跨提示关系标注;部分模型是通用编码器,部分是通用解码器。
FlowMAS 基于生成流网络(GFlowNets)建模多智能体工作流拓扑生成,引入好奇心驱动的结构探索模块与信息引导优化模块,在六个基准数据集上结合三种 LLM 后验 consistently 优于多个基线。
EntityWeaver 是一个交互式可视化系统,用于探索文档集合中的命名实体及其关系,重点处理不确定性并支持远读与近读。系统基于连接文档、实体提及和实体的图结构,将提及到实体链接的不确定性直接可视化,并提供传递函数控制让用户调整不确定性的显示方式。系统还支持源文本协调视图、多阶段过滤查询构建器、小地图导航和导出功能,由领域专家参与设计与初步评估。
论文提出 Copula Active Subspaces(CAS),通过分量秩变换与秩 r 降维表示非高斯噪声密度,以 copula 得分协方差 C 的前导特征向量确定依赖方向。
summary_zh: RICE(Representations from In-Context Examples)是一种无需训练的密集检索方法,通过为查询和文档编码提供共享上下文,让 LLM 仅凭少量上下文示例生成高质量密集表示。
LLM-based multi-agent systems over wireless networks face metric misalignment, message redundancy。
Assay 将 AI 编码智能体的声明绑定到代码依赖锥的 Merkle 哈希,使声明在代码或依赖变更时自动失效,并在五公开仓库上验证:600-token 简报比探索代理便宜 14–114 倍,温构建快至冷构建的 5 倍,锥绑定重验 7.9%–81.9% 声明,合并门拦截全部 9 种对抗行为。工具为无依赖 Python 包并带 MCP 服务器,所有数据由发布脚本生成。
推荐理由:用内容寻址证据图把智能体声明与代码依赖绑定,为代码变更时的自动失效与审核提供了可验证的工程路径。
论文提出 Graph-Split Bayesian Causal Forest(GSBCF),将图分裂贝叶斯加法回归树(GS-BART)与贝叶斯因果森林倾向得分回归框架结合,用于空间异质性因果推断。通过图引导分裂规则建模空间混淆,并开发高效有信息提议采样算法实现后验计算。模拟和真实数据实验表明,估计精度和不确定性量化均优于现有因果 BART 方法。
论文在 NFCorpus、TREC-COVID 和 SciDocs 上测试了四种生成式查询扩展格式与 SPLADE-v3 的组合,所有 12 种方法-数据集对比在 nDCG@10 上均提升,最佳相对增益分别为 4.81%、8.92% 和 9.47%,其中 11 项在 Holm 校正后仍显著。
summary_zh: 本文提出一种 Boundary Negotiating Artifact,作为 AI 监管沙箱(AIRSes)中不同利益相关者协作评估的接口。