蒸馏视觉证据而非答案:面向视觉语言模型的跨世界在线蒸馏方法 CW-OPD
提出 Cross-World On-Policy Distillation(CW-OPD),通过构造共享问题但证据不同的两个视觉世界,显式监督学生对视觉证据变化的响应。
提出 Cross-World On-Policy Distillation(CW-OPD),通过构造共享问题但证据不同的两个视觉世界,显式监督学生对视觉证据变化的响应。
DreamBooth 微调合成图像会降低主体保真度,产生过饱和色彩和过多高频细节。研究者定位原因为分类器自由引导(CFG)的膨胀,并提出训练无关的 ReGain 校正,在采样时按频段缩放引导量。在 Stable Diffusion v1.5 上,ReGain 用 DINO、DINOv2 和 CLIP-I 衡量缩小了 51-64% 的主体保真度差距,同时保持文本对齐。
论文提出基于掩码扩散模型的条件生成方法,支持按战术主题和部分棋盘状态生成谜题。引入同步最佳走子预测辅助任务,将解唯一性提升11.6%、主题条件准确率提升2.5%;结合DDPO强化学习框架,使符合主题且唯一的局面产出率提高89.1%。作者首次发布开源权重模型,提供可控的创意生成新路径。
ExploreNet 在扩散 GRPO 训练中为每个潜在元素预测自适应噪声尺度,替代 Flow-GRPO 的各向同性高斯噪声。在 Stable Diffusion 3.5 Medium 上,ExploreNet 使 GenEval2 提升 14%,人类偏好胜率 67.2%,并迁移至两个组合基准和五个偏好/图像质量模型。
论文提出 agent experience(AX)正在取代 answer-engine optimization(AEO),因为智能体会打开搜索结果并阅读企业网站后再做决定。
Why it matters: 论文用 37,927 次智能体旅程比较可读站点与外部提及的影响,给出答案来源、准确率和推荐倍数的量化结果。
STRIDE 是首个评估场景描述与行人轨迹上下文一致性的自动化框架,基于社会学理论构建 VRDST 评估协议,将高层上下文分解为场景自适应行为问题,并通过确定性测量工具库得出可复现答案。STRIDE-Bench 包含 1K 场景、6K 行为问题和 11K 测量,覆盖 30 张真实地图,人类验证一致性达 80%。实验显示现有文本到轨迹模型的上下文对齐能力有限,细粒度上下文条件化仍存在挑战。
summary_zh: 论文研究折扣无限时域下拟合 Q 迭代(FQI)在函数动作空间中的有限样本理论,针对函数动作缺乏勒贝格密度、传统覆盖条件过强、函数动作空间过大导致贪心优化困难三个挑战,引入基于评论器的相对覆盖条件并给出学习策略遗憾的多项式衰减界。
提出三阶段强化微调(RFT)流水线训练多智能体VLA模型,在RoboTwin、RoboFactory和真实场景双臂Franka机器人任务上平均成功率分别提升23.1%、16.4%和44%。该方法基于π₀和π₀.₅骨干网络,通过初始化感知数据采集、离线信用筛选微调与潜在空间在线微调三阶段实现多机器人协作。代码已公开。
论文提出无监督定量方法 HSTA,分析 arXiv 学术预印本与 USPTO 专利申请的 30,000 条记录,通过 Transformer 句向量投影到超球面、Spherical K-Means 聚类与 UMAP 降维,追踪语义演变与商业化时滞。
PreviewDiff 是一种无需训练、测试时搜索方法,将扩散采样从标量搜索转为多模态评判引导的中间潜在空间搜索。在去噪检查点解码局部预览,由多模态评判器评分并给出自然语言反馈,据此分支为语义提示编辑和局部重噪声潜在延续,再评分并选择性前向推进。图像与视频生成基准上,PreviewDiff 一致优于等预算 Best-of-N 与强标量搜索基线,更早干预与更大搜索宽度收益最大。
NeuroDyn-EEG 提出一种预训练框架,融合 Jansen-Rit 神经质量模型、leadfield 源投影与基于模拟的参数反演,在生理范围内用约 2.43M 可训练参数从标准 19 通道 EEG 估计 90 个 AAL 区域的 11 类区域参数及 1 个全局参数。
Multiverse Computing 提出 ProvenanceGuard,在 MCP agent 回答后逐条核查 claim 与来源是否匹配,而非把所有证据混合后判断。测试中它从 139 条应被拦截的 claim 中拦下 138 条,并对来源识别正确的比例约 86%。该方法可对接 RARR 修复循环,在本地配置下每条回答约增加半秒开销。
NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。
Why it matters: 单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。
Allen AI 提出 BenchMIRT,用多维项目反应理论逐题审计 LLM 基准,从 100 个模型、16 个基准、34K+ 题中独立恢复出安全与推理两个维度。分析显示 BBQ、WMDP 等基准的得分更依赖推理能力;保留 10% 题目仍能维持排名,模型在未见过题目上的预测准确率达 79%。
阿尔托大学研究团队开发了一种量子启发式算法,可在瞬间模拟包含超过 2.68 亿个位点的非周期量子材料,远超传统超级计算机能力。该算法将准晶体问题编码为量子多体系统,利用张量网络实现指数级加速,为拓扑量子比特和超摩尔超准晶体的设计铺路。研究目前仍处于理论模拟阶段,未来可适配至芬兰量子计算基础设施上的实际量子硬件。