热点事件持续更新
Bellman-Certified Rounding for Sparse Policy Deployment in MDPs
1 篇报道1 个报道来源4 小时前 更新
先了解这件事
AI 综述
该论文研究有限 MDP 中连续策略混合舍入为稀疏二进制策略时如何保留折扣回报,方法通过 2d+2 次 Bellman 求解得到可复用包络,在舍入前提供均匀与候选特定保证。候选特定界将结构化测试集上的认证覆盖率从 48.2% 提升至 74.1%,在 γ=0.95 时局部积分把中位界损失比从 402.3 降至 2.08。论文证明当预算线性增长时线性维度依赖不可避免,且精确全局曲率阈值判定是 NP 难问题。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv · Machine Learning TheoryBellman-Certified Rounding for Sparse Policy Deployment in MDPs
论文研究有限 MDP 中连续策略混合舍入为稀疏二进制策略时如何保留折扣回报,通过 2d+2 次 Bellman 求解得到可复用包络,在舍入前提供均匀与候选特定保证。候选特定界将结构化测试集上的认证覆盖率从 48.2% 提升至 74.1%,在 γ=0.95 时局部积分把中位界损失比从 402.3 降至 2.08。论文证明当预算线性增长时线性维度依赖不可避免,且精确全局曲率阈值判定是 NP 难问题。
本事件热度走势
当前热度 9·可比范围峰值 10(10月2日 13:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。