arXiv · Computer Vision· Jingbo Yue, Bruce Coburn, Jinge Ma, Jui-Feng Chi, Fengqing Zhu·· 3 小时前AI 评分23
通过多模态食品项验证与恢复改进基于图像的营养估计
Improving Image-Based Nutrition Estimation Through Multimodal Food-Item Verification and Recovery
AI 导读
该研究提出一个用多模态大语言模型(MLLMs)清点可见食物、分别验证食物身份及各候选 2D 区域是否支持份量估计的框架,并通过整图审查触发至多一次定向恢复。恢复区域在不访问恢复提示词的情况下重新验证,再汇总为最终食物项集用于营养估计,无需任务特定微调。在常见有效输出样本的匹配评估中,食物项级定位在所有测试设置下均提升质量精度,并相对改进的检索基线提升能量精度,食物身份精确率与召回率也提高。
来源:arXiv · Computer Vision · arxiv.org