Hot eventLive
arXiv论文分析4万例Copilot图像上传对话
1 reports1 sources3 hr ago updated
Get the story
AI overview
2026-10-02,arXiv《Human-Computer Interaction》发表一项研究,分析 Microsoft Copilot 中 40,000+ 张图像上传对话,提出涵盖感知、认知与生成的十种能力分层框架。结果显示多数图像上传任务涉及多能力组合,多模态使用覆盖比纯文本更广、更依赖跨模态对齐;253 个现有基准对感知与推理覆盖集中,但文本、代码与数据生成等常见工作流测试不足,该结论在独立 ChatGPT 数据集上得到验证。
Generated from reports · updated 2 hr ago
Timeline
Follow the coverage from different angles.
Oct 2, 2026
- arXiv · Human-Computer Interaction从图像到任务:真实场景中多模态 LLM 交互的特征分析
研究分析 Microsoft Copilot 中 40,000+ 张图像上传对话,提出涵盖感知、认知与生成十种能力的分层框架。多数图像上传任务涉及多能力组合,多模态使用覆盖比纯文本更广、更依赖跨模态对齐。253 个现有基准对感知与推理覆盖集中,文本、代码与数据生成等常见工作流测试不足,该结论在独立 ChatGPT 数据集上得到验证。
Heat trend
There is not enough continuous observation data to draw a trend yet.