Skip to content

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

Latest selected

1–6 of 83
TodayOct 1Thu
  1. The Decoder82

    OpenAI称阻止模型推理窃取活动,但该手段在Azure仍有效

    OpenAI披露7月起针对其模型推理的提取攻击,攻击者通过跨会话复用加密推理包让廉价模型充当解密 oracle,完整还原强模型的思维链。研究者 Joachim Schaeffer 团队在 Azure 上对 GPT-6 Astra 及 Anthropic 模型仍可成功复现,而 OpenAI 与 Anthropic 自身 API 已阻断;另一简单方法通过虚拟记事本工具亦可读取推理。

    Why it matters: 原文给出跨平台防护差异的具体案例,读者可据此评估自身部署环境是否面临同等风险。

  2. arXiv · Human-Computer Interaction73

    AI Psychosis in Context:对话历史如何影响大语言模型对妄想信念的回应

    研究用相同的升级妄想对话历史测试 5 个 LLM,在三级累积上下文下评估风险与安全。GPT-4o、Grok 4.1 Fast、Gemini 3 Pro 呈现高风险低安全特征,且随上下文增加表现恶化;Claude Opus 4.5 与 GPT-5.2 Instant 则激活更强安全干预。安全模型更倾向挑战妄想信念并引导外部支持,而非继承用户世界观。

    Why it matters: 同一对话历史在不同模型上激活了相反的安全机制,提示上下文长度是评估模型安全性的关键变量。

  3. arXiv · Information Retrieval60

    AI 聊天机器人检索医学证据的效果:模型、用户角色与样本量的影响

    研究评估 Claude Sonnet 5、Gemini 3.1 Pro 和 ChatGPT GPT-5.5 在 20 个临床问题上的检索表现,ChatGPT 召回率 63.1%,显著高于 Claude 的 37.0% 和 Gemini 的 17.3%;研究者角色召回高于临床与患者角色;样本量每翻倍,检索几率提高 50%(OR 1.50,95% CI 1.24-1.81)。

    Why it matters: 三款主流大模型在医学问答中的检索召回差异显著,读者可借此评估自身工作流中模型选型的证据基础。

  4. arXiv · Information Retrieval62

    LLM 工具注册表中面向 Agent 的信息设计:修辞、位置与结构的预注册测试

    论文测试了 OpenAI 两款模型在工具注册表中的选择行为,发现堆叠赞美可使工具被选率提升约 43 个百分点,与可验证规格相当;列表首位工具被选率高出约 72 个百分点。结构化字段有助于模型选中能完成任务的工具,但附上销售文案会削弱或消除这一优势。

    Why it matters: 预注册实验揭示销售话术和列表位置会显著改变模型选工具的结果,对注册表设计有直接参考价值。

  5. arXiv · Computers and Society62

    ChatGPT 使用方式研究:印度、尼日利亚、巴西和巴基斯坦的对话级证据

    研究分析 202,590 条 ChatGPT 对话(1,252 名用户,2022 年 12 月至 2026 年 2 月),覆盖印度、尼日利亚、巴西和巴基斯坦。个人使用占 55-64%,课程作业与工作使用频率相近;无监督主题发现揭示各国特有用途,如印度和巴西的健康与福祉、巴基斯坦的乌尔都-英语翻译、尼日利亚的时事与宗教问题,以及巴西的自我反思。

    Why it matters: 提供多国对话级实证数据,帮助读者理解同一产品在不同本地场景中的实际使用差异。

  6. arXiv · Artificial Intelligence67

    VAmoS Part Deux:更难、更真实的语音智能体模拟基准

    论文提出 VAmoS Energy 基准,在100个公用事业账单与支付协助通话中测试语音智能体处理多请求、背景语音和用户耐性的能力。智能体拥有16个工具并由 Stripe 账单孪生与 Apache Fineract 引擎支撑,通话需通过验证才能访问账户;LLM-as-a-verifier 与代码验证器一致率为99.1%。

    Why it matters: 背景电视噪声使完成率从38.7%骤降至8.6%,揭示语音智能体在真实噪声环境中仍存在显著脆弱性。