研究人员对10万人测试AI与人类创造力
蒙特利尔大学Karim Jerbi教授与Yoshua Bengio等合作在Scientific Reports发表研究,使用Divergent Association Task对比GPT-4、Claude、Gemini等模型与超过10万人的创造力表现。部分AI系统在发散语言创造力任务上超过人类平均,但最富创造力的人类仍显著优于所有AI模型。研究还发现AI创造力可通过温度参数和提示词调整。
蒙特利尔大学Karim Jerbi教授与Yoshua Bengio等合作在Scientific Reports发表研究,使用Divergent Association Task对比GPT-4、Claude、Gemini等模型与超过10万人的创造力表现。部分AI系统在发散语言创造力任务上超过人类平均,但最富创造力的人类仍显著优于所有AI模型。研究还发现AI创造力可通过温度参数和提示词调整。
OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 两款开源权重模型,是自 GPT-2 以来首次开放大权重模型。模型采用 MoE、SwiGLU、GQA、滑动窗口注意力和 RMSNorm 等现代设计,并支持 MXFP4 量化以在单卡运行。两款模型均为推理模型,支持低/中/高推理强度调节,并在多个基准上接近 OpenAI 自有闭源模型。
summary_zh: HumaniBench 是首个针对大多模态模型(LMMs)以人为中心的综合评测基准,涵盖公平性、伦理、理解、推理、语言包容性、同理心与鲁棒性七项原则。
Mistral AI 与 Carbone 4、ADEME 合作完成行业首个 LLM 全生命周期分析(LCA),并由 Resilio 和 Hubblo 同行评审,覆盖温室气体排放、水资源消耗与资源枯竭三类指标。
summary_zh: Mistral 提出用结构化输出(Structured Outputs)实现 RAG Triad 评估框架,通过 Context Relevance、Groundedness、Answer Relevance 三个指标,结合"LLM As a Judge"对检索与生成结果进行自动评分。
summary_zh: LLM 作为自回归模型预测 token 序列,与量化交易中预测价格/交易序列在数据结构上有相似性,但金融数据噪声多、信号被有效市场竞争抵消,预测难度远高于语言。
对抗攻击通过精心构造的输入触发大语言模型输出不安全内容,攻击者可在白盒(获取梯度信号)或黑盒(仅通过 API)设定下操作。常见方法包括 Token 替换、基于梯度的攻击、Jailbreak 提示、人工红队与模型红队攻击,其中 TextAttack 等框架实现了针对分类与生成任务的对抗样本生成。
summary_zh: 文章批评当前 AI“对齐”研究被商业利益主导,认为其核心是打造能付费的产品,而非解决人类灭绝风险。OpenAI 与 Anthropic 等公司虽宣称研究对齐,但营收目标始终影响其治理与技术决策。
summary_zh: 大模型训练面临 GPU 内存与计算时间瓶颈,需依赖并行策略扩展至多 GPU。数据并行通过梯度同步更新权重,模型并行将参数切分到不同设备,流水线并行则用微批次减少空闲等待。