文本分类的语言模型演进:从词袋到Jev
Sebastian Raschka梳理了文本分类从词袋模型、RNN/CNN到BERT/GPT的演进历程,并分析Jev的API设计与实际表现。Jev是TypeSafe AI发布的专有分类模型,在IMDb测试集上Choice API准确率达96.47%,延迟低、成本低,且无需针对每个任务微调。
Sebastian Raschka梳理了文本分类从词袋模型、RNN/CNN到BERT/GPT的演进历程,并分析Jev的API设计与实际表现。Jev是TypeSafe AI发布的专有分类模型,在IMDb测试集上Choice API准确率达96.47%,延迟低、成本低,且无需针对每个任务微调。
OpenAI 声称其最先进 AI 模型解决了 Navier–Stokes 方程相关的千禧年难题,证明该方程在某些情况下会产生奇点,即预测出物理上不可能的无限速度。物理学家和数学家正借助 AI 进一步理解湍流。
推荐理由:AI 证明 Navier–Stokes 方程存在奇点,为流体湍流研究提供了新的数学视角。
Interconnects 复盘最新开放模型动态,指出多家公司持续投入训练并以开放方式发布模型,Thinking Machines 的 Inkling 与 Poolside 的 Laguna S2.1 等均在 Pareto 前沿有表现。DeepSeek-V4-Flash 在 OpenAI 降价后更新,Kimi K3 采用非商业许可并引发关于美国政策工具的讨论。
Nathan Lambert与Florian Brand讨论了Kimi K3发布后的开源模型格局,包括GLM 5.2的持续角色、中国模型性能提升的资本与数据因素、蒸馏在RL阶段的作用争议,以及中美开放模型生态的基础设施差距。
Moonshot AI 于 7 月 16 日发布 2.8T 参数 MoE 模型 Kimi K3,权重将于 7 月 27 日开放。在 Vals AI Index 排名第 2,Artificial Analysis 智力指数排名第 3(仅次于 Claude Fable 与 GPT-5.6 Sol Max),在 Frontend Code Arena 排名第 1。
推荐理由:K3 让开放权重模型首次逼近前沿,读者可据此重新评估开放与闭源模型的能力差距及扩散节奏。
Nathan Lambert 亲测 GLM-5.2 后认为,它是首个在编码 harness 中表现可靠的开放权重通用智能体模型,Arena 评测中已能比肩 Claude Opus 4.8 的 max 模式。社区反响强烈,作者将其与 DeepSeek R1 类比,并指出这会给 Anthropic 带来定价压力,同时让开放模型经济迎来拐点。
推荐理由:作者以亲测视角说明 GLM-5.2 在编码智能体工作流中的可用性,为读者判断开放模型何时能替代闭源前沿模型提供可迁移观察。