文本分类的语言模型演进:从词袋到Jev
Sebastian Raschka梳理了文本分类从词袋模型、RNN/CNN到BERT/GPT的演进历程,并分析Jev的API设计与实际表现。Jev是TypeSafe AI发布的专有分类模型,在IMDb测试集上Choice API准确率达96.47%,延迟低、成本低,且无需针对每个任务微调。
Sebastian Raschka梳理了文本分类从词袋模型、RNN/CNN到BERT/GPT的演进历程,并分析Jev的API设计与实际表现。Jev是TypeSafe AI发布的专有分类模型,在IMDb测试集上Choice API准确率达96.47%,延迟低、成本低,且无需针对每个任务微调。
Sebastian Raschka 分享了对 GPT-6 Astra 的使用印象,指出其在 3D 渲染、动画、ARC-AGI-3(99.9%)等任务上表现突出,并探讨了循环变压器架构与隐藏推理链的传闻。
IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。
推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。
Nathan Lambert 发布由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,配套 12 小时课程、代码练习与模型对比。书中覆盖 RL 算法直觉、系统设计因素、后训练历史、蒸馏以及过拟合与评估等常见陷阱,并强调理解研究价值与产业落地节奏。
Mamba 是一种状态空间模型(SSM),通过选择性机制和状态压缩实现长序列建模,在百万级 token 长度下保持与 Transformer 相近的性能,同时推理速度最高提升约 5 倍。原文用 Temple Run 类比解释 SSM 的状态演化与离散化,并讨论其对可解释性、AI 安全与长期记忆应用的影响。