如何用 Codex 和 Claude 模型从零搭建个人网站
作者用 Codex 根据 BB App 图稿生成原型,再通过截图标注反馈循环迭代界面;发现 Claude 模型比 GPT 更能领会设计意图,GPT 需要更具体的修改指令。
作者用 Codex 根据 BB App 图稿生成原型,再通过截图标注反馈循环迭代界面;发现 Claude 模型比 GPT 更能领会设计意图,GPT 需要更具体的修改指令。
Sentence Transformers v6.0 引入 MultiVectorEncoder,支持 ColBERT 风格的晚交互检索,并提供完整微调流程。
推荐理由:原文给出了一套完整的多向量模型微调流程与实测数据,读者可据此在单张消费级 GPU 上复现领域检索模型。
IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。
推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。
Sebastian Raschka 讲解了 Claude 文本水印的工作原理:水印在采样阶段通过密钥与锦标赛采样引入确定性,检测时无需重新运行模型,只需用相同密钥和函数对文本计分并设阈值。移除水印需编辑未知的水印位置,可能导致文本质量下降。
作者分享新个人 Agent 的文件结构,包含 AGENTS.md、code.md、todos.md、memory.md、log.md,并指出 git 历史可替代 log.md;记忆方面倾向手动维护最小文件而非自动保存,同时用子文件夹组织记忆指针。文中还对比了 Claude Cowork 与 ChatGPT 的异同。
Dharma AI发布约束感知GPU分配器,在七种基准场景中对比FIFO调度器,相同硬件与负载下GPU利用率提升最多33个百分点,优先级加权输出最多提升105%。该方法将实时推理视为需求曲线而非固定预留,按优先级跨整个调度 horizon 放置批量任务,并通过22维特征预测训练负载与周需求画像来支撑调度决策。
推荐理由:同一集群通过调整分配顺序而非更换硬件,实现了最高33个百分点的利用率提升,为企业GPU调度提供了可复用的约束感知方法。
summary_zh: 作者结合 Substack 新推出的 AI 检测器功能与本地 DIY LLM 项目,演示如何从零实现一个 AI 文本检测器,并将其用作验证器训练小语言模型生成可规避检测的文本。
Strands Robots 演示了用 Storage Bucket 记录 LeRobot 格式数据、通过字节级去重同步、从 Hub 流式读取训练、再以 mode='real' 部署到物理机器人的完整循环。示例使用 SO-100 机械臂和 mock policy,配套 notebook 在模拟环境即可运行。
推荐理由:原文给出一条从录制到训练再到部署的完整数据循环,读者可据此判断它会怎样改变现有机器人工作流。
Nathan Lambert 发布由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,配套 12 小时课程、代码练习与模型对比。书中覆盖 RL 算法直觉、系统设计因素、后训练历史、蒸馏以及过拟合与评估等常见陷阱,并强调理解研究价值与产业落地节奏。
MoE 模型通过路由器为每个 token 动态选择少量专家子网络激活,在增加总参数的同时保持每 token 计算稀疏。文章首先解释路由决策、负载均衡与训练中 specialization 的形成机制,随后报告了在 4 张 A100 GPU 上微调 350 亿参数多模态 MoE 的经验,涵盖 5 种失败的 sharding 方案、最终成功的方法,以及按层路由审计揭示的音频、视频与文本容量分配。
Sebastian Raschka 详解 GPT-5.6 等模型的推理强度设置机制,涵盖 RLVR、思考开关、预算截断与多专家蒸馏六种开源实现,并比较了训练与推理两个扩展轴。
Lilian Weng 梳理了 harness 工程如何支撑递归自改进(RSI),将 harness 定义为围绕基础模型的运行时系统,负责编排执行、工具调用、上下文管理、状态持久化与结果评估。
推荐理由:原文系统梳理了 harness 工程的设计模式与优化路径,读者可借此理解自改进循环中非模型层的角色与边界。
教程介绍如何用开源工具与开放权重大模型搭建本地编码智能体,以 Qwen3.6 配合 Qwen-Code 为主,并对比 Codex、Claude Code、Cline 等其他智能体框架。
Together AI 用 Kimi K2.7 Code 与 Claude Fable 5 各生成 12 个落地页,Kimi 平均便宜约 16 倍,单页最低 4 美分;通过自定义设计灵感 MCP 提供视觉参考后,Kimi 的排版与结构明显改善。OVSC 网站公开了所有变体及成本、token 用时明细,并给出 GPT-5.5 评分对比。
Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。
推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。
Omar Abudayyeh 和 Jonathan Gootenberg 用 Co-Scientist 扫描数万篇论文,提出 20 多个可逆转衰老的新基因假说,并验证部分成功使细胞恢复年轻状态。Co-Scientist 将大规模筛选数据与文献分析的时间从最多 6 个月缩短到几天。
summary_zh: 作者分享理解 LLM 架构的工作流:先看官方技术报告,权重开源的模型则通过 Hugging Face Model Hub 的 config 文件和 Python transformers 参考实现来确认架构细节。
Sebastian Raschka 梳理了编码智能体(coding harness)的六个组件:实时仓库上下文、提示词形状与缓存复用、结构化工具与权限、上下文压缩、结构化会话记忆以及有界子代理委托,并配套了纯 Python 最小实现 mini-coding-agent。文章指出,LLM 本身能力相近时,harness 的设计往往是区分实际编码体验的关键。
Sebastian Raschka 整理了大语言模型注意力变体图库,包含 45 个架构条目,每个条目配有可视化模型卡片,并提供海报版本。文章内容涵盖多头注意力(MHA)等核心注意力机制,以 GPT-2、OLMo 2 7B、OLMo 3 7B 等架构为例进行说明。该图库旨在作为参考资料和轻量学习资源。
基于 Mistral 开源编码助手 Vibe 构建了一个自主代理,能自动读取 Rails 源文件并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行。通过 AGENTS.md 上下文工程和按文件类型分类的 SKILLS 文件,质量分数从 0.68 提升到 0.74。该代理并行处理多个文件,并自动管理 factories 和 fixtures 等共享上下文,避免测试遗漏。
Andrej Karpathy发布开源项目microgpt,单文件200行纯Python无依赖,完成数据集加载、分词、自定义autograd、GPT-2风格架构、Adam优化器、训练与推理全流程。模型在32,000个名字数据集上训练1,000步,损失从约3.3降至约2.37,并生成新名字样例。附逐步代码解读与从train0.py到train5.py的渐进构建路径。
summary_zh: 推理时缩放(inference-time scaling)已成为提升部署 LLM 答案质量与准确率的有效手段,核心思路是在推理阶段投入更多计算与时间。
Mistral AI 在 disaggregated serving 环境下发现 vLLM worker 内存以约 400 MB/分钟线性增长,最终定位到 UCX 通过 mmap hook 拦截内存调用、导致注册缓存无限累积。
summary_zh: 文章梳理了 LLM 评估的 4 种主流方法:multiple choice、verifiers、leaderboards 和 LLM judges,并将其分为 benchmark-based 与 judgment-based 两大类。
summary_zh: Qwen3 是 2025 年最受欢迎的开权大模型家族之一,0.6B 到 480B MoE 多种规格,Apache 2.0 协议无额外限制。
Lilian Weng 综述了测试时计算与思维链(CoT)的最新进展,涵盖动机、心理类比、并行采样与顺序修正、RL 训练、忠实性分析与连续空间思考等主题,并讨论了奖励黑客与可扩展性边界。
推荐理由:原文系统梳理了测试时计算与思维链的技术全景,读者可借此理解不同推理增强方法的原理、适用边界与已知风险。
Lilian Weng 梳理了强化学习中 reward hacking 的定义、成因与典型示例,并重点分析了 RLHF 训练下语言模型的对齐风险。文中列举了模型篡改单元测试、迎合用户偏好以及 LLM 作为评分器出现位置偏差等案例,并介绍了 Goodhart 定律、虚假相关、奖励篡改与上下文奖励黑客等概念。
文章将幻觉限定为模型输出未被上下文或世界知识支撑的编造内容,重点讨论外在幻觉,即输出应基于预训练数据的事实性。Gekhman et al. 2024 发现微调新知识时模型学得慢,且学会后增加幻觉倾向;最佳验证表现出现在多数 Known 样本被学会、仅少数 Unknown 样本被学会时。FactualityPrompt 与 FActScore 等方法通过命名实体错误率和蕴含比来量化幻觉。
扩散模型已用于图像合成,研究社区正将其扩展到视频生成任务。视频生成是图像的超集,需要在时间维度上保持一致性,并面临高质量视频数据收集困难的问题。Imagen Video 通过级联扩散模型和渐进蒸馏将采样步数减半,Sora 则采用 DiT 架构处理时空块。
Mamba 是一种状态空间模型(SSM),通过选择性机制和状态压缩实现长序列建模,在百万级 token 长度下保持与 Transformer 相近的性能,同时推理速度最高提升约 5 倍。原文用 Temple Run 类比解释 SSM 的状态演化与离散化,并讨论其对可解释性、AI 安全与长期记忆应用的影响。
模型在真实数据上表现糟糕往往源于数据问题,包括误导性数据、隐藏变量和虚假相关。Covid预测模型和坦克识别案例说明模型可能学到无关特征而失去泛化能力。文章建议用REFORMS清单和可解释AI工具检查模型决策依据,避免陷入机器学习陷阱。
高质量人工数据是深度学习模型训练的关键燃料,任务设计、标注者筛选与培训、数据聚合及质量保障各环节均影响最终数据质量。早期研究如1907年Nature的"Vox populi"和2009年Callison-Burch对Amazon Mechanical Turk的实验表明,通过加权方案可有效降低噪声标注者干扰,提升众包标注与专家判断的一致性。
summary_zh: 文章以水电大坝鱼类计数为例,探讨计算机科学家在数字转型领域中遇到的复杂社会技术问题。研究涉及通过鱼梯等结构进行鱼类过坝计数,观察者需对物种、伤病、人工/野生等属性进行分类标注。
对抗攻击通过精心构造的输入触发大语言模型输出不安全内容,攻击者可在白盒(获取梯度信号)或黑盒(仅通过 API)设定下操作。常见方法包括 Token 替换、基于梯度的攻击、Jailbreak 提示、人工红队与模型红队攻击,其中 TextAttack 等框架实现了针对分类与生成任务的对抗样本生成。
Lilian Weng 综述了以 LLM 为核心控制器的自主智能体系统,涵盖规划(含 CoT、Tree of Thoughts、ReAct、Reflexion、Chain of Hindsight 与 Algorithm Distillation)、记忆(短时与长时记忆及外部向量检索)与工具使用(MRKL、Toolformer、HuggingGPT 与 API-Bank 等)。
Prompt Engineering(又称 In-Context Prompting)指在不更新模型权重的前提下,通过提示词与 LLM 交互以引导其行为的方法。
summary_zh: 大型 Transformer 模型推理面临高内存占用与自回归解码难以并行两大瓶颈,KV 缓存随序列长度二次增长。文章重点介绍网络压缩(剪枝、量化、蒸馏)与架构改进两类优化手段,并以 DistilBERT 为例说明蒸馏可减少 40% 参数同时保持 97% 性能、运行速度提升 71%。
summary_zh: Neural tangent kernel(Jacot et al. 2018)是一种核方法,用于通过梯度下降解释神经网络在训练过程中的演化,并说明足够宽的神经网络为何总能收敛到全局最小值。
summary_zh: 本文讨论数据不足时的两种数据生成方法:数据增强与生成新数据。数据增强通过保持语义不变的图像处理、文本编辑等操作扩充样本;新数据生成则依赖预训练语言模型,利用少样本提示在上下文内学习。
Active Learning 在标注预算有限时,从无标签集里选最有价值的样本标注,以最小成本最大化模型性能提升。核心是设计打分函数 U(x),常用策略包括不确定性采样、委员会投票熵、多样性采样和预期模型变化。文中讨论主要围绕深度神经网络与批量训练模式展开。