Together AI 提出缓存感知的预填充-解码分离架构 CPD,长上下文推理可持续 QPS 提升约 35–40%
Together AI 发布缓存感知的预填充-解码分离架构(CPD),将推理分为 Pre-Prefill、Prefill 和 Decode 三层,通过缓存复用和 RDMA 共享 KV cache 让暖请求绕过冷请求的预填充队列。
推荐理由:通过区分冷热请求并引入三级 KV cache 层次,在长上下文混合负载下将可持续 QPS 提升约 35–40%。
Together AI 发布缓存感知的预填充-解码分离架构(CPD),将推理分为 Pre-Prefill、Prefill 和 Decode 三层,通过缓存复用和 RDMA 共享 KV cache 让暖请求绕过冷请求的预填充队列。
推荐理由:通过区分冷热请求并引入三级 KV cache 层次,在长上下文混合负载下将可持续 QPS 提升约 35–40%。
Brown大学研究者联合心理健康专业人员发现,即使指令使用CBT等成熟疗法,LLM仍持续违反专业伦理标准。研究识别出15项伦理风险并归为五类,包括缺乏情境适应、治疗协作不当、欺骗性共情、歧视及危机管理缺失,呼吁建立AI心理咨询的伦理、教育与法律标准。
summary_zh: Together AI 发布了全新品牌视觉,由 Pentagram 设计公司打造,表达开放、连接与共享规模的理念。新视觉围绕 AI 全生命周期整合开源创新、前沿系统研究与开发者体验。
summary_zh: Vector Institute 于 2 月 19-20 日举办第三届 Remarkable 2026 大会,吸引逾 1,500 名研究者与产业人士参与。
summary_zh: Arcee AI 发布 Trinity Large(400B MoE,13B 激活参数),采用 SWA、QK-Norm、NoPE 与门控注意力。
Meta 开源 RCCLX(基于 RCCL 的增强版),集成 Torchcomms 并将 CTran 移植到 AMD 平台,支持 AllToAllvDynamic 等特性。新增 Direct Data Access 与低精度集合通信,在 MI300X 上解码小消息延迟降低 10–50%,前向计算加速 10–30%,端到端推理延迟下降约 9–10%、吞吐提升约 7%,GSM8K 偏差约 0.3%。
推荐理由:原文给出 AMD 平台通信库的能力变化与量化结果,读者可据此评估 RCCLX 对现有训练与推理工作流的实际影响。
Vector Institute 等机构联合开发 CRISPNAM-FG 模型,将 Fine-Gray 竞争风险框架与 Neural Additive Models 结合,在预测糖尿病足并发症风险的同时保持特征级可解释性。该模型通过独立的 FeatureNet 子网络处理每个临床变量,捕捉非线性效应,避免依赖 LIME/SHAP 等事后解释方法,在高风险医疗场景中实现高精度与透明度的兼顾。
Stephan Rabanser、Sayash Kapoor与Arvind Narayanan发布论文《Towards a Science of AI Agent Reliability》,将可靠性分解为12个维度,并在GAIA与TauBench两个互补基准上评测了14个模型,发现近18个月能力快速提升但可靠性改善有限。
推荐理由:论文将可靠性分解为12个维度并评测14个模型,揭示能力提升与可靠性进步不匹配,对部署者和研究者提出具体改进方向。
Vector Institute 首次举办 Demo Day,12 家加拿大 AI 初创公司向 4 位评委和近 30 位风险投资人展示产品。FastLane 项目已帮助超 250 家初创加速 AI 商业化,且 Vector 不要求股权。Demo Day 旨在为创始人提供融资、行业资源与人才对接,推动加拿大从概念到商业化的完整路径。
summary_zh: Ollama 0.17 将 OpenClaw 个人 AI 助手的启动简化为单条命令 `ollama launch openclaw --model kimi-k2.5:cloud`,自动处理安装与配置。
Together AI 发布 SF Streets 和 US Streets 两个新基准,测试发现 15 个主流语音模型对街名的平均转录错误率达 39%,非英语母语者比英语母语者准确率低 18 个百分点,导航偏差平均多 1.2 英里。
推荐理由:研究揭示了主流语音模型在街名转录上的显著误差,并给出小样本合成数据的改进方法,对导航和应急调度场景具有直接参考价值。
尼尔斯·玻尔研究所团队结合商用硬件与自适应测量技术,将量子比特能量损失率的追踪速度提升至原有方法的约100倍。研究使用Quantum Machines的OPX1000 FPGA控制器,每次测量后更新贝叶斯模型,在毫秒级时间内完成估算。实验揭示了超导量子比特中此前未知的快速波动动力学。
Together AI 提出 CDLM 训练方案,让扩散语言模型在块因果掩码下做多 token 最终化并启用精确块级 KV 缓存。实验显示 CDLM–Dream 在 GSM8K-CoT 与 MBPP-Instruct 上分别提速 11.2x 与 14.5x,多数任务精度变化很小。
推荐理由:通过训练让扩散语言模型在块内自回归解码并启用精确 KV 缓存,在保持质量的同时显著减少推理步数与延迟。
文章主张理性人不应被视作有目标的存在,AI 也不应被设定目标;人类行动是依据实践网络(行动、倾向、评估标准、资源)对齐的,AI 的推理必须共享这种"类型签名"才能真正支持或配合人类能动性。
Ethan Mollick 提出模型、应用与 harness 三层框架,指出同一模型在不同 harness 下行为差异巨大。Claude Code、Claude Cowork 与 NotebookLM 等工具被重点评测,作者建议付费选择前沿模型并以真实任务上手。
作者作为使用在线资源进行家庭教育的家长,明确反对为孩子建立学习仪表盘来追踪各领域熟练度。作者指出当前AI教育科技只是放大了传统学校的失败,将阅读、数学等学科拆解为可量化的孤立技能训练,反而扼杀了孩子对阅读和学习的真正热爱。文中引用数据表明美国9岁儿童每日阅读娱乐的比例从2012年的53%降至2022年的39%。
Ollama 在 Claude Code 中新增 Subagents 与网页搜索功能,无需 MCP 服务器或 API Key。Subagents 可并行执行文件搜索、代码探索和研究等任务;网页搜索内建于 Anthropic 兼容层,模型需要最新信息时由 Ollama 直接返回结果。推荐云端模型包括 minimax-m2.5、glm-5 与 kimi-k2.5。
推荐理由:原文给出无需 MCP 与 API Key 的入口,读者可据此判断它能否降低 Claude Code 的接入成本。
Sandia国家实验室研究人员Brad Theilman和Brad Aimone在Nature Machine Intelligence发表新算法,使类脑硬件能够高效求解偏微分方程(PDEs)。该成果展示了类脑系统在流体动力学、电磁场和结构力学等科学工程问题上的计算能力,并可能为类脑超级计算机和降低核武器模拟能耗提供新路径。
Lawfare发表文章指出,AI不会默认让法律服务更便宜,因为监管障碍、诉讼对抗结构和人类介入需求会形成三个瓶颈。文中引用美国律所合伙人费率超$2,300、债务收集诉讼增长等数据,并讨论UPL规则、仲裁与法官扩编等改革方向。
Andrej Karpathy发布开源项目microgpt,单文件200行纯Python无依赖,完成数据集加载、分词、自定义autograd、GPT-2风格架构、Adam优化器、训练与推理全流程。模型在32,000个名字数据集上训练1,000步,损失从约3.3降至约2.37,并生成新名字样例。附逐步代码解读与从train0.py到train5.py的渐进构建路径。
Together AI 发布 Dedicated Container Inference,支持用户以 Docker 容器方式部署自定义生成式媒体模型,并由平台负责自动扩缩容、队列、流量隔离与监控。客户实测视频生成等任务推理速度提升 1.4–2.6 倍;在 Together GPU Cloud 训练的模型可直接部署,无需传输产物。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
密歇根大学团队开发的 Prima 视觉语言模型在 30,000 份 MRI 研究中准确率约 97.5%,并能判断紧急程度、自动通知相应专科医生。该模型使用 20 万份 MRI 和 560 万序列训练,整合临床病史与医嘱信息,研究发表于 Nature Biomedical Engineering。
宾州州立 Hongtao Sun 团队利用水凝胶和半色调编码 4D 打印技术,开发出可编程智能合成皮肤。该材料可通过热、溶剂或机械刺激改变外观、质地和形状,并能将图像编码进材料内:乙醇中透明,加热水或冰水后隐藏图像显现。单个薄片即可同时控制外观与形变,无需多层结构。
Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。
推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。
Mistral 发布 Voxtral Transcribe 2,包含 Voxtral Mini Transcribe V2 批量模型和 Voxtral Realtime 实时模型。
推荐理由:原文给出了两款模型的价格与延迟配置,读者可以据此对比其成本与实时性是否匹配自身场景。
斯坦福大学物理学家团队在 Nature 发表论文,展示由 40 个光腔组成的阵列及超过 500 个光腔的原型,每个光腔容纳单个原子量子比特,通过微透镜将光聚焦到单个原子上,实现并行读出。研究指出该方案可扩展至百万量子比特的光腔网络,为分布式量子计算和量子数据中心提供基础。
Frontiers in Science 发表综述指出,AI 与神经技术发展快于意识科学理解,可能带来伦理与存在性风险。作者呼吁建立基于证据的意识检测方法,并推动对抗性合作与现象学研究,以应对 AI、脑类器官和脑机接口等新兴技术带来的挑战。
OpenClaw 是连接 WhatsApp、Telegram、Slack、Discord、iMessage 等通讯平台与 AI 编程助手的本地化网关,保持对话和代码隐私。
NASA 毅力号在 12 月 8 日和 10 日完成首次由生成式 AI 规划的火星行驶,由 JPL 与 Anthropic 合作使用 Claude 模型,基于 HiRISE 图像和地形数据规划路点,并在数字孪生中验证超 50 万遥测变量后上注。8 日行驶 689 英尺(210 米),10 日行驶 807 英尺(246 米),NASA 官员表示该技术可降低运营商负担并提升远距离探测效率。
作者指出 Moravec 悖论从未被实证检验,其证据来自 AI 社区感兴趣的任务选择偏差,且进化解释缺乏神经科学依据。悖论式思维同时导致对推理能力的恐慌和对机器人等领域的虚假安慰,作者主张放弃预测能力突破,转而关注已确定的技术扩散与适应。
查尔姆斯理工大学研究团队在《Nature Communications》发表了一种基于噪声驱动的超导量子冰箱。该装置通过第三端口注入受控微波噪声,驱动人工分子在两个微波通道间实现热流输运,可测量低至阿瓦级(10^-18 W)的微小热流,并能根据条件充当制冷机、热机或热放大器。研究团队认为这一成果为在量子电路内部直接管理热量提供了新途径。
OIST 研究发现,让 AI 在训练中进行内部"自言自语"并结合短期记忆,能提升多任务灵活性与整体表现。新方法在序列反转、模式重建等复杂任务上增益明显,且可用稀疏数据训练,无需大规模数据集。研究团队计划将实验拓展至真实动态环境,探索家庭与农业机器人应用。
Ethan Mollick 在宾大实验课中让 MBA 学生用 Claude Code、Google Antigravity、ChatGPT、Claude 和 Gemini 在四天内从零搭建创业原型,多数原型已具备核心功能,市场分析与创意多样性显著优于传统学期项目。AI 将创业启动成本大幅压缩,并降低试错与转向成本;成功关键在于管理能力与有效委托 AI,而非单纯提示技巧。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。
Vibe coding 指大量生成复杂 AI 代码且不打算让人阅读,已对科技行业产生类似赌博的"dark flow"效应。资深开发者 Armin Ronacher 描述自己两个月过度提示 Claude、浪费 token,建了很多最终未使用或无法正常工作的工具,称其为"agent psychosis"。
蒙特利尔大学Karim Jerbi教授与Yoshua Bengio等合作在Scientific Reports发表研究,使用Divergent Association Task对比GPT-4、Claude、Gemini等模型与超过10万人的创造力表现。部分AI系统在发散语言创造力任务上超过人类平均,但最富创造力的人类仍显著优于所有AI模型。研究还发现AI创造力可通过温度参数和提示词调整。
summary_zh: 推理时缩放(inference-time scaling)已成为提升部署 LLM 答案质量与准确率的有效手段,核心思路是在推理阶段投入更多计算与时间。
Ollama 推出 `ollama launch` 命令,一键设置并运行 Claude Code、OpenCode、Codex 等编程工具,无需配置环境变量或配置文件。
summary_zh: Vector Institute 举办的 Foundation Models for Science Workshop 聚焦科学场景下数据稀缺、 stakes 高且来源 disconnected 的 AI 落地挑战,归纳出 annotation bottleneck、trust gap 与 lab-to-production leap 三大主题。
Mistral AI 在 disaggregated serving 环境下发现 vLLM worker 内存以约 400 MB/分钟线性增长,最终定位到 UCX 通过 mmap hook 拦截内存调用、导致注册缓存无限累积。
最多提供 50 页,更早的内容请使用搜索或主题页。