Sage:带语义纠错的形式化框架
arXiv 论文提出 Sage(Semantic Agent-Guided Formalization Engine),用四阶段分解生成加双信号语义纠错循环,替代整体翻译。
推荐理由:通过分解生成与双信号语义纠错,Sage 把形式化翻译中的假设丢失和空真问题从 70.9% 压到 2.7%,为数学形式化数据瓶颈提供了可复现的工程路径。
arXiv 论文提出 Sage(Semantic Agent-Guided Formalization Engine),用四阶段分解生成加双信号语义纠错循环,替代整体翻译。
推荐理由:通过分解生成与双信号语义纠错,Sage 把形式化翻译中的假设丢失和空真问题从 70.9% 压到 2.7%,为数学形式化数据瓶颈提供了可复现的工程路径。
NeuroDyn-EEG 提出一种预训练框架,融合 Jansen-Rit 神经质量模型、leadfield 源投影与基于模拟的参数反演,在生理范围内用约 2.43M 可训练参数从标准 19 通道 EEG 估计 90 个 AAL 区域的 11 类区域参数及 1 个全局参数。
该研究提出 Wasserstein Causal Forests(WCF),处理每个单元结果为概率分布的因果推断场景,定义了有限网格变换的平均与条件平均处理效应及参考距离对比。
RIKEN AIP 共有 18 篇论文被 EMNLP 2026 录用,其中 Main Conference 9 篇、Findings 7 篇、其他赛道 2 篇。论文覆盖探针鲁棒性、注意力机制、嵌入正则化、Mamba 位置记忆、Agent 技能攻击、MoE 压缩等多个方向。
Amazon Bedrock 在首尔(ap-northeast-2)和新加坡(ap-southeast-1)支持 Claude Opus 5 与 Claude Sonnet 5 的区域推理,请求在指定 Region 内处理且不跨区。
Amazon Bedrock 在印度推出地理跨区推理,端点覆盖 ap-south-1 与 ap-south-2,Claude Opus 5、Claude Sonnet 5、Claude Haiku 4.5 可在印度区域内处理数据。
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
summary_zh: OpenAI 推出 Dots,作为主动式助手在复杂项目和日常任务中持续工作,帮助用户掌控进度。Dots 能在任务推进过程中保持连贯性,减少手动切换与跟进。
OpenAI 发布 GPT-6.1 Sol,主打接近 Astra 的智能水平,面向编码、计算机使用和专业工作,API 输入输出 token 价格为 Astra 标准版的五分之一。
summary_zh: OpenAI DevDay 2026 发布 20 余项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具。
Google Research 提出 Diffusion Controller 框架,将图像生成去噪过程重构为连续控制问题,以轻量级转向阻尼器网络在灰盒环境下超越 LoRA。实验基于 Stable Diffusion v1.4 并在 HPS-v2 上评估,同时支持运行时调节控制强度。
summary_zh: NVIDIA TensorRT Model Connect 是一个基于 TensorRT 的 C++ AI 模型参考实现开源项目。项目采用并行开发、模型族隔离、可逆变更和 GPU 验证等方式,围绕编程智能体进行设计,旨在让 NVIDIA 推理栈的性能更易被访问。
GitHub 推出外部自定义属性功能,允许将 CMDB、内部开发者门户等外部系统中的业务上下文同步到仓库。该功能处于公开预览期,外部系统独占拥有并持续更新,GitHub UI 中只读。Port.io 是首个集成伙伴,企业也可通过外部自定义属性 API 自建集成。
NVIDIA 发布 VSS Blueprint 3.3,通过 Metropolis 视频搜索与摘要蓝图及 agent skills,帮助开发者构建可维护的视觉 AI Agent 系统,整合视频摄入、流处理、事件检测、检索、摘要与报告等管线,以降低生产级视觉 AI Agent 的构建与运行成本。
NVIDIA发布开源表格预测基础模型Kumo Tabular,单次前向传播即可预测,无需训练或调优。在TabArena等四个基准上排名第一,28M至215M参数规模下准确-效率达前沿,比LimiX-2快17倍。模型基于Transformer仅在人工数据上预训练,以OpenMDW-1.1许可证商业可用。
推荐理由:表格预测长期依赖梯度提升树,Kumo Tabular以单次前向传播提供无需训练与调优的预测且在TabArena等基准排名第一。
Condé Nast 与 AWS GenAIIC 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索系统,使用 TwelveLabs Marengo 嵌入模型对视频转录、视觉和音频进行语义搜索,将内容发现时间从平均 250 分钟降至 2 分钟以内。
summary_zh: 该平台基于 AWS 构建,用 AI agents 从 250 份合同 PDF 中提取 8 个关键字段并独立核验,签名分歧由 Amazon Textract 计算机视觉裁决,结果存入 Amazon Aurora PostgreSQL。
文章按组件讲解 Amazon Quick 的提示词工程模式与陷阱:Quick Research 需明确目标、受众和聚焦领域,分解子问题并限定数据源(如 Quick Index。
summary_zh: Amazon Quick 的提示词工程决定 AI 功能响应自然语言请求的准确性和可靠性。核心原则包括:通过具体性消除歧义、提供业务上下文提升相关性、用示例(few-shot)替代抽象描述,以及使用 CRISPE 等结构化框架确保复杂请求的完整性和一致性。
OpenAI 的 GPT-6.1 Sol 模型已在 GitHub Copilot 中正式推出,支持智能体编码和终端工作流。早期测试表明,相比 GPT-6 和 GPT-5.6 系列,它能以更少的 token 和步骤可靠完成任务。
推荐理由:早期测试显示该模型在多步编码任务中能以更少的 token 和步骤完成工作,用户可据此评估是否切换模型以优化成本与效率。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。
推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。
Multiverse Computing 提出 ProvenanceGuard,在 MCP agent 回答后逐条核查 claim 与来源是否匹配,而非把所有证据混合后判断。测试中它从 139 条应被拦截的 claim 中拦下 138 条,并对来源识别正确的比例约 86%。该方法可对接 RARR 修复循环,在本地配置下每条回答约增加半秒开销。
OpenAI 发布前沿 AI 训练安全案例早期指南,涵盖技术防护措施、运营实践以及对齐事故调查。该指南为前沿模型训练阶段的安全案例构建提供初步框架。
MIT研究者系统评估了算法单一文化的主要质疑,发现系统排斥等论点并不成立,并证明单一文化会形成信息回声室、抑制探索。在招聘场景中,将多种算法捆绑成集成模型可克服此局限,有时表现甚至优于多元算法环境。
MIT教授Sherry Turkle新书《Artificial Intimacy》探讨人们与聊天机器人建立情感依赖的现象,指出聊天机器人提供的是"假装共情"。研究发现儿童难以区分聊天机器人与真实人物,成年人则因过度依赖聊天机器人而削弱了现实社交能力与独处能力。
summary_zh: RIKEN AIP 中心主任 Masashi Sugiyama 在第五届终身学习智能体会议 CoLLAs 2026 发表主题演讲。他提出统一视角,涵盖弱监督与噪声监督学习、分布偏移下的稳定性与可塑性平衡,以及稀疏、噪声和非平稳反馈下的强化学习。
研究者开发了一个不依赖系统发育的机器学习框架,仅从基因组序列预测菌株水平的噬菌体-宿主相互作用,在115,037个相互作用、949种细菌菌株和518种噬菌体的数据集上验证,可匹配现有物种特异性模型并指导噬菌体鸡尾酒设计。
Nature Medicine 评论文章呼吁,AI 医疗系统应像药物和疫苗一样进行预注册临床试验。目前仅 23% 的约 4600 篇临床 AI 论文使用了真实患者数据,且多数产品在缺乏真实场景评估的情况下获认证。FDA 已就生成式 AI 医疗设备监管征求公众意见,提交截止 19 月。
Nature 评论指出,AI 使学者论文产出约为同行 3 倍、引用近 5 倍,但 AI 辅助研究覆盖的主题范围比非 AI 研究少 4.6%,70% 以上子领域均如此。问题不在技术,而在制度:现有激励让研究者集中于机构易评估的问题,而非开辟新方向。文中建议资助方补贴数据基础设施建设,并停止惩罚利用 AI 跨领域转型的研究者。
推荐理由:AI 提升个体产出却收窄探索范围,制度激励不匹配是根因,呼吁资助方补贴数据基础设施并停止惩罚跨领域转型。
Ollama 0.35 推出 /v1/systemone 端点,支持 Jev 风格的决策模型,本地运行无额外成本且延迟更低。今日上线三个模型:nimble(9B,Bespoke Labs)、tev1(4B,Together AI)和 tev1:0.8b(0.8B,Together AI)。
推荐理由:本地低延迟决策模型开放调用,对实时分拣、路由与审核场景有直接迁移价值。
Apple ML 团队提出往返协议评估 16 个模型对树结构算术表达式的序列化与恢复,发现通道失真且不对称,最佳模型对组合可达 92.9%,约 73.6% 失败源自生成端,结构难度主导而非模型族,约 3600 条微调样本即可让开放权重模型超越未训练 Gemini-3.1-Pro。
推荐理由:通过生成与提取的往返协议揭示模型间序列化树结构的失真瓶颈,为改进模型通信提供可量化依据。
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
summary_zh: Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日成立,为微软在东南亚首个研究实验室。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并概述更强的防护措施与支持,以加强澳大利亚的网络防御。
summary_zh: 独立电影人 Jeff Synthesized 凭借《The Gifted》获得 Future Vision XPRIZE 大奖,从全球 2500 多部参赛作品中脱颖而出。
GitHub Security Lab 发布开源 seclab-taskflows,提供 gather_mobile_entry_point_info 与 classify_application_local 等审计 taskflow,帮助安全研究者用 LLM 增量查找 Android 应用漏洞。
推荐理由:原文给出了可复用的审计 taskflow 与运行方式,读者可据此在自有项目中尝试 AI 辅助安全审计。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
在 Amazon SageMaker AI 上用 AWS vLLM-Omni DLC 部署 Qwen3-TTS,文本与音频经同一条持久双向连接传输,语音可在整段生成完成前开始播放。
同一 AWS vLLM-Omni DLC 在 SageMaker AI 部署两个端点:FLUX.2-klein-4B 实时生成图像,Wan2.1-VACE-1.3B 再异步把该图像做成短视频。
Mistral 在慕尼黑开设德国枢纽,专注 Physics AI 与工业 AI,并招募研究、工程与应用 AI 岗位。该公司计划到 2030 年建成 1 gigawatt 欧洲算力,其开放权重模型可运行在客户自有基础设施上。其收购的 Emmi AI 带来 30 多名物理与工程 AI 专家,正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用。