Atria 团队研究:AI 智能体承担更多模型研发工作,但决策仍由人类做出
Atria 团队在开发 744B 参数的 MoE 智能体语言模型 Atria Dawn Preview 过程中记录人机协作数据,发现 AI 参与了 96.5% 的任务,四周内智能体动作与人类输入的比值中位数从 11 升至 28.5。
Atria 团队在开发 744B 参数的 MoE 智能体语言模型 Atria Dawn Preview 过程中记录人机协作数据,发现 AI 参与了 96.5% 的任务,四周内智能体动作与人类输入的比值中位数从 11 升至 28.5。
AMD 宣布以 82 亿美元收购 World Labs,后者专注理解物理世界的深度学习模型。World Labs 创始人李飞飞将加入 AMD 出任执行副总裁兼首席科学家,双方去年已建立推理优化与训练合作。交易预计在今年年底前完成,尚待监管批准。
推荐理由:这笔 82 亿美元收购把世界模型与芯片路线绑在一起,读者可据此理解 AMD 与 Nvidia 在 AI 硬件生态上的竞争走向。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,通过将适配器 ID 外置到 AWS Systems Manager Parameter Store,生产环境适配器引用更新无需重新部署应用,原本需数小时至数天的协调工作缩短至数秒。
AWS 发布基于 Amazon EKS、EFA 和 DeepEP 的 MoE 强化学习训练架构,吞吐量提升 40%。该方案针对 RLHF 和 GRPO 等大规模 RL 训练中 rollout 生成与策略训练的资源竞争问题,通过 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信。
在 Amazon SageMaker HyperPod 上,用开源 RL 框架 SkyRL 对 Qwen3-VL-8B 视觉语言模型做 GRPO 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练算力与数据集分处不同 AWS Region 而无需复制数据。
Anthropic 开设湿实验室之际,Endura Therapeutics 的 Adrian Sanborn 提出 AI 改造科研的两条路径:Foundries 用新一代测序、多重检测和物理自动化把实验数据产出提速一个数量级,Navigators 则用模型优化决策与流程,无需专有模型或大数据集。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,读者可了解开放科学在疫情准备中的具体做法。
NVIDIA 验证工程师 Sakeena Fiza 在数据中心系统工程实验室负责新产品量产前的硬件验证,她回忆 NVIDIA Rubin GPU 首次在系统级成功枚举时团队集体欢呼。她将验证工作比作侦探破案,目标是在客户发现问题之前先发现问题,单块板卡可能含数万个元件、一个机架接近 50 万个。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式集成策略融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的排序预测,在盲测中化学家更偏好其单步反应预测。
MIT Technology Review 与 Times of San Diego 用 15 个月调查,绘制出首张美墨边境监控塔附近死亡事件综合地图与分析。
NVIDIA 在纽约气候周介绍了五家用 AI 推进清洁能源的公司。ThinkLabs AI 用 CUDA 平台打造数字孪生与智能体,帮助南加州爱迪生将电网互联申请评估时间从 30-45 天缩短至 2 分钟。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练而成,训练数据来自近三十年企业 CRM 部署的专有合成数据集。
推荐理由:Koa 基于 NVIDIA Nemotron 3 Super 后训练,并给出 CRM Bench 上错误率降低 3 倍的具体对比。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定电力预算下提升 AI 工厂的 token 吞吐。
推荐理由:原文给出 DSX 各组件在真实部署中的量化结果,读者可据此判断固定电力预算下提升吞吐的可行路径。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 系统、DSX 平台与 NVLink 6 的多项进展,核心指标从峰值性能转向每兆瓦可验证的智能体 token 数。
推荐理由:NVIDIA 在 AI Infra Summit 集中给出 Vera Rubin、DSX 与 NVLink 6 的能效与吞吐数据,可据此判断 AI 工厂的供电与推理经济性走向。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放,可连接企业数据、用自然语言发现洞察并构建交互式仪表盘。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 开放学术研究免费使用。
推荐理由:AlphaGenome Atlas 把 90 亿个单核苷酸变异的预测结果做成可检索资源,读者可了解其数据规模与在罕见病研究中的实际用法。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,均以 Apache 2.0 许可开源。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量较首版增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP。微软同时推出持续追踪各版本计算性能的 living benchmark。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,同时支持报告生成与结构化预测,并用强化学习 DAPO 在多任务设定下奖励临床正确性。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
伯克利 EPIC Data Lab 提出近零推理成本时代数据系统面临三大挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成数据系统。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
Berkeley AI Research 提出 GRASP,一种面向学习动力学(世界模型)的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接加入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划变得可行。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10x 更少的消融达到 SPEX 的性能。
伯克利 AI 研究团队提出基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,并在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计达到端到端 SOTA 水平,同时占用更少内存和算力,且无需任务专用解码器设计。
伯克利 AI 研究提出首个关于 word2vec 学习过程的定量预测理论,证明在实际训练条件下该问题可化简为无权重最小二乘矩阵分解,梯度流动态有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。