Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,称 3.8 是其目前最强的推理与编码模型,速度与成本与 3.7 Flash 持平。
推荐理由:官方给出两个变体的定价、基准与开放入口,可据此判断长程编码与安全场景的选型取舍。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,称 3.8 是其目前最强的推理与编码模型,速度与成本与 3.7 Flash 持平。
推荐理由:官方给出两个变体的定价、基准与开放入口,可据此判断长程编码与安全场景的选型取舍。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,官方称视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及可用入口,读者可据此判断长视频分析的成本结构变化。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本收益。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:Orchard 把环境层做成可复用服务,并给出三个领域的训练配方与数据,读者可据此判断小模型在真实任务上的可行边界。
微软研究院提出 Echoverse,为计算机操作智能体构建十二个训练世界,包括十个完整领域环境和两个能力环境,每个环境自带数据库、任务和基于数据库真值的验证器。
推荐理由:微软研究院公开了十二个计算机操作智能体训练环境与配套验证器,并给出深度环境与浅层环境对迁移效果的对比数据。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型。
推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化翻译到 Apple Silicon,以及翻译层对性能差距的具体贡献。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,首次实现对完整人形机器人的全身控制,并提升灵巧操作与多机器人协作能力。
推荐理由:原文给出三款模型的职责分工与本地部署、快速适配新机体的能力,读者可据此判断机器人智能层的当前边界。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款模型。
推荐理由:官方给出三款 Flash 模型的 token 效率、价格与基准变化,可据此判断智能体工作流的成本走向。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的对比数据,可了解其成本与能力取舍。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全防护选项,可据此判断智能体跨平台自动化的落地路径。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 使用 Co-Scientist 加速细胞衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,成功将细胞推向更年轻状态并改善整体功能。此外,Co-Scientist 将原本需要长达六个月的筛选数据分析缩短至几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,读者可据此判断 AI 辅助科研的实际效率提升。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国地点并搭配风格与角色描述,生成起点绑定真实街景的交互世界。
推荐理由:原文给出 Genie 接入 Street View 真实影像后的世界生成方式与开放范围,读者可据此判断世界模型落地路径。
Google DeepMind 发布 Gemini for Science,在 Google Labs 上线三项实验工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成可申请试用的科学工具,读者可据此判断科研智能体的落地形态。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量能否兼得。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化科学假设。
推荐理由:原文给出多智能体系统的三阶段架构与真实科研案例,读者可据此判断它在假设生成环节的可用边界。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果,覆盖数学、量子物理、基因组、电网优化和 AI 基础设施等领域。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,从基因组到 TPU 设计,可看编码智能体在真实基础设施中的迁移路径。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开 AI co-clinician 研究,给出医生盲评与多模态模拟的对比结果,可了解医疗智能体的能力边界。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四种尺寸覆盖从手机到工作站的部署,并给出 Arena 排名与 Apache 2.0 许可,便于判断开源模型的可用边界。
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性演示,用户可通过指点加语音在 Google AI Studio 中编辑图片或查找地点。
推荐理由:Google DeepMind 公布 AI 指针的四条交互原则,并说明 Gemini 已接入 Chrome 与 Googlebook,读者可据此判断 AI 交互从提示词转向指点的路径。