Perplexity 采用 GPT-6 Astra 处理端到端系统任务
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、Labels 触发器和 Actions 工作流搭出一套自动化管线:活动从单个 Issue 自动建站、生成 UTM 链接、每日筛选报名者并在结束后自动清理。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑 10 亿 ChatGPT 用户、每秒 2200 万次请求。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿色和红色高亮显示增删改内容,终端面板支持运行命令和配置脚本,浏览器面板提供 Pick & Polish 工具用于选取元素并让智能体调整。完成审查、运行和预览后,用户可直接在应用内接受变更并创建 pull request。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放,可连接企业数据、用自然语言发现洞察并构建交互式仪表盘。
OpenAI 发布 ChatGPT for Financial Services,将内置金融数据与 GPT-6 Astra 结合,用于研究、建模和生成可直接交付客户的材料。
推荐理由:OpenAI 把内置金融数据与 GPT-6 Astra 打包进 ChatGPT,读者可据此判断金融研究流程的入口变化。
OpenAI 与美国总务管理局(GSA)合作,为符合条件的联邦、州、地方及部落政府提供 $0 许可费、使用量 50% 折扣以及扩展的网络安全防御支持。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,支持自定义音色和电话(telephony)接入。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此判断语音应用的接入方式与能力边界。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:OpenAI 官方发布托管式 Agents API,读者可了解其编排、长时会话与工具调用能力。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他带来了 AI 对齐、安全与标准方面的经验。
OpenAI 的 Chris Lehane 主张,AI 能力越强,就越需要更强的安全证据、共享标准与持久的政策行动,并呼吁在政策窗口仍然敞开时采取行动。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、电脑操作能力,以及更强的写作与设计判断力。
推荐理由:OpenAI 官方发布 GPT-6 Astra,读者可据此了解其在推理、电脑操作与写作设计判断上的能力定位。
MIT 研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 开放学术研究免费使用。
推荐理由:AlphaGenome Atlas 把 90 亿个单核苷酸变异的预测结果做成可检索资源,读者可了解其数据规模与在罕见病研究中的实际用法。
OpenAI 探讨更强且更可负担的 AI 如何拓展个人与企业可完成的工作,并让增长更经济。文章聚焦能力提升与成本下降带来的工作范围扩大,未披露具体模型、版本或价格数据。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与输出定位,可据此判断图像生成能力的迭代方向。
OpenAI 宣布扩大对新闻业的支持,面向学生、教育工作者、记者和新闻机构提供工具、培训与合作伙伴关系。该计划覆盖从课堂到新闻编辑室的多个环节。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份文字说明和一份 Lean 形式化证明。
OpenAI 开放申请一项总额 500 万美元的资助计划,用于支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
OpenAI 联合 AIRPPU 和 WAN-IFRA 推出一个 AI 项目,帮助乌克兰新闻机构提升创新能力、韧性并强化独立新闻。该项目面向乌克兰新闻组织,具体工具、规模与上线时间未披露。
OpenAI 的 Jakub Pachocki 反思日益强大的 AI 与对齐难题,称其如同"异类心智",呼吁加强安全防护并推动国际协调。
OpenAI 披露内部编码智能体使用情况,聚焦智能体使用率、实验速度、任务复杂度与研究加速等早期数据。内容展示了编码智能体正在重塑 OpenAI 内部的 AI 研究方式。
GitHub 推出研究预览版 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 选择该模型。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话在独立的 Git worktree 上并行执行、互不干扰,并各自保留上下文,可随时切换且无需重新说明任务。在示例仓库 tailspin-toys 中,可同时让 Copilot 分别开发 funded sort 功能、执行无障碍审查和运行测试,并在会话视图中跟踪进度、查看结果。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,按 Brightband 的独立实时评测。
推荐理由:官方给出分辨率、更新频率与降水精度提升的具体数字,可据此判断 AI 天气预报在 Google 产品中的落地程度。
OpenAI 推出 Daybreak for Frontline Defenders,承诺投入 10 亿美元,为关键服务扩大前沿网络 AI 的使用权限,并提供培训与支持。
Playco 借助 GPT-6 Astra,从一个灰盒基础版本构建了三款主题游戏原型,人工修复量比使用上一代模型减少 50%。
Legora 借助 GPT-6 Astra 在数分钟内完成 41 份文档的审阅,找出了全部 4 处预设错误,并在该财务审阅工作流中把性能提升近 40%。
Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴限量开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型访问权限。
推荐理由:Google 把 Gemini 3.8 Flash Cyber 与 CodeMender 组合成受限访问计划,读者可了解其能力边界与准入条件。
Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,称 3.8 是其目前最强的推理与编码模型,速度与成本与 3.7 Flash 持平。
推荐理由:官方给出两个变体的定价、基准与开放入口,可据此判断长程编码与安全场景的选型取舍。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,均以 Apache 2.0 许可开源。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量较首版增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP。微软同时推出持续追踪各版本计算性能的 living benchmark。
微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨序列仍不可靠。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,同时支持报告生成与结构化预测,并用强化学习 DAPO 在多任务设定下奖励临床正确性。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:Orchard 把环境层做成可复用服务,并给出三个领域的训练配方与数据,读者可据此判断小模型在真实任务上的可行边界。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化翻译到 Apple Silicon,以及翻译层对性能差距的具体贡献。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。