xAI 的 Grok 4.7 上线 Amazon Bedrock
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过跨区域推理配置在 bedrock-runtime 端点提供服务,兼容 Responses、Chat Completions 和 Converse API。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过跨区域推理配置在 bedrock-runtime 端点提供服务,兼容 Responses、Chat Completions 和 Converse API。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为更高效、单任务成本更低的 Sonnet 模型,适合聚焦编码与知识工作。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 承担规模化任务。
OpenAI 启动 Codex Originals 项目征集,面向使用 Codex 的开发者、研究者与创作者收集真实故事与项目。有意参与者可通过下方表单提交自己的经历与作品。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,更快地构建、运营和销售现代车队管理方案,实现销售额提升 60%、节省 75+ 小时。
开源终端 AI 编程智能体 OpenCode 可接入 Amazon Bedrock 上的开放权重模型,推理在用户自己的 AWS 账户内完成,无按席位收费。文中演示了用 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 配置多模型工作流,并称 Ethara.AI 已用该架构在生产环境做多智能体编排。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准,可组合使用;RAG 并未消亡,它让模型基于训练数据外的文档、内部知识和代码库上下文作答,避免浪费 token 并减少不完整回答。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中增量发布而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿色和红色高亮显示增删改内容,终端面板支持运行命令和配置脚本,浏览器面板提供 Pick & Polish 工具用于选取元素并让智能体调整。完成审查、运行和预览后,用户可直接在应用内接受变更并创建 pull request。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
MIT 研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
OpenAI 披露内部编码智能体使用情况,聚焦智能体使用率、实验速度、任务复杂度与研究加速等早期数据。内容展示了编码智能体正在重塑 OpenAI 内部的 AI 研究方式。
GitHub 推出研究预览版 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 选择该模型。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话在独立的 Git worktree 上并行执行、互不干扰,并各自保留上下文,可随时切换且无需重新说明任务。在示例仓库 tailspin-toys 中,可同时让 Copilot 分别开发 funded sort 功能、执行无障碍审查和运行测试,并在会话视图中跟踪进度、查看结果。
Playco 借助 GPT-6 Astra,从一个灰盒基础版本构建了三款主题游戏原型,人工修复量比使用上一代模型减少 50%。
Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,称 3.8 是其目前最强的推理与编码模型,速度与成本与 3.7 Flash 持平。
推荐理由:官方给出两个变体的定价、基准与开放入口,可据此判断长程编码与安全场景的选型取舍。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:Orchard 把环境层做成可复用服务,并给出三个领域的训练配方与数据,读者可据此判断小模型在真实任务上的可行边界。
伯克利 AI 研究提出首个关于 word2vec 学习过程的定量预测理论,证明在实际训练条件下该问题可化简为无权重最小二乘矩阵分解,梯度流动态有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。