跳到正文

#Microsoft

今日 2 条
今天9月29日周二
9月28日周一
  1. The Verge · AI71

    英伟达发布 Open Agent Safety Platform,称可在毫秒级隔离越界智能体

    英伟达推出 Open Agent Safety Platform,用于隔离和监控 AI 智能体,称可在毫秒级内隔离试图越界的智能体。该平台基于开源软件 OpenShell,运行在英伟达 Vera AI CPU 上,用户可设定智能体可访问的信息,OpenShell 会在任务执行前和执行中检查这些限制,另有独立芯片上的 Sentry 技术持续监控智能体。

9月26日周六
9月25日周五
9月24日周四
9月23日周三
  1. Ars Technica · AI62

    微软联合行业打击 AI 辅助诈骗平台 EvilTokens,涉 12000 个账号被盗

    微软周二表示牵头联合行业打击了一个订阅制诈骗平台 EvilTokens,该平台借助 AI 聊天机器人攻破 12000 个微软账号。该平台今年 2 月通过 Telegram 频道推出,收取 1500 美元初始费用及每月 500 美元续费,可批量入侵邮箱账号、分析收件箱、筛选高价值目标并起草冒充可信联系人的诈骗邮件。

9月21日周一
9月17日周四
  1. GitHub Blog · AI & ML72

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中增量发布而非一次性切换。

    推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。

9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot 应用新手指南:使用 diff、终端和浏览器面板

    GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿色和红色高亮显示增删改内容,终端面板支持运行命令和配置脚本,浏览器面板提供 Pick & Polish 工具用于选取元素并让智能体调整。完成审查、运行和预览后,用户可直接在应用内接受变更并创建 pull request。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 发布 Project HydraFusion:多模型编排实现前沿级编码质量

    GitHub 推出研究预览版 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 选择该模型。

    推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。

9月4日周五
  1. GitHub Blog · AI & ML48

    GitHub Copilot 应用入门:如何同时运行多个智能体

    GitHub Copilot 应用支持同时运行多个智能体会话,每个会话在独立的 Git worktree 上并行执行、互不干扰,并各自保留上下文,可随时切换且无需重新说明任务。在示例仓库 tailspin-toys 中,可同时让 Copilot 分别开发 funded sort 功能、执行无障碍审查和运行测试,并在会话视图中跟踪进度、查看结果。

9月1日周二
8月21日周五
  1. Microsoft Research40

    微软 Skala 1.1 发布:训练数据增 2.5 倍,并集成进 CP2K 等主流 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量较首版增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP。微软同时推出持续追踪各版本计算性能的 living benchmark。

8月13日周四
  1. Microsoft Research38

    MindTopo:微软推出评估多模态模型拓扑空间推理能力的新基准

    微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨序列仍不可靠。

8月12日周三
8月4日周二
  1. Microsoft Research71

    Microsoft Research 开源 Orchard 智能体框架,含 SWE、GUI 与个人助理三套训练配方

    Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。

    推荐理由:Orchard 把环境层做成可复用服务,并给出三个领域的训练配方与数据,读者可据此判断小模型在真实任务上的可行边界。