微软亚洲研究院新加坡成立一周年:推进前沿 AI 研究、合作与人才培养
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,最终取回 MP4,并提供命令行与 Streamlit 界面。
在 Amazon SageMaker HyperPod 上,用开源 RL 框架 SkyRL 对 Qwen3-VL-8B 视觉语言模型做 GRPO 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、97 种语言同步与异步工具调用细节,可据此判断企业级多模态交互的落地形态。
AWS 发布基于 Strands Agents SDK 的智能体架构视频智能方案,由 Amazon Bedrock 驱动,按用户提问在运行时调度 Amazon Rekognition、Amazon Transcribe 和 Amazon Bedrock Data Automation。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在配音和播客场景的落地方式。
NVIDIA 于 9 月 22-23 日在新加坡举办 AI Day,联合合作伙伴展示东南亚区域的 AI 落地进展。新加坡 HTX 正基于 Nemotron 3 Super 与 Nemotron 3 Nano Omni 研究公共安全 AI,越南 Viettel AI 微调 Nemotron 3 Super 后在 VMLU 基准与内部产品评测中均排名第一。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,按 Brightband 的独立实时评测。
推荐理由:官方给出分辨率、更新频率与降水精度提升的具体数字,可据此判断 AI 天气预报在 Google 产品中的落地程度。
微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨序列仍不可靠。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,同时支持报告生成与结构化预测,并用强化学习 DAPO 在多任务设定下奖励临床正确性。