OpenAI 提出前沿 AI 训练安全案例的早期指南
OpenAI 发布前沿 AI 训练安全案例的早期指南,覆盖技术防护措施、运营实践以及失准事件调查三方面。该指南针对前沿 AI 训练环节,旨在为安全案例的构建提供初步框架。
OpenAI 发布前沿 AI 训练安全案例的早期指南,覆盖技术防护措施、运营实践以及失准事件调查三方面。该指南针对前沿 AI 训练环节,旨在为安全案例的构建提供初步框架。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并公布更严格的防护措施与支持,以加强澳大利亚的网络防御能力。
OpenAI 宣布将其 Daybreak 计划的访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,讨论 AI 安全、人类控制与国际合作。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
OpenAI 阐述了针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则,强调评估需严谨、安全且独立。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体触及范围之外执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,为新兴 AI 成果的评审与传播提供指导。该小组为独立性质,具体成员、成果范围及运作方式未在文中披露。
OpenAI 提出构建全球共享 AI 标准的路径,呼吁通过协调一致的评估、报告与治理来提升安全性。该主张面向 AI 发展的下一阶段,强调以协同机制推动安全水平提升。
OpenAI 发布澳大利亚青少年安全蓝图,这是一份包含六大支柱的路线图,旨在打造更安全的 AI 体验,保护并赋能青少年。
OpenAI 发布一套用于追踪、调查和披露模型失准(misalignment)的框架,同时公开六份关于模型意外或令人担忧行为的报告。
推荐理由:OpenAI 公开模型失准的追踪与披露框架,并附六份异常行为报告,可了解其安全披露机制。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他带来了 AI 对齐、安全与标准方面的经验。
OpenAI 的 Chris Lehane 主张,AI 能力越强,就越需要更强的安全证据、共享标准与持久的政策行动,并呼吁在政策窗口仍然敞开时采取行动。
OpenAI 开放申请一项总额 500 万美元的资助计划,用于支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。
OpenAI 的 Jakub Pachocki 反思日益强大的 AI 与对齐难题,称其如同"异类心智",呼吁加强安全防护并推动国际协调。
OpenAI 推出 Daybreak for Frontline Defenders,承诺投入 10 亿美元,为关键服务扩大前沿网络 AI 的使用权限,并提供培训与支持。
Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴限量开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型访问权限。
推荐理由:Google 把 Gemini 3.8 Flash Cyber 与 CodeMender 组合成受限访问计划,读者可了解其能力边界与准入条件。
Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,称 3.8 是其目前最强的推理与编码模型,速度与成本与 3.7 Flash 持平。
推荐理由:官方给出两个变体的定价、基准与开放入口,可据此判断长程编码与安全场景的选型取舍。