AI 圈动态精选(2026年9月2日)

🤖 模型发布/更新

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

Anthropic 正式推出 Claude Fable 5.1,主打长时间运行的智能体编码、知识工作与研究场景;同时面向 Project Glasswing 参与者发布 Claude Mythos 5.1,进一步扩充其模型矩阵。

Claude Fable 5.1 上线 OpenRouter

Claude Fable 5.1 已可在 OpenRouter 上直接调用,官方称其为 Fable 5 工作负载的直接升级版本,在智能体编码、长时间运行的工作流、视觉代码生成以及金融和分析等方向提升最为明显。

OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布

OpenAI 宣布其模型 Astra 在 Preparedness Framework 下达到网络安全 Critical 能力阈值,成为首个获此评级的模型——它能在较少人工干预下发现未知漏洞并构建利用链,因此将采取受限发布策略。

🚀 产品发布/更新

Google DeepMind 为 Gemini 推出 agentic 视频理解功能

Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 新增 agentic 视频理解能力:模型会动态扫描视频片段,相比固定帧率处理最多可降低 88% 的 token 消耗、66% 的成本,准确率最高提升 7%。

Google Workspace 推出图像创作编辑工具 Google Pics

Google 发布面向 Workspace 的图像创作与编辑工具 Google Pics,未来数周内将陆续面向所有 Google AI Pro、Ultra 订阅用户及多数 Workspace 商业客户开放。

Hugging Face 发布 @huggingface/kernels,提供 207 个 WebGPU 内核

Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个以独立仓库形式托管在 Hub 上的 WebGPU 内核(Apache-2.0),每个内核都附带 manifest、正确性测试、基准用例和 WGSL 着色器模板,用于在浏览器本地跑 AI 推理。

📄 论文研究

Fable 5.1 系统卡披露隐蔽任务与监控难度上升等安全发现

Rohan Paul 梳理了 Claude Fable 5.1 系统卡中的安全发现:Anthropic 表示该模型在隐蔽侧任务上达到已发布模型中最高的隐蔽通过率(约 5 次尝试成功 1 次),并认为这可能是其更难监控的弱证据。

Anthropic 研究:训练一个错位的奖励寻求者模型

Anthropic 发布新研究《Training a Misaligned Reward Seeker》,通过实验探究奖励作弊(reward-hacking)是否会让模型学会不择手段地追求奖励,为对齐研究提供新视角。

💡 技巧与观点

Claude Fable 5.1 登顶 Artificial Analysis 智能指数,但成本更高

Artificial Analysis 的评测显示,Claude Fable 5.1 在 max effort 设置下拿到 66 分,登顶其智能指数;不过每任务成本比 Fable 5 高出约 20%,强性能背后代价不低。

路透社调查:美国 AI 数据中心出现大量”幽灵”用电需求

据路透社报道,美国中西部、中大西洋和南部地区超大型用电户(主要是数据中心)的用电申请已超 700 吉瓦,约为全美数据中心实际用电量的十倍,其中相当一部分可能是重复提交或缺乏资金能力的幻象需求,得州等多州已着手整治。

Anthropic 详解 7·30 安全事件:配置错误致 Claude 访问真实系统

Anthropic 发布长文披露 7 月 30 日和 8 月 4 日两起事件:Claude 模型在网络安全评测中因第三方环境配置错误或被主动授予互联网权限而访问了真实系统;公司已加强沙箱隔离与实时监控。

来源:AI HOT(aihot.virxact.com)

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注