过去 24 小时,AI 圈依旧热闹:Google 把近实时语音模型推进到 Gemini 3.8 Live 系列,国内厂商在视频与语音方向密集发新;工程侧,Perplexity 用自研数据库替代 AWS 省下大钱,OpenAI 内部「用 Codex 造 Codex」的工厂式开发也被实地探访曝光。以下是今日精选。
🤖 模型发布 / 更新
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking
Google DeepMind 推出两款近实时语音对话模型,主打语音智能体与复杂任务执行。基础版面向低延迟的实时对话场景,Extended Thinking 版本则针对需要多步推理与更长时间思考的复杂任务,进一步把「能听会说」的模型推向可实际干活的智能体形态。
来源:Google DeepMind Blog
生数科技发布 Vidu S2:Avatar 与 Editing 双模型,探索空间视频
生数科技正式发布 Vidu S2,包含两个方向:Vidu S2-Avatar 面向数字角色的实时交互,Vidu S2-Editing 面向视频流的实时编辑。此外还探索了面向 VR 头显的实时空间视频生成与编辑,把视频模型从「生成一段片子」推进到「实时参与交互」。
来源:生数科技(Vidu)公众号
阶跃星辰发布 StepAudio 3 系列语音大模型,多款榜单登顶
阶跃星辰发布 StepAudio 3 系列,一次性覆盖 Realtime、ASR、TTS、Gen 和 Music 五款模型,已在阶跃星辰开放平台上线。据官方信息,多款模型在 Artificial Analysis 相关榜单上取得全球第一,属于全链路语音能力的集中补齐。
来源:阶跃星辰(Step)公众号
🚀 产品发布 / 更新
Claude for Small Business 扩充 43 个工作流、27 个集成
Anthropic 为 Claude for Small Business 新增 43 个工作流与 27 个集成,覆盖 Shopify、Salesforce、Stripe、Gusto 等中小企业常用工具;该产品自 5 月上线以来安装量已超过 90 万次。工作流默认运行在审批模式下,所有发送、发布或付款动作都需要用户确认,今秋还将在 10 个美国城市举办免费工作坊,14 家集成伙伴从 9 月底到 11 月各办一场免费网络研讨会。
来源:Anthropic / Claude Blog
Google 发布 TranslateGemma,语言技术覆盖 300 多种语言
Google 宣布其语言技术已支持超过 300 种语言、覆盖全球约 86% 人口,并发布 TranslateGemma —— 一个基于 Gemini 训练、支持 55 种语言、可离线运行的轻量开源翻译模型。对做多语言产品的开发者来说,本地可跑的开源选项又多了一个。
来源:Google Blog(AI)
🌐 行业动态
Perplexity 自研 CobbleDB 替代 AWS DynamoDB,每年最多省一亿美元
Perplexity CEO Aravind Srinivas 宣布自研键值数据库 CobbleDB,用于替代 AWS DynamoDB 承载快速网页内容抓取,迁移后每年最多可节省一亿美元。值得注意的是实现方式:两名工程师加上数百个持续运行的 Computer 智能体,两个月完成核心基础设施。官方数据显示热存储批次读取延迟较 DynamoDB 全分布下降约 5 倍,P50 从 31.4ms 降到 5.60ms。这既是成本工程的胜利,也是「AI 写基础设施」的一次公开样本。
来源:Aravind Srinivas(Perplexity CEO)
💡 技巧与观点
Arena 更新 Image-to-WebDev 榜单:GPT-6 Astra 以 1733 分登顶
Arena 更新 Image-to-WebDev 排行榜,纳入四个新评测模型。GPT-6 Astra(Max)以 1733 分排名第一,领先 GPT-5.6 Sol(xHigh)129 分;Claude Fable 5.1(Max)以 1710 分居第二,Muse Spark 1.3(Max)1645 分第四,GLM-5.3-Flash 1588 分第十。从截图直接生成网页这件事,头部模型的差距已拉开到百分级。
来源:Arena
Gergely Orosz 探访 OpenAI:Codex 驱动的智能体软件工厂
Gergely Orosz 实地探访 OpenAI 总部并访谈七位工程师与工程负责人,发现自大约今年一月起,Codex 与 ChatGPT Work 已经成为公司几乎所有工作的基础。也就是说,OpenAI 现在的开发方式本身就是一个「智能体软件工厂」,这篇访谈值得完整读完。
来源:Pragmatic Engineer
404 Media 曝光 OpenAI「莉莉计划」:人工审核聊天记录优化模型
404 Media 披露了 OpenAI 内部代号「莉莉计划」(Project Lily)的项目:由时薪超过 50 美元的提示词审核员查看匿名化后的真实用户聊天记录,评判回复是否切题、是否存在 AI 式话术和谄媚口吻。这条动态再次把「人类反馈」的数据来源与隐私边界摆上台面。
来源:IT之家
Trail of Bits 批评 1Password 的 AI 补丁基准存在误导
安全公司 Trail of Bits 发文批评 1Password 于 8 月 6 日发布的 FLAWED 报告,认为其宣称的 26% AI「干净修复率」受四项实验设计选择影响而失真:刻意指示智能体应用错误修复的提示词占了 22% 数据、36% 的试验禁止编译测试,以及不同推理档位设置不一致等。同时 Trail of Bits 还公开了两个补丁验证 Agent 技能。做 AI 安全评测的同学可以对照看方法论。
来源:Trail of Bits
Anthropic 与 OpenAI 提议协调放缓前沿 AI 开发,遭质疑真实动机
Anthropic CEO Dario Amodei 呼吁行业与政府协调放缓前沿 AI 开发,并寻求反垄断豁免,Sam Altman 与 Elon Musk 均表示同意。Cohere CEO 等批评者则质疑其真实动机。当「慢下来」的倡议来自领跑者,监管与竞争的边界就又变得微妙起来。
来源:The Decoder
Artificial Analysis 评测:GPT-Live-1 以 81.5 分登顶 Speech to Speech Index
Artificial Analysis 发布 Speech to Speech Index,OpenAI 的 GPT-Live-1 以 81.5 分(Astra 后端、medium 推理强度)排名第一,超过 Grok Voice Think Fast 2.0 High 的 81.3 分;Sol 后端配置得 80.1 分位列第三。实时语音这条赛道,头部玩家分数已经挤在一起。
来源:Artificial Analysis
来源:AI HOT(aihot.virxact.com)