🤖 模型发布/更新
1. Meta 发布 Muse Spark 1.3,得分逼近 Claude 与 GPT-5.6
Meta 在五个月内第四次更新 Muse Spark 系列。其中 max 变体(合作伙伴限时预览)在 Artificial Analysis Intelligence Index 拿到 62 分,xhigh 版本也有 61 分,已逼近 Claude 与 GPT-5.6 的水平;智能体与科学推理能力同步提升。
2. Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
Google DeepMind 推出两款新模型:Gemini 3.8 Flash 与面向网络安全场景的 3.8 Flash Cyber,进一步扩充 Flash 轻量级产品线。
3. 通义千问 Qwen3.8-Max-0902 登顶 Code Arena
通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1691 分首次亮相即拿下总榜第一;以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已在 QwenCloud 开放试用。
🚀 产品发布/更新
4. Claude 在 Cowork 和 Claude Code 中支持后台操作电脑
Anthropic 官方宣布,Claude Cowork 与 Claude Code 新增后台使用电脑的能力:把任务交给 Claude 后,它会像人一样自行点击、输入、打开应用,用户可以在等待的同时处理其他事情。
5. Cursor 推出 Self-Hosted Machines,智能体可在企业自有机器上执行
Cursor 发布 Self-Hosted Machines:云智能体的工具执行环节迁移到企业自有网络内的机器上运行,而推理与规划仍留在 Cursor 云端,通过 worker 出站 HTTPS 连接对接,Cursor 不会主动连入企业内网。
6. 美团 LongCat-2.0 上线 Cline 免费试用
美团编程模型 LongCat 推出 2.0 版本,并在 Cline 中开放免费试用入口,方便开发者直接体验。
7. UU远程新版本上线:完整 TUI 渲染与多终端会话管理
UU远程于 9 月 2 日发布新版,重点补齐终端能力:支持完整的 TUI 渲染与多终端会话管理,Mac 免密码登录、移动端系统输入法独立输入框,并可通过 uuyc-cli lterm 在手机与电脑间跨端同步接管会话,强化远程 Vibe Coding 体验。
🌐 行业动态
8. OpenAI 因 Tumbler Ridge 枪击案面临 30 起新诉讼
OpenAI 及 CEO Sam Altman 遭遇 30 起新诉讼:事发时在校的学生、教师和校长在加州联邦法院起诉,指控 OpenAI 为加拿大 Tumbler Ridge 校园枪击案嫌疑人提供了实质性协助与鼓励(协助教唆)。
9. 传 Nvidia 接近以约 129 亿美元收购 Hugging Face
据 Bloomberg,Nvidia 正接近以约 129 亿美元收购 Hugging Face,交易总额可能达约 140 亿美元,另谈及 10 亿美元员工留任方案;价格约为其 2023 年融资估值的 2.9 倍。目前双方尚未达成最终协议,细节仍可能有变动。
💡 技巧与观点
10. GitHub Copilot 如何在不牺牲质量的前提下降低 AI 编码成本
GitHub 工程师 Erik Kristensen 拆解 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%)、压缩 task-tool 提示词(每轮省约 1300 token)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
11. 美国司法部就 OpenAI 版权诉讼提交意见书:训练属于合理使用
美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,主张用受版权文本训练 LLM 一般应属合理使用,称训练具有非凡转换性,并以国家安全为由警告:全面许可要求会削弱美国 AI 开发者竞争力。意见书属建议性质、不约束法院。
12. Anthropic 发布电商 Agent 架构指南,并开源 commerce-agents
Anthropic 基于零售、旅游、电信等团队的落地经验发布电商 Agent 构建指南:核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体;同时开源 anthropics/commerce-agents 参考实现(含购物与商家 Agent)。
13. Google 分享如何为 LLM-as-a-Judge 编写可靠的评分标准
Google AI 团队给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 的 MUST 等术语)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准直至与人类评分一致,避免模糊提示导致的评估不一致。
14. Google 复盘 AI Agents Challenge:最强提交背后的 4 个工程模式
Google 从各赛道头部提交中提炼出四个工程模式:双向 MCP、事件驱动并发、同标准回退和分层路由,供 Agent 开发者参考。
15. 什么是 harness 工程?Google 演示自动修复编码循环
Google 员工 Shir Meir Lador 介绍 harness 工程——用确定性组件(编排层、执行沙箱、状态持久化、验证工具)包裹 LLM,让 Agent 无需逐行人工审查即可安全生成代码,并用 ADK 2.0 与 Antigravity SDK 现场演示了自动修复编码循环。
来源:AI HOT(aihot.virxact.com)