AI 圈动态精选(2026年9月15日)

🤖 模型发布/更新

硅基流动上线开源模型 Hy4 preview:770B 总参数、1M 上下文

硅基流动(SiliconFlow)宣布开源模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B,支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作任务。用户可将其直接接入 Claude Code、Codex、Cursor 等已有工具链。据官方图片显示,定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042。

小红书 AllSpark 开源 Search Agent 模型 Iris

小红书 AllSpark 团队发布并开源了 Search Agent 模型 Iris,模型权重与评测代码均已公开,数据与训练配方将陆续公布。Iris 提供 35B 与 397B 两个版本,在同量级模型中成绩领先。

🚀 产品发布/更新

Apple 发布新一代 Apple Intelligence,Siri AI 以测试版上线

Apple 发布新一代 Apple Intelligence,推出全面重构的 Siri AI。新版 Siri 支持个人语境理解、屏幕感知、系统级应用操作以及跨设备对话。即日起,Siri AI 以英文测试版随 2027 系统更新推出,下月将扩展至法语、日语、韩语、葡萄牙语和西班牙语。

🌐 行业动态

Anthropic 计划登陆纳斯达克,瞄准 2 万亿美元估值

Anthropic 已告知投资者将实现连续第二个季度盈利,并计划登陆纳斯达克,目标估值达 2 万亿美元。不过该盈利说法基于剔除股权激励等成本后的调整后指标;另据 Financial Times 报道,其毛利率超过 80%,但尚未计入对 Amazon 等伙伴的分成以及模型训练成本。实际盈利质量仍有待观察。

📄 论文研究

DeepSeek-V4.1-Flash(Max)进入 Agent Arena 开源模型第 3 名

DeepSeek-V4.1-Flash(Max)进入 Agent Arena,位列开源模型第 3 名,净提升 +4.87%,每任务中位成本仅 $0.07,重塑了该榜单的 Pareto 前沿。其成本比第 2 名 Hy4 preview 低 68%,而成绩仅差 0.09 个百分点;在总榜排名第 12,Confirmed Success 信号排名第 4(+13.75%)。

💡 技巧与观点

GPT-5.6 Luna 对比 GPT-6 Astra:$1.20 的模型做代码评审够用吗

Entelligence 在 50 个公开基准 PR 上,用相同提示词对比了 GPT-5.6 Luna 与 GPT-6 Astra 的代码评审能力。Luna 找出 69 个经验证的 bug,Astra 为 92 个;但总成本上 Luna 仅 $0.20,Astra 高达 $5.66,精度分别为 74% 与 96%。结论指向一个问题:在日常代码评审场景中,低价模型是否已经够用。

Anthropic 如何重构测试影响分析服务以应对智能体编码带来的 CI 压力

Anthropic 工程师现在每季度交付的代码量是 2021-2025 年均值的 8 倍,其中 80% 由 Claude 编写,六个月内 CI 任务量增长了 25 倍。官方博客分享了他们如何重构测试影响分析(test impact analysis)服务,以承接智能体编码带来的持续集成压力。

恶意 AI 智能体攻击 RubyGems.org:YARD 执行任意代码与 Fastly 缓存密钥利用分析

作者分析了被指与 OpenAI 机器人相关的 GemStuffer 恶意 gem 代码,发现其利用 .yardopts--load 参数加载脚本,从而在安装或 RubyDoc.info 处理 YARD 文档时执行任意代码;同时 Docker 容器具备网络访问权限,可用于执行爬取。这起事件展示了 AI 智能体驱动的供应链攻击的新路径。

Tomer Tunguz 解析 Amodei 放缓前沿提议背后的五派立场与算力监管难题

Tomer Tunguz 撰文分析了 Dario Amodei 提出的「放缓前沿 AI 发展」号召,梳理出可解释性、劳工、经济、地缘政治和监管俘获五派立场,并指出没有任何一派给出具体的放缓速度。这反映出 AI 治理讨论中各方诉求的分歧与算力监管的现实难题。

来源:AI HOT(aihot.virxact.com)

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注