AI 科技日报 · 2026-09-24
今日速览
- OpenAI 与 Anthropic 同日发新模型,GPT-6 Sol/Luna 与 Claude Opus 5.5 撞车,API 价格双双下调。
- 小米开源 MiMo-V2.6 全模态系列,登顶全球开源模型智能指数第一。
- 千问发布 Qwen-Audio-3.1 五款语音模型,ASR 价格最高降 95%。
- 谷歌上线 Gemini 3.8 TTS,30 秒音频即可克隆声线。
- 爱诗科技上线 PixVerse R2,实时世界模型首次给出 Scaling 路径。
- 息壤开物完成数亿元融资,估值 5 亿美元押注物理基础模型。
- DeepSeek 发布 Dsec 论文,梁文锋署名,披露大规模 Agent 训练沙箱。
- 阿里云 Qwen Book 智能体电脑亮相,云栖大会首次对外展示。
要闻详情
1. OpenAI 与 Anthropic 同日发新模型,API 价格双双下调
当地时间 9 月 22 日,OpenAI 与 Anthropic 相隔约一个半小时先后发新:OpenAI 推出 GPT-6 系列中端模型 GPT-6 Sol 与轻量模型 GPT-6 Luna,沿用 GPT-6 Astra 的训练方法与计算机使用能力,API 价格较 GPT-5.6 永久下调 50%——Sol 输入从每百万 token 4 美元降至 2 美元、输出从 20 美元降至 10 美元;Luna 输入降至 0.10 美元、输出 0.50 美元,比 DeepSeek-V4.1-Flash 空闲时段还低。Anthropic 则发布 Claude 5.5 系列首款模型 Opus 5.5,典型任务成本比 Opus 5 低 40%、输出速度提升超 30%,输入输出定价 4/20 美元较上代降 20%,缓存读取降 60%,在第三方 Artificial Analysis 智能指数上以 58 分登顶。
一句话点评:一家靠降价守市场,一家靠效率抢高端,前沿模型的竞争重心已经从"谁更聪明"转向"谁的单任务成本更低"。
原文链接:
- 腾讯新闻·智东西《OpenAI连发两款GPT-6新模型!API价格腰斩》
- 今日头条·36氪《Anthropic深夜放大招:Claude Opus 5.5上线,任务成本大降40%》
- IT之家《Anthropic 发布 Claude Opus 5.5 模型:性能媲美 Fable 5.1,运行成本比 Opus 5 低 40%》
2. 小米开源 MiMo-V2.6 全模态系列,登顶全球开源榜首
9 月 22 日,小米发布并开源 MiMo-V2.6 系列,含全模态旗舰 Pro 与高效推理 Flash,另上线 Pro-UltraSpeed 超高速模式。全系原生支持文本、图像、视频、音频输入,配备 1M 上下文;Pro 采用 1.02 万亿总参数/420 亿激活参数的稀疏 MoE 架构。在 Artificial Analysis 综合智能指数上,MiMo-V2.6-Pro 以 46 分位列全球开源模型第一、国产模型第一,超过 Kimi K3 与 Qwen3.8 Max,实测单任务成本 0.13 美元首次进入 0.1 美元区间。值得关注的是小米罕见公开了 RL 训练账单:6 天强化学习后训练,Flash 约 85 万美元、Pro 约 262 万美元,合计超 347 万美元、约 75 万条轨迹,并同步开源 RL 技术成果、7000 余个任务环境与端到端训练框架。
一句话点评:把训练成本和工程细节一并摊开,比"刷榜第一"更有分量——开源竞争进入了算账时代。
原文链接:
- 腾讯新闻·21世纪经济报道《小米大模型6天"烧掉"347万美元》
3. 千问发布 Qwen-Audio-3.1 五款语音模型,ASR 价格最高降 95%
9 月 23 日 2026 云栖大会上,阿里发布 Qwen-Audio-3.1 系列语音大模型,一次性推出五款:覆盖语音识别(ASR)、语音合成(TTS)、实时语音交互(Realtime)三大核心模型的升级版,并全新推出音频创作模型 TTS-Next 与音频理解模型 ASR-Next,形成"理解—生成—交互—创作"完整音频能力栈。ASR 支持 30 种语言与 16 种中文方言,首字响应约 160 毫秒,新增原生转写润色与分角色转写;TTS-Next 可一次生成人声、音效与环境声;Realtime 支持全双工对话、随时插话打断并能主动调用 Agent 工具。价格方面全线下调,TTS 降约 70%、Realtime 降约 85%、ASR 降幅达 95%,API 已上架千问 AI 平台,同步开源 Qwen-Audio-Agent 框架。
一句话点评:语音模型从"能听懂"走向"能创作",而 95% 的降幅意味着语音入口的价格战已经提前开打。
原文链接:
- 中国证券网《从生成迈向创作 阿里发布语音模型系列Qwen-Audio-3.1》
- 证券时报《千问发布Qwen-Audio-3.1系列语音大模型 Qwen-Audio全线语音模型价格均下调》
4. 谷歌上线 Gemini 3.8 TTS,30 秒音频即可克隆声线
9 月 23 日,谷歌发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,官方称其为迄今表现力最强的音频生成模型,当日即通过 Gemini API 与 Google AI Studio 上线。Flash TTS 面向游戏、有声书、播客与互动媒体的角色设计;Flash-Lite TTS 主攻批量配音与语音代理等高性价比场景。核心变化是从固定预置音色转向生成式造声:用户可用自然语言在 100 多种语言与方言中定义角色、口音与音色特征,音色库由 30 种扩至 2000 多种;仅需 30 秒音频样本即可复刻声线,但必须通过声音所有者的口头授权核验,输出全部嵌入 SynthID 水印并附 C2PA 凭据。Flash TTS 在 Hume AI 语音设计基准以 71.4 分位列第一。
一句话点评:造声能力越强、授权闸门越紧,语音克隆正在从"技术炫技"转向"合规工程"。
原文链接:
- 今日头条·科技快报网《谷歌Gemini 3.8语音模型发布:30秒克隆声线,支持百种语言》
5. 爱诗科技上线 PixVerse R2,实时世界模型给出 Scaling 路径
爱诗科技发布通用实时世界模型 PixVerse R2,官方称首次为实时世界模型建立 Scaling 路径。R2 的架构把"能力"与"效率"解耦为两大引擎:全模态因果自回归(Omni Causal AR)负责跨数据、输入类型与任务持续增长能力,实时加速层则把同一模型压缩到可实时运行,从而不再需要在"更快"与"更强"之间二选一。内部评测显示,Error Bank 机制使长会话中的画面漂移下降约 35.8%。用户可通过 WASD 键配合 Prompt 实时探索与改变世界,其自研游戏引擎已切换至 R2 运行,《零印法师》等互动影游体验同步开放。官方坦言,单次生成质量与前沿离线视频模型相比仍有差距。
一句话点评:把世界模型做成"可以走进去的环境"而不只是"生成一段视频",这才是世界模型真正的分水岭。
原文链接:
- 搜狐·腾讯研究院AI速递 20260924
6. 息壤开物连续完成数亿元融资,押注物理基础模型
物理基础模型公司息壤开物(XIRRA)宣布连续完成种子轮及天使轮融资,累计金额达数亿元,由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、上海天使会、标朴投资等跟投,公司目前估值 5 亿美元,资金将用于原生物理 AI 模型规模预训练、真实物理交互数据建设与场景验证。公司今年 7 月成立,由前华为云大模型 CTO、华为大模型 0 到 1 核心成员李寅创办,现任华为多模态首席科学家、南洋理工大学校长讲席教授张含望将出任联合创始人兼首席科学家。其自研物理基础模型 LPM 在 WorldArena 2.0 全球总决赛中获轨迹精度全球第一、物理合规性全球前三,路线图是先跑通机器人场景闭环,再复制到自动驾驶仿真、极端天气预测、药物分子生成等领域。
一句话点评:数字世界的智能开始过剩,稀缺的是"理解物理规律"的模型——这也是具身智能真正的底座之争。
原文链接:
- 中国证券网《物理基础模型公司息壤开物成立两月获数亿元融资》
- 界面新闻《AI早报|马斯克预测20年后可能有1000亿台人形机器人;Anthropic发布Claude Opus 5.5》
7. DeepSeek 发布 Dsec 论文,披露大规模 Agent 训练沙箱
9 月 23 日,DeepSeek 发布系统论文《DeepSeek Elastic Compute:大规模 Agent 训练的沙箱基础设施》,梁文锋署名,介绍了其用于 Agent 强化学习训练与评测的生产级沙箱平台 Dsec。论文披露了一个 Dsec 生产单元的规模:约 160 台 CPU 节点、3 万颗 CPU Core、250TB DRAM,单日服务约 300 万个 Sandbox,峰值同时在线超过 38 万个,创建速度超过 5000 个/秒。从 DeepSeek V3.2 到 V4.1,其强化学习训练和评测的 Sandbox workload 均运行在 Dsec 之上;实验显示按需加载镜像可将 8192 个 Container 的启动时间控制在约 35 分钟,较完整远程拉取方案缩短约 42%,磁盘写入量下降约 57%。
一句话点评:当模型开始"动手"而不只是"说话",训练基础设施本身就成了护城河——这篇论文的价值不亚于一次模型发布。
原文链接:
- 今日头条·每日经济新闻《梁文锋署名!DeepSeek发新论文,剑指大规模Agent训练|全球科技早参》
8. 阿里云 Qwen Book 智能体电脑亮相云栖大会
9 月 23 日 2026 杭州云栖大会上,阿里云旗下 AI 智能体电脑 Qwen Book 首次亮相,可自主理解用户意图并持续进化,瞄准 AI 在办公与生活场景中跨应用、跨智能体使用的痛点,完整产品预计今年底或明年初发布。Qwen Book 已开放系统接口与能力接入,与高通、英特尔、罗技、绿联等企业产品完成适配,并打通支付宝、千问输入法等阿里系应用,构建面向办公场景的服务矩阵;阿里云同时宣布 Qwen Book 将与开源项目 Omarchy 合作,探索面向智能体的新一代桌面操作系统。阿里云研发副总裁张献涛表示,随着个人上下文不断积累,智能体正从弱关联走向积累跃迁,期待 Qwen Book 从硬件工具演变为 Token 驱动、持续成长的智能体载体。
一句话点评:从"装一个 AI 应用的电脑"到"为智能体设计的电脑",端侧形态的重新定义可能是下一轮换机的理由。
原文链接:
- 今日头条·第一财经《昨夜今晨发生了什么?》
- 杭州日报《2026云栖大会阿里云透露这些AI布局》
一句话总结
9 月 23 日这一天,AI 行业几乎同时打响了三条战线——中美头部厂商把 API 价格压向"腰斩"、国产开源模型把训练账本摊到台面上、语音与世界模型把 AI 从"生成内容"推向"进入环境",而算力与物理世界的底座之争才刚刚开始。
本栏目由 AI 每天上午 10:00 自动生成,信息来自公开网络报道,观点仅供参考。