侧重 AI Coding 与 具身智能 方向,精选 8 条今日值得关注的重要动态。
1. OpenAI 发布 GPT-6 Sol 与 Luna,API 成本直降 50%
事件内容:
9月23日,OpenAI 推出 GPT-6 架构下的两款更小、更省模型 Sol 与 Luna。Sol 面向复杂技术解题与软件开发工作流,Luna 面向高吞吐事务性任务;官方称相较上一代 GPT-5.6,API 成本降低 50%,复杂任务错误率减半,Sol 在内部事实性评测中已达到旗舰 Astra 级别的可靠性,把本月发布的 GPT-6 Astra 核心能力推向企业生产环境。
为何值得关注:
把前沿推理价格直接砍半、同时降低错误率,会显著拉低在企业代码库上跑多步自主 Agent 的财务门槛。对 Vibe Coding 与 Agent 工作流,这意味着高频“测试—修复”循环和长链路代码修改可以更便宜地规模化,中小团队也能用上接近旗舰的编程能力,模型竞争重心从“谁更聪明”加速转向“谁更便宜、跑得更勤”。
2. 月之暗面上线 Kimi K2.6-code-preview 万亿参数编程模型
事件内容:
9月23日,月之暗面正式上线 Kimi K2.6-code-preview 万亿参数编程大模型。该版本在 K2.5 基础上重点优化推理深度、代理规划质量与多步工具调用可靠性,第三方评测显示其编程能力得分较上代提升 6 分,进入行业第一梯队,并搭配 39 元/月起的开发者会员套餐。
为何值得关注:
国产编程大模型开始以“万亿参数 + 高性价比订阅”正面参与 AI Coding 竞争。对国内开发者,这意味着在不依赖海外 API 的前提下也能获得强代理规划与工具调用能力,有望带动本土 Vibe Coding 生态与中文代码场景的落地,也加剧了头部编程模型在价格与中文能力上的贴身竞争。
3. DeepSeek 梁文锋署名论文:大规模 Agent 训练沙箱 Dsec
事件内容:
9月23日,DeepSeek 发布系统论文《DeepSeek Elastic Compute: 大规模 Agent 训练的沙箱基础设施》,介绍生产级沙箱平台 Dsec。一个生产单元约含 160 台 CPU 节点、3 万颗 CPU Core 与 250TB DRAM,单日服务约 300 万个 Sandbox,峰值同时在线超 38 万个,创建速度超 5000 个/秒;从 V3.2 到 V4.1 的强化学习训练与评测均运行其上,按需加载镜像将 8192 个容器启动时间压至约 35 分钟。
为何值得关注:
当 Agent 从“生成文本”转向“调用工具、运行代码、多轮执行”,训练与评测所需的计算、存储和安全隔离已成为模型规模化的关键瓶颈。Dsec 把海量沙箱做成可弹性调度的基础设施,说明头部实验室正把 Agent 训练当作工程系统问题攻克,将直接影响未来 Agent 强化学习的范式与成本曲线。
4. Meta 发布自主消费级 Agent Muse,订阅最高 100 美元/月
事件内容:
9月24日,Meta 正式推出自主消费级 AI Agent Muse,由 Muse Spark 驱动,覆盖网页、移动与聊天端,面向美国用户,订阅最高 100 美元/月。与对话式聊天机器人不同,Muse 可自主执行现实任务:预订旅行、协商水电账单、填写表单、发送日程邀请,并通过 Stripe Link 完成自动交易,未来计划接入 Shopify Shop Pay 与 1Password。
为何值得关注:
Muse 标志着 AI 从“被动对话”走向“主动数字代理”,直接接触个人邮箱、日历与支付凭证,是消费级 Agent 货币化的标志性尝试。它测试的是用户对“自动执行金融交易”的接受度,也为 Agent 的授权、安全与责任边界提供了现实样本,预示着 Agent 竞争正从开发者工具向大众日常服务延伸。
5. Amazon 向 Claude 开放 Seller Central API,推 Bedrock 卖家插件
事件内容:
9月23日,在 Amazon Accelerate 大会上,亚马逊向外部 AI 智能体开放 Seller Central API,并推出美国区测试版插件,让卖家无需打开卖家中心即可通过 Anthropic 的 Claude 或亚马逊自家的 Quick 助手管理库存、价格、商品列表与分析。Seller Assistant 运行于 Amazon Bedrock(结合 Amazon Nova 与 Claude),并为每个主账户赠送截至 2026 年底的 12 个月免费 Quick Plus 订阅。
为何值得关注:
约 90% 的卖家已用外部 AI 打理部分运营,亚马逊此举把“Agent 直接操盘电商后台”从灰色脚本变成官方能力。对 Agent 生态,这是头部平台首次把核心商业 API 开放给第三方大模型,验证了“Agent-as-Operator”在真实高价值业务中的可行性,也拉开了电商平台 Agent 化改造的序幕。
6. Figure 发布 Helix 2.5,陌生家庭自主做家务成功率 56%
事件内容:
9月17日,海外人形机器人公司 Figure 发布神经网络模型 Helix 2.5。演示显示,搭载该模型的 Figure 03 可在 30 个此前未见过的真实家庭中自主作业,完成整理床铺、折叠毛巾、收拾玩具等任务,420 次完整任务 trial 中成功 237 次(成功率 56%),而未经预训练的基线仅约 8%。Figure 称 Helix 2.5 用更少专用数据实现更强泛化。
为何值得关注:
56% 的跨陌生家庭成功率,是具身模型从“固定场景演示”迈向“真实泛化”的重要证据。它说明世界模型加大规模第一视角人类视频数据,能让机器人在未训练过的新环境迁移技能,是家庭场景落地的关键一步,也抬高了具身智能的估值叙事——核心竞争力正从硬件本体转向具身大脑与数据飞轮。
7. 松延动力连发 HERON-WorldModel 与 HERON-CRA 双模型
事件内容:
9月8日与 9月15日,以万元级机器人“小布米”闻名的松延动力接连发布自研具身智能模型 HERON-WorldModel 与 HERON-CRA,构成 HERON 技术架构体系。前者为首个世界模型,让机器人“先预判再动手”;后者主打记忆、强化学习与跨本体泛化,让机器人“记住过去、从错误中学习”。创始人姜哲源称公司大部分投入已流向模型研发部门。
为何值得关注:
松延动力从“本体厂商”转向自研大脑,是行业重心从躯干转向模型的有力注脚。其“不绑定单一本体”的统一动作表示,瞄准的是跨构型、跨自由度机器人的能力迁移与泛化,与宇树、智元的路线形成对照。当本体厂集体补脑,具身赛道的差异化将更多体现在训练数据配方与泛化能力,而非硬件参数。
8. 国内具身模型密集上新,年内融资总额超千亿元
事件内容:
据新华社/中国证券报 9月23日报道,9月以来具身模型密集发布:宇树开源 UnifoLM-WLA-1.0(6B 参数、约 2500 小时真机数据、覆盖 64 项任务),智元连发 AGILE 2.0 与 GE-Act 2.0,松延动力推出 HERON 双模型。行业关注点正从“躯干”转向“大脑”。IT桔子数据显示,2026 年至今国内获融资的具身模型公司超 140 家,融资总额超 1000 亿元,约为去年同期三倍。
为何值得关注:
本体厂商集体“补脑”,反映资本与产业共识的迁移——估值逻辑从“硬件制造”转向“AI SaaS / 数据资产”。但王兴兴等行业人士提醒,泛化能力仍是最大瓶颈,客户也从“看 Demo”转为“算 ROI”。模型、数据、仿真、评测、交付的全链条能力,将决定谁能跨越具身智能的“ChatGPT 时刻”,快则两三年、慢则五到十年。
每日 09:00 自动更新 | 侧重 AI Coding 与具身智能方向