侧重 AI Coding 与 具身智能 方向,精选 8 条今日值得关注的重要动态。
1. OpenAI 发布 GPT-6 Sol 与 Luna,API 价格永久腰斩
事件内容:
OpenAI 于 9 月 25 日正式推出 GPT-6 系列两款新模型 Sol 与 Luna,延续「大中小杯」梯队:Astra 守旗舰,Sol 居中端专业工作,Luna 为轻量高性价比档。两款模型沿用 Astra 的训练方法,继承了其在编程、事实准确性与计算机操作上的改进,内部测试显示 Sol 错误率约为上一代一半。价格方面以 GPT-5.6 促销价为基准,Sol 每百万输入 token 从 4 美元降至 2 美元、输出从 20 降至 10;Luna 输入从 0.20 降至 0.10、输出从 1.20 降至 0.50,且为永久性降价。模型 ID 为 gpt-6-sol 与 gpt-6-luna,已同步上线 API,Plus/Pro/Business/Enterprise/Edu 用户即日起可在 ChatGPT Work 与 Codex 中使用。
为何值得关注:
这是基础模型价格战向编程场景的最直接传导:Sol 在多项基准上可与 Claude Opus 5 比肩,但单任务成本仅约其 9%,Luna 在 DeepSWE 测试中成本比竞品低 93%–96%。对依赖长上下文、多轮迭代的 Coding Agent 而言,单位智能成本骤降会显著改变「用哪个模型跑 Agent」的算账方式,也将倒逼 Claude Code、Cursor 等上层工具重新分配模型路由策略。
2. Factory 完成 2 亿美元融资,估值升至 50 亿美元
事件内容:
AI 编程 Agent 公司 Factory(The San Francisco AI Factory Inc.)完成 2 亿美元新一轮融资,估值由 5 个月前(2026 年 4 月)的 15 亿美元跃升至 50 亿美元,累计融资超 4 亿美元。本轮由 Blackstone 领投,其本身也是 Factory 的企业付费客户;Khosla Ventures、Sequoia、Insight Partners、NEA 等跟投。Factory 称营收已连续 6 个月每月翻倍,客户包括 Nvidia、Adobe、Palo Alto Networks、T-Mobile 等,开发者用户已达数十万。其产品 Droids 主打在隔离虚拟环境中自动完成修 bug、代码迁移、写测试等任务,并通过模型路由将 token 成本压低 60% 以上。
为何值得关注:
投资方愿意以 50 亿美元为一家「独立编程 Agent 层」买单,而非默认大厂会吞掉这一品类,说明市场押注企业会持续为「架在任意模型之上、可跨供应商切换」的 Agent 工具付费。Blackstone 既是股东又是客户的双重身份,也把「真实企业负载验证」摆到了估值逻辑的中心,对 Cursor、Cognition 等同赛道玩家形成直接对标压力。
3. Cursor 上线 Rollouts 与 Security Review 两款 PR 机器人
事件内容:
Cursor 于 9 月 24 日推出两款新 bot:Rollouts 在变更部署后持续检查其健康度,Security Review 则对每一个 PR 扫描可被利用的漏洞。两者都面向「代码合入主线后」与「合入前」两个容易漏检的环节,把 Agent 能力从「写代码」延伸到「看护代码全生命周期」。与此同期,Cursor 还在 Product Hunt 的 Vibe Coding 榜单中位居前列,社区侧围绕长时运行 Agent、跨机终端编排的工具(如 49agents IDE、Blume.codes)也密集涌现。
为何值得关注:
编程助手的竞争焦点正从「补全与生成」转向「责任边界」:能写代码不够,还要能证明代码部署后不出事、合入前无漏洞。Rollouts/Security Review 把 Agent 嵌进 CI/CD 的关键闸门,意味着 Vibe Coding 正被倒逼补齐工程化与可审计性,这恰好是它进入企业正规研发流程最缺的一块拼图。
4. GitHub Copilot 接入 Claude Opus 5.5 与 GPT-6,并预览本地沙箱
事件内容:
GitHub 于 9 月 22 日宣布在 Copilot 全系客户端与 Agent 体验中提供 Anthropic Claude Opus 5.5 与 OpenAI GPT-6 Sol/Luna,可用范围随套餐与模型灰度而不同;同时 Copilot CLI 对 C++ 项目新增整库持久化索引,加速跨文件的定义、引用与符号检索。9 月 23 日,GitHub 又在 Copilot 应用中预览项目级本地沙箱控制,覆盖文件系统、网络访问与 Git/GitHub CLI 凭据,默认关闭、公开预览;Copilot 代码审查的控制项(按 PR 事件自动审查、可配置审查力度、企业级默认力度)也已全量可用。
为何值得关注:
Copilot 一边把前沿模型「即插即用」地开放给开发者,一边用本地沙箱把 Agent 的文件/网络/凭据权限收口——这是把「能力」与「安全边界」同步交付的典型动作。对 Vibe Coder 而言,多模型可择优选路由,沙箱则把「让 Agent 碰真实环境」的恐惧降到可控,是企业采纳编程 Agent 的两个前置条件同时被满足。
5. Claude Code 连发安全更新,危险 rm 命令强制确认
事件内容:
Anthropic 于 9 月 24–25 日连续推送 Claude Code 2.1.281 与 2.1.282:2.1.281 中 auto 模式遇到 `rm -rf "$(pwd)"` 这类高危模式会一律先询问,并支持关闭署名、恢复会话时保留推理与缓存;2.1.282 进一步规定克隆的仓库不能再悄悄开启遥测导出,且会明确告知用户它忽略了哪些遥测变量。同期 Codex CLI 0.156.1 也在 OpenAI 发模型次日即把 GPT-6 Sol/Luna 加入模型选择器,CMU 的 CliffCompaction 则作为代理层把长 Coding Agent 会话成本砍掉一半。
为何值得关注:
当 Agent 拿到 shell 权限,「能不能不乱删、会不会偷传数据」成了信任底线。Claude Code 把高危命令与遥测开关做成「默认拦一道」的护栏,折射出编程 Agent 的演进从「更聪明」转向「更可信」——这类边界控制会逐步沉淀为行业标配,也是 Agent 从个人玩具走向团队生产环境的安全地基。
6. StepFun 发布 Step 5 Preview:600B MoE、百万 token 上下文
事件内容:
阶跃星辰(StepFun)推出 Step 5 Preview,采用稀疏混合专家架构,总参数 600B、每 token 激活 27B,支持 100 万 token 的多模态上下文(文本、图像、视频),API 定价为每百万输入 token 1.00 美元、输出 2.70 美元,主要面向软件工程与金融工作流。同期 Product Hunt 的 Vibe Coding 新晋工具还出现把 Agent 会话沉淀为可复用 rules/skills(Blume.codes)、把 coding agent 跑在专属电脑/账号/预算上(Solid)等方向。
为何值得关注:
百万级上下文 + 高性价比 MoE,直击长时编程 Agent「要读完整仓库和长日志」的痛点。当上下文容量不再卡脖子、单价又压到软件工程可接受区间,Agent 处理超大规模代码库重构与跨文件调试的门槛会明显下降,国内基础模型在 Coding 赛道的产品化节奏正在提速。
7. 具身智能赛道复盘:一年融资近 370 亿、出货量增 508%
事件内容:
据中国经济新闻网 2026 年复盘,全球人形机器人 2025 年出货量逼近 1.8 万台、同比暴增 508%;截至 2025 年 12 月,至少 165 家具身智能企业完成 303 次融资、累计近 370 亿元,较 2024 年增长约 260%,其中 86 家企业一年完成两轮以上融资,百亿估值独角兽扩容至约 9–10 家。2026 年被称作「量产元年」,国内市场规模预计同比再翻番;政策层面「具身智能」与「智能机器人」首次升格为国家战略,北京、上海等 20 余城竞相布局,核心部件(视触觉传感器、减速器、灵巧手)价格降幅超 50%。
为何值得关注:
数据背后是「从概念验证转向 ROI 评估」的分水岭信号:资本涌入速度已快于产业,而成本下探让消费级人形机器人首次跌破万元。但也要警惕三重隐忧——技术瓶颈、伪需求与普遍亏损。对关注物理 AI 的读者,真正的胜负手正从硬件转移到「具身大脑」与世界模型,工业场景是最先规模化落地的突破口。
8. 宇树 Unitree R1 起售 2.99 万,人形机器人走向「万元工具」
事件内容:
据科普中国梳理,宇树科技 Unitree R1 身高 123cm、起售价 2.99 万元,松延动力 Bumi 预售不足万元,优必选 Walker 系列成本较 2024 年下降 25%。宇树估值约 420 亿元、处于 IPO 阶段,2025 年人形机器人出货超 5500 台居全球第一;智元机器人 2025 年出货 5100 台、2026 年目标数万台;银河通用获国家大基金三期投资并与宁德时代合作,其物料搬运方案效率较人工提升 30%+,智元与富临精工近百台落地覆盖 3 条装配线。行业共识的渗透路径为 3D 岗位→泛工业/商业服务→家庭。
为何值得关注:
价格下探叠加头部企业万台级量产目标,标志人形机器人正从「百万玩具」走向「万元工具」。商业化先从危险、肮脏、枯燥的工业岗位破局,再向商业服务扩展——这意味着具身智能的落地不再只讲 Demo,而是开始用「效率提升百分比」和「落地台数」来量化回报,2026 年或是规模验证的真正起点。
每日 09:00 自动更新 | 侧重 AI Coding 与具身智能方向