EdTech 全球风向标
2026-09-13 · AI Coding × 具身智能特辑 · 精选 10 条当日最值得关注的全球 AI 动态
Cursor 推出 Origin 原生托管与 Cloud Agents,打造自托管 Agent 云平台
Agent Infrastructure
9 月 4 日至 11 日,Cursor 密集发布约 15 项更新,核心围绕 Origin 代码托管与 Cloud Agents。Origin 提供原生仓库、双向 GitHub 同步、PR 工具,并打通 Vercel/Buildkite 预览与流水线;Cloud Agents 可订阅 PR/Slack 事件、通过 /goal 执行长期目标,还能从零创建项目并一键发布到 Vercel。此外,Cursor 支持在企业内网自托管 Agent 机器(动态团队池、休眠、Linux/Mac computer use),让密钥留在内部。
Claude Code 上线 plugin eval 与 256 并发工作流,coding agent 进入可评测时代
Agent Evaluation
9 月 11 日前后,Claude Code 发布 v2.1.269 等多项更新:新增 claude plugin eval,插件/Skill 作者可编写测试用例、打分、关闭插件重跑以查看 delta;支持 /output-style 切换(含 Remote Control、headless 云会话);Bash 工具修改文件后直接输出 diff;CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS 可调至 1–256,Workflow 并发能力大幅提升。
GitHub Copilot 引入 HydraFusion 与评论自动解决,评测成本再降
Multi-Model
9 月 11 日,GitHub Copilot 代码审查代理升级:在开发者处理完评论后,Copilot 可自动解决线程;采纳建议时生成上下文感知的提交信息。Copilot 的 Lite effort 级别改用多代理集成评审(ensemble),GitHub 称高严重级问题处理率提升 47%,中等严重级提升 31%,同时审查成本降低 8%。微软工程师还介绍了 Copilot 的 HydraFusion 引擎:按推理深度、代码生成复杂度、调试难度、工具编排需求四个维度评分,再选择执行工作流并分阶段分配模型。
Cognition 发布 SWE-2:FrontierCode 1.1 Main 50%,成本仅为 Fable 5.1 的三分之一
Model
Cognition 宣布推出其最先进的编码模型 SWE-2。在 FrontierCode 1.1 Main 基准上得分 50.0%,仅比 Claude Fable 5.1 低约 1 个百分点,但成本低约 64%;与 GPT-6 Astra 接近,而价格仅为其约四分之一。SWE-2 基于 2.8 万亿参数的 Kimi K3 基座模型进行后训练,Cognition 称这是首次将强化学习扩展到多万亿参数规模。
DeepSeek V4.1 Flash 发布:552B MoE、视觉理解、推理成本再降
Open Weights
DeepSeek 发布 V4.1 Flash,参数规模约 5520 亿,几乎是前代 V4 Flash 的两倍。新架构采用非对称专家激活:输入仅激活 8B、输出激活 16B,HBM 和 SSD 占用分别降至前代的 1/4 与 1/8。模型具备原生视觉理解能力,缓存命中价格约 $0.003/百万 token,价格随参数增长反而下降。
OpenAI Agents API 公开测试:agent 可跨天长时运行、支持自托管沙盒
Infrastructure
OpenAI 将支撑 Codex 的 Agents API 推向公开测试。开发者可通过单一 API 调用创建能运行代码、使用工具、协调子代理并在长会话中保存结果的 agent。API 支持 OpenAI 托管沙盒或企业自有基础设施,内置上下文管理、MCP 工具、并行子代理、Webhook、文件输入与 mid-turn steering。
Sakana Fugu Max / Ultra v2:多模型动态路由,成本降至 1/6
Multi-Agent Orchestration
Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 多智能体编排系统。Fugu Max 可编排包含 NVIDIA Nemotron 等在内的开放权重与专家模型池,动态把每个任务路由到“能完成该工作的最低成本模型”,宣称在接近旗舰质量的同时成本降低 2–6 倍。Fugu Ultra v2 在 DeepSWE、Chartography 等基准上取得顶尖分数,且未依赖 Fable 5/5.1 或 GPT-6-Astra。
2026 外滩大会:机器人从“表演嘉宾”变成“产线打工人”
场景落地
9 月 9–12 日举办的 2026 Inclusion·外滩大会上,40 余家具身智能厂商集中亮相。与往年跳舞、弹琴的炫技展示不同,今年更多机器人进入药房、工厂、洗衣房、变电站等真实场景:搭载蚂蚁灵波通用大脑的人形机器人已在上海国大药房门店承担夜间药品分拣;复旦大学眸深具身大模型驱动的轮式双臂机器人完成洗衣机螺栓抓取、定位、拧紧;四足机器狗进入变电站、核电、地铁等高危场景巡检。
服贸会首发首秀:电子架构底座与仿真训练系统降低具身智能门槛
供应链
9 月 12 日央视报道,2026 年服贸会 3 号馆集中展示具身智能全产业链。我国自主研发的机器人电子架构底座技术首次亮相,一套架构覆盖日常、工业、医疗等场景;仿真训练系统能高度还原物理真实场景,让机器人在虚拟环境中反复试错,降低训练成本。现场还展示了基于可穿戴采集设备形成的超过 150 万小时人类行为数据库。
斜跃智能完成数亿元天使+轮融资,理想前高管押注家庭具身基础模型
融资
9 月 12 日,斜跃智能宣布完成数亿元天使+轮融资,线性资本、钧山资本、弘颐资本、隐山资本等参与。公司由理想汽车前 AI 首席科学家陈伟与前产品线总裁张骁联合创立,以家庭为第一落地场景,提出 Duplex Reasoning(全双工推理)范式,强调机器人在感知、规划、执行过程中保持与人的双向通道,可随时被打断、修正与接管。