EdTech 全球风向标

jiaojianli.com

EdTech 全球风向标

2026-09-13 · AI Coding × 具身智能特辑 · 精选 10 条当日最值得关注的全球 AI 动态

Cursor 推出 Origin 原生托管与 Cloud Agents,打造自托管 Agent 云平台

AI Coding
Agent Infrastructure

9 月 4 日至 11 日,Cursor 密集发布约 15 项更新,核心围绕 Origin 代码托管与 Cloud Agents。Origin 提供原生仓库、双向 GitHub 同步、PR 工具,并打通 Vercel/Buildkite 预览与流水线;Cloud Agents 可订阅 PR/Slack 事件、通过 /goal 执行长期目标,还能从零创建项目并一键发布到 Vercel。此外,Cursor 支持在企业内网自托管 Agent 机器(动态团队池、休眠、Linux/Mac computer use),让密钥留在内部。

★ 值得关注:在被 OpenAI 断供模型后,Cursor 没有退守“AI 编辑器”,而是把代码托管、CI、预览、发布闭环收进自家产品,升级为“自托管 Agent 云平台”。这是工具商在被上游模型商“卡脖子”后的典型护城河自救,也预示开发者基础设施正在从“人类优先”转向“Agent 原生”。

查看原文 →

Claude Code 上线 plugin eval 与 256 并发工作流,coding agent 进入可评测时代

AI Coding
Agent Evaluation

9 月 11 日前后,Claude Code 发布 v2.1.269 等多项更新:新增 claude plugin eval,插件/Skill 作者可编写测试用例、打分、关闭插件重跑以查看 delta;支持 /output-style 切换(含 Remote Control、headless 云会话);Bash 工具修改文件后直接输出 diff;CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS 可调至 1–256,Workflow 并发能力大幅提升。

★ 值得关注:这标志着 coding agent 从“能跑”进入“可测试、可评测、可规模化并发”的工程化阶段。插件生态即将出现类似单元测试的质量门槛,企业可以更放心地把 agent 集成进 CI/CD。

查看原文 →

GitHub Copilot 引入 HydraFusion 与评论自动解决,评测成本再降

AI Coding
Multi-Model

9 月 11 日,GitHub Copilot 代码审查代理升级:在开发者处理完评论后,Copilot 可自动解决线程;采纳建议时生成上下文感知的提交信息。Copilot 的 Lite effort 级别改用多代理集成评审(ensemble),GitHub 称高严重级问题处理率提升 47%,中等严重级提升 31%,同时审查成本降低 8%。微软工程师还介绍了 Copilot 的 HydraFusion 引擎:按推理深度、代码生成复杂度、调试难度、工具编排需求四个维度评分,再选择执行工作流并分阶段分配模型。

★ 值得关注:多模型路由正从概念落地为可评测的产品形态。HydraFusion 把“一个 prompt 扔给最强模型”变成“按任务复杂度调度模型”,在保持质量的同时降低推理成本,对企业规模化采用至关重要。

查看原文 →

Cognition 发布 SWE-2:FrontierCode 1.1 Main 50%,成本仅为 Fable 5.1 的三分之一

AI Coding
Model

Cognition 宣布推出其最先进的编码模型 SWE-2。在 FrontierCode 1.1 Main 基准上得分 50.0%,仅比 Claude Fable 5.1 低约 1 个百分点,但成本低约 64%;与 GPT-6 Astra 接近,而价格仅为其约四分之一。SWE-2 基于 2.8 万亿参数的 Kimi K3 基座模型进行后训练,Cognition 称这是首次将强化学习扩展到多万亿参数规模。

★ 值得关注:SWE-2 直接冲击“性能 vs 成本”的帕累托前沿。如果低成本模型能在主流编码任务上接近顶级模型,agentic coding 的商业化路径将更清晰,开发者也能用更少的预算跑更多 agent。

查看原文 →

DeepSeek V4.1 Flash 发布:552B MoE、视觉理解、推理成本再降

AI Coding
Open Weights

DeepSeek 发布 V4.1 Flash,参数规模约 5520 亿,几乎是前代 V4 Flash 的两倍。新架构采用非对称专家激活:输入仅激活 8B、输出激活 16B,HBM 和 SSD 占用分别降至前代的 1/4 与 1/8。模型具备原生视觉理解能力,缓存命中价格约 $0.003/百万 token,价格随参数增长反而下降。

★ 值得关注:DeepSeek 再次证明“大模型可以既大又便宜”。低成本、高参数的开放权重模型将持续压低 agent 推理成本,加速私有化部署和视觉-代码多模态 agent 的普及。

查看原文 →

OpenAI Agents API 公开测试:agent 可跨天长时运行、支持自托管沙盒

AI Agent
Infrastructure

OpenAI 将支撑 Codex 的 Agents API 推向公开测试。开发者可通过单一 API 调用创建能运行代码、使用工具、协调子代理并在长会话中保存结果的 agent。API 支持 OpenAI 托管沙盒或企业自有基础设施,内置上下文管理、MCP 工具、并行子代理、Webhook、文件输入与 mid-turn steering。

★ 值得关注:这是 OpenAI 把“agent 作为产品”抽象化的关键一步。自托管沙盒选项可降低厂商锁定,但数据留存、训练隔离等治理问题也随之浮出水面,企业需在采用时同步建立安全边界。

查看原文 →

Sakana Fugu Max / Ultra v2:多模型动态路由,成本降至 1/6

AI Coding
Multi-Agent Orchestration

Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 多智能体编排系统。Fugu Max 可编排包含 NVIDIA Nemotron 等在内的开放权重与专家模型池,动态把每个任务路由到“能完成该工作的最低成本模型”,宣称在接近旗舰质量的同时成本降低 2–6 倍。Fugu Ultra v2 在 DeepSWE、Chartography 等基准上取得顶尖分数,且未依赖 Fable 5/5.1 或 GPT-6-Astra。

★ 值得关注:静态模型菜单正在让位于“可调度系统”。这对构建高并发、低成本的 agent 工作流极具参考价值,也表明模型层面的竞争正从“谁更大”转向“谁能以更低成本完成同样任务”。

查看原文 →

2026 外滩大会:机器人从“表演嘉宾”变成“产线打工人”

具身智能
场景落地

9 月 9–12 日举办的 2026 Inclusion·外滩大会上,40 余家具身智能厂商集中亮相。与往年跳舞、弹琴的炫技展示不同,今年更多机器人进入药房、工厂、洗衣房、变电站等真实场景:搭载蚂蚁灵波通用大脑的人形机器人已在上海国大药房门店承担夜间药品分拣;复旦大学眸深具身大模型驱动的轮式双臂机器人完成洗衣机螺栓抓取、定位、拧紧;四足机器狗进入变电站、核电、地铁等高危场景巡检。

★ 值得关注:“真干活”是具身智能从实验室走向商业闭环的分水岭。当同一套“通用大脑”能驱动不同形态机器人在多场景落地,具身智能开始具备可复制的产业价值,而不仅是资本热度。

查看原文 →

服贸会首发首秀:电子架构底座与仿真训练系统降低具身智能门槛

具身智能
供应链

9 月 12 日央视报道,2026 年服贸会 3 号馆集中展示具身智能全产业链。我国自主研发的机器人电子架构底座技术首次亮相,一套架构覆盖日常、工业、医疗等场景;仿真训练系统能高度还原物理真实场景,让机器人在虚拟环境中反复试错,降低训练成本。现场还展示了基于可穿戴采集设备形成的超过 150 万小时人类行为数据库。

★ 值得关注:具身智能的瓶颈不仅是模型,更是底层电子架构、数据采集与训练成本。服贸会展示的首发技术说明产业链正在补全“数据-训练-硬件”基础设施,这对国内中小企业和科研院所进入该领域尤为重要。

查看原文 →

斜跃智能完成数亿元天使+轮融资,理想前高管押注家庭具身基础模型

具身智能
融资

9 月 12 日,斜跃智能宣布完成数亿元天使+轮融资,线性资本、钧山资本、弘颐资本、隐山资本等参与。公司由理想汽车前 AI 首席科学家陈伟与前产品线总裁张骁联合创立,以家庭为第一落地场景,提出 Duplex Reasoning(全双工推理)范式,强调机器人在感知、规划、执行过程中保持与人的双向通道,可随时被打断、修正与接管。

★ 值得关注:家庭是具身智能最难也最具长期价值的场景。斜跃把“交互与行动一体化”作为模型起点,而非单纯追求动作执行,代表了从“Action-centric”向“Human-centric”的范式转变,值得持续关注其模型进展与落地节奏。

查看原文 →