EdTech 全球风向标


EdTech 全球风向标

2026年8月15日 · 第15期
本期聚焦:中国教育部等五部门联合印发”人工智能+教育”行动计划顶层设计;全球学者持续深耕AI反馈工作流与苏格拉底式辅导架构;DeepSeek Harness、Google Gemini课堂、讯飞AI黑板等产品和硬件密集落地。教育技术的全球图景正在从”概念验证”加速迈向”规模应用”。

1

中国教育部等五部门印发《”人工智能+教育”行动计划》,系统擘画智能教育发展蓝图

政策动向
来源:中华人民共和国教育部 · 2026年4月发布,8月持续解读

教育部、国家发展改革委、科技部、工业和信息化部、国家数据管理局联合印发《”人工智能+教育”行动计划》,提出推动人工智能深度融入中小学教育教学全要素、全过程、全场景。行动计划涵盖六大方向:促进”人工智能+教育”国际合作、筑牢安全防护体系、建立教育大模型安全审核机制、推动软件正版化、强化人工智能进校园管理、健全评估备案与风险预警机制。

文件明确要求将”人工智能+教育”纳入各地各校发展规划,制定符合自身实际的实施方案,积极开展应用示范。同时提出建强人工智能开放联盟、世界数字教育联盟等平台,深度参与人工智能教育领域国际议程、规则和标准制定。

2

Making AI-Generated Feedback Matter:从”提供反馈”到”学生执行”,13037名学生的大规模准实验揭示AI反馈工作流的关键设计

学术研究
arXiv:2608.11625 · 2026年8月12日

澳大利亚墨尔本大学等机构的研究团队开展了一项覆盖13,037名学生和51,296份学生作品的大规模准实验研究,比较了三种AI反馈工作流的效果。研究发现:在”执行式反馈”条件下(学生被引导选择反馈建议、评估相关性并参与针对性AI对话),学生对AI反馈的采纳率高达26.2%,显著高于”定向反馈”的14.1%和”自主反馈”的0.1%。该工作流还显著提升了学生的自我评估信心和作品质量。

核心结论是:AI反馈的教育价值不仅取决于反馈评论的质量,更取决于能否主动结构化学生的反馈素养执行过程。AI访问本身是不够的,有目的的工作流设计才是 productive feedback use 的核心。

学者点评
这项研究以惊人的样本量证实了一个被长期忽视的教育技术命题:工具本身不产生学习效果,人与工具的交互设计才产生学习效果。26.2% vs 0.1%的采纳率差距不是技术差距,而是教学设计差距。这对所有正在部署AI写作反馈、AI编程辅导、AI评测系统的教育开发者都是一个警醒——别只优化模型,优化工作流。
3

Teaching a Large Language Model Tutor to Withhold the Answer:用监督架构和证据驱动方法训练LLM导师”忍住不直接给答案”

学术研究
arXiv:2608.12292 · 2026年8月12日

悉尼科技大学Yusuf Pisan团队提出了一种让LLM辅导系统可靠地”抑制直接给出答案”的监督架构。研究指出,一个有效的LLM导师必须经常拒绝给出它本可以轻松生成的答案——随机研究显示,使用无防护聊天机器人的学生练习时得分更高,但在后续无辅助测试中表现更差;而苏格拉底式防护版本保留了练习收益并消除了后续损失。

该系统将答案抑制执行为每轮可机器检查的契约:非LLM策略核心根据可信学习者状态设置八级帮助阶梯上限;确定性检测器剥离解决方案代码;独立LLM评判员检查每条风险回复是否违反契约。研究还发现了可解释的”过度帮助阶梯”,从公然泄露解决方案到命名确切Bug,再到过度引用一般性事实。

学者点评
苏格拉底式教学的”知识助产术”在两千多年后获得了工程化实现。这篇论文的贡献不仅在于技术架构,更在于将”帮助的程度”量化为可操作的八级阶梯,并揭示了LLM导师常见的”过度帮助”行为谱系。对于正在设计AI辅导系统的研究者而言,这是一份可直接落地的工程指南——”可机器检查的契约”这个设计思想尤其值得借鉴。
4

首届Teaching Monster Challenge揭晓:AI教学代理的学科教学知识(PCK)基准测试显示”内容擅长,适配薄弱”

学术研究
arXiv:2608.08852 · 2026年8月9日

台湾大学Hung-yi Lee团队联合多所高校发布了首个针对AI教学代理学科教学知识(PCK)的评测基准——Teaching Monster Challenge。该基准要求系统根据给定主题和学习者画像生成完整教学视频,由LLM评判员筛选、众包两两投票排名、专家委员会最终裁定。首届评测结果显示:当前AI系统在处理内容方面表现良好,但在内容呈现方式和根据学习者特征进行适配方面明显薄弱。

研究还发现了一个自动评判的局限性:LLM评判员能够清晰区分低水平尾部,但对最强系统的排名却与人类偏好不符——最强系统从评判员那里获得了几乎相同的分数。这意味着不仅需要更好的教学系统,还需要更好的自动评判器。

学者点评
PCK(学科教学知识)是Shulman在1986年提出的经典概念,指教师将学科知识转化为学生可理解形式的能力。这个评测基准首次将PCK从人类教师的专属能力转化为AI系统的可测量指标,填补了重要空白。当前结果印证了一个直觉:LLM知道很多,但不知道如何针对不同学习者”讲出来”。评测数据全部开源,这对推动AI教育代理的可解释性和可评估性具有重要意义。

5

DeepSeek Harness正式发布:国产首款开源AI Agent产品,MIT协议全面开放

企业研发
DeepSeek · 2026年8月13日

DeepSeek正式发布首款智能体产品DeepSeek Harness开发者预览版,并以MIT协议将全部代码开源。Harness的定位是”让AI真正干活”的Agent运行框架,核心公式为”Model + Harness = Agent”——大模型负责思考推理,Harness负责调度工具、管理任务、执行闭环等工程化工作。

Harness采用”一切皆插件”架构,模型、工具、技能、会话、沙箱、存储、调度、UI等所有模块均可自由替换和重组,支持接入近40家第三方大模型。产品内置四种预设模式:标准模式(完整编程助手)、PTC模式(TypeScript小程序自动化)、极简模式(基础文本替换)、创造模式(支持运行时检查)。同时支持项目管理、超长任务协作、多智能体协同编排、上下文管理以及联网搜索和Skill功能。

研发者推介
DeepSeek Harness的开源策略和插件化架构展现了国产AI基础设施的新思路。对教育工作者而言,这意味着可以低成本搭建定制化的教学Agent——用开源Harness+自有知识库+教学场景插件,快速构建学科专属辅导系统。MIT协议彻底消除了商业使用的法律顾虑,预计会催生一波教育垂直领域的Agent创新。值得关注的是其”极简模式”,适合对技术门槛敏感的教师群体快速上手。
6

Google Gemini全面进入K-12课堂:所有年龄段学生可用,支持作业草稿、学习指南和闪卡生成

企业研发
Google · 2026年8月10日起 rollout

Google宣布Gemini在Google Classroom中向所有年龄段学生全面开放(管理员需先启用)。此次更新包含三大核心功能: redesigned Classroom主页为教师提供作业完成度和课程互动数据仪表盘;Gemini可在作业创建页面直接起草Classroom可用的评分量规,利用作业上下文自动生成分项标准;学生可使用Gemini Notebook同步教师提供的材料,自动生成学习指南、音频概览和闪卡。

与此同时,Google为K-12教育工作者提供了配套的Gemini使用框架,包括学生入门提示词可自动拉取特定班级和作业作为上下文,以及家长控制指南。这是Google在AI教育领域最大规模的一次产品迭代。

研发者推介
Google Gemini进入K-12全年龄段是AI教育从”试点”走向”普及”的标志性事件。三个功能中最具工程智慧的是”评分量规自动生成”——它将AI生成能力嵌入教师最熟悉的工作流(作业创建页面),而非要求教师切换到独立AI工具。这种”在工作流中赋能”的设计哲学,是教育AI产品化最应效仿的路径。音频概览和闪卡生成则精准击中了学生的复习场景需求。
7

科大讯飞AI黑板落地超10万间教室:手写公式实时同步,手绘草图转3D模型,星火能力下沉基础教育

企业研发
科大讯飞 · 2026年8月6日集中展示

科大讯飞在”活力中国调研行”中集中展示了星火大模型赋能的AI黑板,目前已在安徽、江苏、广东等地超过10万间教室部署。AI黑板基于讯飞星火大模型技术,与中国教育科学研究院、华南师范大学等联合研发,实现了三大核心能力:教师手写公式实时同步大屏显示;手绘草图快速转化为3D立体模型;学生可与虚拟助教对话、旋转几何图形进行互动学习。

与此同时,讯飞星火被确认为国内首个基于全国产算力训练的通用大模型,合肥已建成万卡国产算力集群。科大讯飞AI学习机独家冠名的《一站到底·少年季》第二季也在江苏卫视等平台上线,持续扩大品牌在教育场景的影响力。

研发者推介
10万间教室的部署规模意味着AI黑板已从”示范工程”进入”常态化教学工具”阶段。手写公式实时同步和草图转3D这两个功能,精准解决了传统多媒体教学”板书断裂”和”空间想象难”的痛点。更值得关注的是其全国产算力底座——在算力自主可控成为国家战略的背景下,这意味着教育AI基础设施有了不受外部制约的部署能力。对偏远地区学校而言,这种”硬件+模型+内容”一体化方案是最可落地的智能化路径。

8

OpenAI为美国220+所高校学生提供免费ChatGPT Plus一年,定位”学术操作系统”

行业动态
OpenAI · 2026年8月11日公布

OpenAI准备推出其最大规模的学生优惠:为符合条件的美国大学生提供一整年免费的ChatGPT Plus,通过校园白名单(覆盖220余所参与高校)和SheerID学籍验证发放。宣传定位将ChatGPT包装为”学术操作系统”而非简单的作业工具,覆盖考试准备、语音模式语言练习、演示排练、网站生成,以及可读取邮件、管理日历、整合学期散乱上下文的Agent层。

此举在教育AI市场引发连锁反应:Google此前为学生提供的一年AI Pro已结束,现改为通过Handshake提供一年免费AI Plus(美国和加拿大);Perplexity提供每月10美元的教育定价;Anthropic则通过机构协议而非个人折扣服务学生群体。

9

Meta Muse Spark 1.2与Muse Code齐发:百万Token上下文窗口,Contributor定价低至$0.10/MTok

行业动态
Meta · 2026年8月5日发布

Meta Superintelligence Labs发布Muse Spark 1.2编程专用大模型,拥有1,048,576 Token上下文窗口,与Muse Code终端编程Agent协同训练。标准API定价为$1.25/$4.25每百万Token,而Contributor层级低至$0.10/$0.20每百万Token——作为交换,Meta将使用用户的提示和补全进行训练。

Muse Code是Meta首款专用终端编程Agent(beta版,支持macOS/Linux),核心特性包括:追加式精确事件日志(崩溃后可精确恢复)、持久化子代理(多个Agent跨会话保持活跃)、内置技能集(/plan审批门控计划、/grill压力测试计划、/goal目标导向工作)。独立测试显示Muse Spark 1.2在TerminalBench上排名中游,但性价比突出(每次测试约$0.69)。

10

Cursor Router发布:智能路由将前沿模型成本削减68%,重新定义AI编程经济模型

行业动态
Cursor · 2026年8月6日发布

Cursor推出Cursor Router功能,通过将每个代码辅助请求路由到满足质量阈值的最经济模型,实现了显著的成本优化。Auto Intelligence模式在保持高于Fable级用户满意度的同时,将成本降低了68%(较直接调用前沿模型);Auto Balance模式以41%更低的成本超越Opus 4.8,且满意度提升3%。两种模式均无需用户配置,由路由器按请求自动选择模型。

对于大规模使用Cursor的团队而言,路由优化与直接前沿访问之间的成本差距已足够改变每席位经济模型。这一发布标志着AI编程工具从”追求最强模型”向”追求最优性价比”的理性转向。