设想一下这样一个场景:
你正在解一道数学题,一个AI导师在旁边引导你思考,另外两个AI“同学”——一个擅长概念但总算错数,另一个计算准确但偶尔理解偏颇——正在激烈讨论这道题的解法。
你不仅能看到导师的正确答案,还能观察同伴犯错、纠错的全过程。
这不是天方夜谭,也不再是一个科幻设想。
这已经成为越来越多的人工智能教育应用的发展方向。
之前,自留地曾介绍过清华大学计算机系交互式人工智能课题组(CoAI) 王宏宁教授团队打造的 aicosmos.ai 吗?
这款新一代多智能体教学科研赋能平台,用户可以同时召唤多个AI专家角色进入群聊,比如教学科研助手、物理学科导师、视觉特效工程师。他们会一起介入,通过提问厘清你的学习目标,展开沉浸式研讨。aicosmos.ai 打破了传统AI一对一问答的局限,能够模拟一个真实的学习小组环境,让学习过程变得更加生动和深入。
同样是清华大学,在他们推出的OpenMAIC中,系统不仅能根据学习者的输入,自动生成一堂完整的 AI 互动课,而且可以召唤多智能体参与学习过程,有 AI 老师给你讲,有 AI 同学跟你讨论,还能导出课件。
尽管像 AICosmos 和 OpenMAIC 这样的平台已经展示了“AI 导师 + AI 同学”的雏形,但要让这种模式真正成熟并普及,目前仍面临着从认知科学到技术实现的多重挑战。
的确,多智能体协同教学(Multi-Agent Collaborative Learning)已经成为 AI 教育应用的一个重要趋势,
但这个方向迫切需要进一步的研究支持。

St george campus university of toronto,图片源自多伦多大学官网,未经授权
早上,读到多伦多大学研究团队发表于 arXiv 的《超越AI导师:基于LLM智能体的社会学习》(Beyond the AI Tutor: Social Learning with LLM Agents) 挑战了“单一 LLM 家教”的默认范式。
文章试图回答一个核心问题:
相比单一AI导师,多智能体LLM配置(如加入同伴或角色分工)能否带来额外的学习益处?
文章的四位作者中,通讯作者 Ashton Anderson 是多伦多大学计算机科学系的副教授,他领导着一个计算社会科学实验室。他的研究一直聚焦于以人为本的人工智能(Human-Centered AI),尤其关注算法与人类在社会层面的互动。
第一作者 Harsh Kumar 是Anderson教授团队中的核心成员。
另外两位合作作者Zi Kang (Jace) Mu 与 Jonathan Vincentius 是多伦多大学的研究生。

https://arxiv.org/pdf/2604.02677v1
研究包含两项对照实验:
一是在 SAT 难度数学问题中引入 LLM 家教和会犯不同类型错误的 LLM 同伴;
二是在议论文与创意写作任务中比较无 AI、单一 LLM、双 LLM(Claude + ChatGPT)三种条件。
实验一:数学问题解决(收敛性任务)
实验设计类型:2×2 完全随机、被试间设计。
自变量1:LLM导师(有 vs. 无)
自变量2:LLM同伴(有 vs. 无)
由此形成四个实验条件:Control(无AI)、Peers Only(仅同伴)、Tutor Only(仅导师)、Tutor + Peers(导师+同伴)。
参与者:通过Prolific平台招募614名美国众包工人,经注意力检查后有效样本315人。
核心材料:
题目:5道SAT水平的数学题(如概率、平均速度、方程组)。
题目变体:为每道题创建同构异值题(结构相同,数值不同),分别用于学习阶段和测试阶段,以控制记忆效应。
智能体设计(关键):
Bob(导师):提供引导性反馈和苏格拉底式提问,不直接给答案。
Alice(同伴):概念理解强,但常犯算术错误。
Charlie(同伴):计算准确,但常犯概念性错误(如用错公式)。
所有智能体由GPT-5.2驱动,通过不同的系统提示词赋予角色。
实验流程(每个参与者完成2道题):
学习阶段:参与者作答 → 根据条件进入对应智能体聊天室(5分钟交互)→ 可自由提问。
干扰任务:玩1分钟俄罗斯方块(建立记忆间隔)。
测试阶段:解答同构变体题,无任何AI辅助(主要结果指标)。
后测问卷:收集自评难度、学习收获、困惑感、对智能体的感知等。
研究发现,在SAT数学题的学习实验中,多智能体配置展现出阶梯式的学习增益。
无AI辅助的对照组测试正确率仅为42%,而仅有AI同伴组、仅有AI导师组和“导师+同伴”组的正确率分别提升至48%、59%和65%。
其中,“导师+同伴”组的成绩显著优于对照组和仅有同伴组,表明导师的权威指导与同伴的错误示范能够形成互补,共同促进深层理解。
实验二:协作写作(发散性任务)
实验设计类型:单因素、被试间设计。
自变量:AI辅助类型,有三个水平:Control(无AI)、Single(单一LLM)、Duo(双LLM)。
关键操作:在Duo条件下,两个LLM被赋予互补的角色分工(如创意写作中,一个侧重想象力,一个侧重结构)。
参与者:招募419人,经预注册标准(通过注意力检查且两篇作文字数均≥40词)筛选后,有效样本247人。
核心材料:
任务:从《纽约时报》学生评论专栏选取的议论文和创意写作提示各3个。
智能体:Single条件随机分配GPT-5.2或Claude Opus 4.6;Duo条件同时使用两者,角色随机分配。
实验流程(每个参与者完成1篇议论文+1篇创意文,顺序随机):
写作阶段:参与者有5分钟时间在文本框内写作。AI条件参与者可通过聊天窗口与智能体互动。
后测问卷:测量写作自我效能感、感知帮助度、是否激发新想法、认知负荷等。
研究发现,在议论文和创意写作任务中,单AI和双AI配置均能显著提升作文质量,且两者效果相当,但它们在观点多样性上产生了根本性分歧。
使用单一AI助手会导致参与者的作文在思想层面显著趋同(观点相似度从0.735升至0.748),而采用两个角色分工的AI(一个侧重想象力与风格,另一个侧重结构与逻辑)则成功避免了这种同质化,使观点多样性恢复至无AI辅助的基线水平。
然而,双AI配置也带来了更高的认知负荷和困惑感,但同时比单AI配置更好地维护了学习者的独立写作信心,揭示了多智能体协作在发散性任务中“保质量、护多样、增负担”的复杂效应。
简单地说,两个实验发现了两个非常有趣且有价值的研究发现:
同时与家教和同伴互动的学生取得了最高的无辅助测试准确率;在写作任务中,双智能体条件既提升了作文质量,又避免了单一模型带来的观点同质化问题。
长期以来,AI教育领域被“复制一对一人类导师”的愿景所主导。
过去几十年,智能导学系统一直以 Bloom 的“一对一人类家教”为标杆。
这项研究最核心的贡献在于证明:教育技术不必受限于这个范式。
通过精心编排多个LLM智能体(AutoGen等框架使其变得可行),研究者创造了一种更接近真实课堂生态的学习环境——有专家,有同伴,有争论,有协作。
这不仅在技术上是可行的,更可能解锁单一导师模式无法提供的教育价值。也为包括清华大学所推出的 aicosmos.ai 和OpenMAIC 之类的多智能体学习系统提供了有力的研究证据支持。
毕竟,真实课堂的学习收益很多时候来自同伴、冲突和多元视角。
这项研究把“社会性学习”和“同伴示范”等经典学习科学概念引入 LLM 教育应用,提示未来的 AI 课堂可以不止于“人机一对一”,而是可以模拟异质性同伴与协作情境。
多智能体架构为“AI 课堂社会学”打开了新空间,也为课程设计者提供了新的变量:除了模型能力,还要设计社会互动结构。
这项研究吸引自留地君的另外一个地方就在于实验设计。
这项研究的设计尤为可贵之处,在于它没有笼统地讨论“多智能体是否更好”,而是区分了两种根本不同的学习任务:收敛性任务,数学问题,有唯一正确答案;发散性任务,创意写作,无标准答案。
这种精细化的设计让结论有了更强的解释力。
研究团队没有只盯着“成绩提升”这一单一维度。
他们测量了学习者的自信、困惑感、认知负荷等在教育心理学中至关重要却常被忽视的变量。
这项研究虽然饱含方法论上的缺陷。
论文坦诚地承认,所有参与者都来自Prolific众包平台,他们答题的动机是赚取报酬(每小时8.17美元),而非真正的学习意愿。这构成了一个根本性的效度威胁。
样本量不足严重削弱了其证据的可信度,研究结论基础薄弱。
尽管如此,这篇文章的价值就在于开创了一个新的研究议程。
它不再是“AI能否教得好”这种已无新意的问题,而是进入了“什么样的AI生态最能促进人类学习”的更深水域,在于它用严谨的实验设计提出了一个正确的问题:
当AI越来越强大,我们是应该追求一个“完美无缺的万能导师”,还是构建一个“有缺陷、有差异、有争论的学习社群”?

图片源自多伦多大学官网,未经授权
在文章结尾,作者明确或隐含地指出了以下未来方向:
1、开展真实教育场景的实地研究:将实验迁移到真实课堂,以学生为对象,验证并扩展当前发现在生态效度上的可靠性。
2、扩大设计空间的探索:系统性地改变智能体数量、角色分工、错误类型组合、交互结构(如同步/异步、对话vs. 结构化提示)等变量,寻找更优或更具适应性的配置。
3、进行纵向研究:设计跨越多小时、多日甚至整个学期的研究,考察多智能体交互对学习的长期影响,以及其动力机制如何随时间演变。
4、扩展到更多学科领域:将范式应用于STEM、人文、社会科学等更广泛的学科,测试结果的普适性。
5、深度分析交互过程:利用行为编码、话语分析等方法,深入挖掘参与者与多个智能体的对话数据,以揭示具体如何(如:通过何种提问、何种争论)促成了学习增益。
6、开发自适应、学习者感知的系统:研究如何根据学习者的认知状态、情感需求或动机水平,动态调整智能体配置(例如,何时用同伴激励,何时用权威导师讲解),实现个性化学习支持。
希望更多的教育技术研究者投入到这个课题方向的研究中,尤其是在读的博士研究生和硕士研究生同学。
最后,关于这个课题,你有何评论?
你如何看待AI多智能体在学习中的应用?
是教育创新的下一个风口,还是技术过度介入教育的危险尝试?
欢迎在评论区分享你的观点。

2003年8月22日 与欧盟项目同仁在兰州摄影者不详