返回行业动态

AI教育评估框架TutorMoments发布,聚焦大模型辅导时机判断能力

2026/08/07 17:54
查看原文

OmniTools 8月8日消息,AI2与Hugging Face联合发布TutorMoments评估框架预览版,旨在衡量大语言模型在真实数学辅导场景中判断“何时介入帮助、何时放手让学生自主思考”的能力。

该框架基于462份美国2至7年级学生的一对一数学辅导转录文本,由27位资深数学教师标注超1500个关键教学决策点,区分“提供脚手架支持”与“推动深度思考”两类情境。测试中,LLM需在标注决策点接手模拟辅导,其行为由教师定义的基准及自动化评分流水线进行三维度评估:是否适时支持、是否适时推动、是否避免过度支持。

初步测试覆盖7个主流LLM,结果显示:仅提示“请良好辅导”时模型普遍过度帮助;明确提示权衡“支持vs.推动”后各模型表现提升,但不同模型间差异显著,且仍难以完全匹配人类教师在真实场景中的动态适配水平。配套数据集、代码及模型回放已开源。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部