OmniTools 8月8日消息,AI2与Hugging Face联合发布TutorMoments评估框架预览版,旨在衡量大语言模型在真实数学辅导场景中判断“何时介入帮助、何时放手让学生自主思考”的能力。
该框架基于462份美国2至7年级学生的一对一数学辅导转录文本,由27位资深数学教师标注超1500个关键教学决策点,区分“提供脚手架支持”与“推动深度思考”两类情境。测试中,LLM需在标注决策点接手模拟辅导,其行为由教师定义的基准及自动化评分流水线进行三维度评估:是否适时支持、是否适时推动、是否避免过度支持。
初步测试覆盖7个主流LLM,结果显示:仅提示“请良好辅导”时模型普遍过度帮助;明确提示权衡“支持vs.推动”后各模型表现提升,但不同模型间差异显著,且仍难以完全匹配人类教师在真实场景中的动态适配水平。配套数据集、代码及模型回放已开源。