大模型解工程力学题能力几何?静态问题测试揭示推理短板

arXiv·25 天前

大语言模型在教育领域的应用日益广泛,但其在专业工程学科中的具体表现仍有待深入探究。近日一项研究聚焦机械工程基础课程中的静力学问题,采用创新的模型蒸馏方法对ChatGPT进行了系统评估。

研究团队并未直接使用教科书原题测试,而是通过蒸馏ChatGPT生成了25道纯文本静力学问题,并在此基础上构建了两个衍生数据集:一个添加了示意图,另一个则修改了数值参数。实验结果显示,模型在纯文本问题上表现优异,准确率较高;然而当问题包含图表时,性能出现明显下降。进一步分析表明,这种性能下降并非主要源于图像识别能力的局限,而是由于模型在多步推理过程中存在困难,难以将提取的视觉信息连贯地应用于后续解题步骤。

这项研究揭示了当前大语言模型在解决需要多模态理解和复杂推理的工程问题时的局限性。尽管模型在文本处理方面表现出色,但面对结合图表的多步骤问题时,其推理链条的连贯性和稳定性仍有待提升。该发现对工程教育中AI工具的合理应用具有重要参考价值,提示教育工作者需审慎评估大模型在不同类型工程问题上的实际能力边界。

大语言模型工程教育多模态推理ChatGPT静力学

原文来源:https://arxiv.org/abs/2606.26103

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回