AI如何塑造研究路径?LLM生成的研究方法存在结构性偏差

arXiv·25 天前

随着大型语言模型(LLMs)在科研方法论指导中的应用日益广泛,其默认倾向性成为学界关注焦点。一项最新研究通过分析GPT-5.1、Gemini 3 Pro和DeepSeek-V3.2对1000篇arXiv计算机科学论文研究问题的回应,揭示了LLMs在研究方法建议上的系统性偏差。

研究团队仅向模型提供研究问题,将其生成的方法论建议与论文实际采用的实验方案进行对比。通过提取结构化方法特征并映射到统一分类体系,研究人员发现最显著的失衡出现在模型提供者选择维度——Jensen-Shannon散度达到其他维度的3-5倍。具体而言,学术界的单次使用模型被低估23-24个百分点,而重复使用的学术/社区模型则被高估4-6个百分点。

更值得关注的是,LLMs建议的方法范围明显收窄:有效模型实体数量从1232个锐减至59-96个。不同LLM之间的排名相关性(0.55-0.68)普遍高于LLM与论文之间的相关性(0.33-0.56),表明这种扭曲在不同模型间高度一致。通过流行度基线、BM25检索校准和论文级相似性测试证实,虽然LLMs能生成针对具体问题的响应,但其选择范围已被大幅过滤。

这项研究警示科研工作者:若不加批判地依赖LLM的方法论建议,可能会将研究方法探索空间压缩到更集中的默认选项,从而限制科学发现的多样性。研究团队建议在使用AI辅助科研时保持方法论自觉,通过交叉验证确保研究设计的全面性。

大型语言模型科研方法论AI偏见学术研究GPT-5.1

原文来源:https://arxiv.org/abs/2606.26130

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回