大模型研究创意生成新策略:预算化子集精炼提升执行可行性
大语言模型(LLMs)能够生成在专家评审看来新颖的研究创意,但近期研究表明,这些创意往往缺乏多样性,且难以可靠评估,转化为实际项目的成功率较低。arXiv最新研究针对执行前阶段的核心问题——如何在有限计算资源下,从大模型生成的创意池中筛选出更强、更多样、更具执行潜力的研究组合——提出了系统解决方案。
研究团队引入“预算化子集精炼”策略框架,其核心思想是仅对选定的候选创意子集进行深度优化,而非对所有创意进行均匀处理。在涵盖10个随机种子和10种研究创意生成环境的统一评估中,仅依靠原始生成和重排序无法在基准标准下产生研究价值强且非重复的创意,而精炼过程对构建优质创意组合至关重要。
实验发现,均匀精炼虽能产生强个体创意,但在组合层面并非最优计算资源分配方式。随机选择k个创意精炼是低成本的有效基线方法,而基于多样性的MMR-k精炼策略展现出最佳综合表现:在研究价值强的非重复创意产出率最高、成功方法中重复率最低、单位研究价值强创意的计算成本最优。
研究还对平衡的72项样本进行了盲审稳健性检验,结果显示精炼效果在不同模型家族间具有普适性,但具体策略的排名因评审者而异。这些发现表明,大模型研究创意生成系统不仅应作为创意发生器评估,更应视为预算约束下的资源分配系统。研究结论主要针对代理评估的创意组合质量,不替代专家评审或基于实际执行的验证。