企业AI技能描述优化:单次改写即可实现人工调优效果
在企业AI系统中,用户查询通常通过自然语言描述匹配被路由到特定技能模块。当多个技能描述重叠时,路由大语言模型会出现误判,这种现象被称为“技能碰撞”。随着系统扩展至数十个技能,手动调整描述以维持路由准确性已成为显著的工程瓶颈。
研究团队在生产级企业群聊代理系统(含9个技能、372个回归测试案例)上部署了自动化描述优化流程。实验结果显示,自动化流程生成的描述平均F1分数达79.2%,与人工调优描述的79.4%几乎持平(平均每技能差异仅-0.20%,在0.78%的多种子噪声范围内)。更重要的是,单技能优化时间从120分钟大幅缩短至3.8分钟,效率提升32倍。
通过在生产系统和ToolBench(含1.6万个工具)上的系统消融实验,研究人员发现:仅使用可用误报和漏报案例进行一次LLM改写,即可获得绝大部分可实现的改进效果。其他测试的设计选择(迭代预算、反馈信号组合、混淆对双重编辑、训练集规模)对最终F1分数的影响均小于0.5%。
值得注意的是,描述优化虽能解决由描述重叠引起的技能碰撞,但无法处理两个技能实际适用范围确实重叠的情况。研究提出了一种诊断方法(训练-验证F1分数大差距),可识别此类需要架构层面而非文本层面干预的案例。