企业AI技能描述优化:单次改写即可实现人工调优效果

arXiv·20 天前

在企业AI系统中,用户查询通常通过自然语言描述匹配被路由到特定技能模块。当多个技能描述重叠时,路由大语言模型会出现误判,这种现象被称为“技能碰撞”。随着系统扩展至数十个技能,手动调整描述以维持路由准确性已成为显著的工程瓶颈。

研究团队在生产级企业群聊代理系统(含9个技能、372个回归测试案例)上部署了自动化描述优化流程。实验结果显示,自动化流程生成的描述平均F1分数达79.2%,与人工调优描述的79.4%几乎持平(平均每技能差异仅-0.20%,在0.78%的多种子噪声范围内)。更重要的是,单技能优化时间从120分钟大幅缩短至3.8分钟,效率提升32倍。

通过在生产系统和ToolBench(含1.6万个工具)上的系统消融实验,研究人员发现:仅使用可用误报和漏报案例进行一次LLM改写,即可获得绝大部分可实现的改进效果。其他测试的设计选择(迭代预算、反馈信号组合、混淆对双重编辑、训练集规模)对最终F1分数的影响均小于0.5%。

值得注意的是,描述优化虽能解决由描述重叠引起的技能碰撞,但无法处理两个技能实际适用范围确实重叠的情况。研究提出了一种诊断方法(训练-验证F1分数大差距),可识别此类需要架构层面而非文本层面干预的案例。

企业AI技能路由LLM优化自动化流程NLP工程

原文来源:https://arxiv.org/abs/2606.30775

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回