AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
提示工程
9 篇相关内容
相关话题
大语言模型
基准测试
模型评估
多项选择题问答
多智能体系统
上下文管理
性能评估
优化算法
AI研究
MAGE
大模型评测
格式敏感度
提示工程“简单”反而更强?研究揭示LLM评估中的“简洁性悖论”
一项大规模实证研究发现,在多项选择题问答任务中,简单的基线提示法往往优于复杂的推理提示技术,挑战了“越复杂越好”的普遍假设。
a
arXiv
·
4 天前
大语言模型
提示工程
模型评估
多项选择题问答
a
大模型协调内容挤占任务预算?新测试方法RCWT揭示上下文分配难题
研究者提出RCWT测试协议,量化大模型多智能体系统中协调内容对任务执行预算的挤占效应。实验发现当参考证据降至数百token时,模型性能会急剧下降。
a
arXiv
·
6 天前
大语言模型
多智能体系统
上下文管理
提示工程
a
MAGE研究揭示提示优化的稳定性与性能权衡:组件耦合效应是关键
研究人员通过MAGE框架发现提示优化中的组件耦合效应,表明多组件优化在提升性能的同时会放大方差,需同时评估性能与稳定性。
a
arXiv
·
6 天前
提示工程
大语言模型
优化算法
AI研究
a
提示词格式敏感度:大模型评测中格式包装对准确率的影响
研究发现,评测大模型时仅改变提示词的格式包装,就可能导致准确率大幅波动,甚至改变排行榜结论。研究人员提出格式敏感度指数与解析敏感度指数,量化这一影响。
a
arXiv
·
7 天前
大模型评测
提示工程
格式敏感度
基准测试
a
提示框架扭曲大语言模型错误检测评估:锚定效应导致F1虚高
研究发现,基于计数的F1指标可能因提示框架中的数字锚定效应而虚高,无法真实反映大语言模型的错误定位能力。
a
arXiv
·
18 天前
大语言模型
评估方法
语法纠错
提示工程
a
对比反思:让AI提示优化像调试代码一样精准
研究者提出对比反思框架,通过结构化追踪AI代理行为差异,实现可解释的迭代式提示优化,在HotpotQA测试中将准确率从51.4%提升至60.4%。
a
arXiv
·
20 天前
提示工程
大语言模型
信息检索
AI优化
a
用非暴力沟通约束降低大语言模型对话中的冲突升级
研究团队通过引入非暴力沟通原则作为提示词约束,成功引导大语言模型在情感冲突场景中采取更具缓和性的对话策略,显著降低了对话冲突升级风险。
a
arXiv
·
25 天前
大语言模型
对话安全
非暴力沟通
提示工程
a
叙事思维法:让大模型学会“三思而后行”的伦理推理框架
研究者提出“叙事思维”提示框架,通过结构化思维链显著提升大模型在道德困境中的推理透明度,将利益相关者遗漏率从31%降至1%以下。
a
arXiv
·
25 天前
伦理AI
推理框架
可解释性
提示工程
a
指令泄露:提示组合式智能体系统中的跨模块干扰现象
研究发现提示组合式智能体系统存在一种隐蔽故障模式——修改某个提示模块会无声影响其他模块行为,即使它们没有共享变量或执行依赖。
a
arXiv
·
25 天前
智能体系统
提示工程
Transformer架构
系统评估
a