打破信息茧房:语义帕累托DQN框架实现多目标推荐

arXiv·27 天前

传统推荐系统常因单一优化用户即时参与度而陷入信息茧房和语义同质化困境。针对此问题,最新研究提出了一种创新的多目标强化学习框架,将推荐任务形式化为语义多目标马尔可夫决策过程。该框架采用高保真语义嵌入技术与帕累托DQN智能体相结合的设计,将用户参与度、信息多样性和内容公平性视为独立且不可聚合的奖励信号,避免了静态奖励标量化的常见缺陷。

实验在MovieLens小型数据集上进行,结果显示基于超体积的动作选择机制能有效打破导致语义崩溃的反馈循环。通过维持高状态轨迹方差,帕累托DQN成功描绘出帕累托前沿,在辅助社会目标方面取得显著提升,同时对用户参与度影响微乎其微。这项研究为构建内在对齐、负责任的推荐系统提供了新路径,标志着推荐算法从单一商业指标向多元价值平衡的重要转变。

推荐系统强化学习多目标优化信息茧房公平性

原文来源:https://arxiv.org/abs/2606.24042

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回