NaviGen:让AI读懂你的行为,生成更懂你的个性化内容

arXiv·27 天前

当前AIGC虽然能生成高保真图像视频,但依赖用户提供详细创作指令,而普通用户往往难以清晰描述视觉细节,导致生成结果与需求不符。针对个性化内容生成这一难题,研究团队提出NaviGen解决方案。

该研究面临两大挑战:如何将用户行为编码成语言模型可理解的形式,以及如何让模型掌握指令撰写能力——这两种能力在预训练和行为数据中都未直接提供。NaviGen的创新在于采用双重标识符表示每个项目,将协同代码和文本代码耦合在单一令牌流中,既作为行为基底又充当语义桥梁。

模型训练采用两阶段流程:首先通过进化搜索监督进行SFT微调,蒸馏出偏好推理和指令撰写能力;随后通过分层且自洽的奖励机制进行强化学习,使生成内容与用户意图对齐。在电商、游戏和短视频领域的实验表明,NaviGen不仅能提升个性化图像视频生成质量,还能增强下一项目预测准确性,生成的指令更具体、相关且易于视觉化生成。

该研究为降低AIGC使用门槛提供了新思路,让AI能主动理解用户偏好并转化为可执行指令。代码已在GitHub匿名发布,为个性化内容生成领域带来新的技术突破。

个性化生成多模态AI用户行为建模指令生成AIGC

原文来源:https://arxiv.org/abs/2606.24196

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回