NaviGen:让AI读懂你的行为,生成更懂你的个性化内容
当前AIGC虽然能生成高保真图像视频,但依赖用户提供详细创作指令,而普通用户往往难以清晰描述视觉细节,导致生成结果与需求不符。针对个性化内容生成这一难题,研究团队提出NaviGen解决方案。
该研究面临两大挑战:如何将用户行为编码成语言模型可理解的形式,以及如何让模型掌握指令撰写能力——这两种能力在预训练和行为数据中都未直接提供。NaviGen的创新在于采用双重标识符表示每个项目,将协同代码和文本代码耦合在单一令牌流中,既作为行为基底又充当语义桥梁。
模型训练采用两阶段流程:首先通过进化搜索监督进行SFT微调,蒸馏出偏好推理和指令撰写能力;随后通过分层且自洽的奖励机制进行强化学习,使生成内容与用户意图对齐。在电商、游戏和短视频领域的实验表明,NaviGen不仅能提升个性化图像视频生成质量,还能增强下一项目预测准确性,生成的指令更具体、相关且易于视觉化生成。
该研究为降低AIGC使用门槛提供了新思路,让AI能主动理解用户偏好并转化为可执行指令。代码已在GitHub匿名发布,为个性化内容生成领域带来新的技术突破。