生成式推荐系统ETEGRec:从动态分词到端到端训练

📅 2026/8/3 14:06:42
生成式推荐系统ETEGRec:从动态分词到端到端训练
1. 从传统推荐到生成式推荐的范式转变推荐系统在过去十年经历了三次明显的技术迭代。早期的协同过滤Collaborative Filtering方法依赖用户-物品交互矩阵通过矩阵分解挖掘潜在特征。2016年后深度神经网络开始主导推荐领域WideDeep、DeepFM等模型通过特征交叉提升了点击率预测准确率。而当前最前沿的生成式推荐Generative Recommendation则完全改变了问题定义——它不再预测用户对现有物品的偏好概率而是直接生成符合用户兴趣的新物品序列。这种范式转变带来两个核心挑战首先传统推荐模型依赖预定义的特征工程难以捕捉物品描述的语义信息其次生成式推荐需要端到端地理解用户行为序列与物品文本的深层关联。这正是ETEGRec模型的创新切入点——通过端到端可学习的物品分词Tokenization技术将离散的文本描述转化为连续语义空间中的向量表示使生成过程能够直接操作语义单元。2. ETEGRec的架构设计与核心创新2.1 动态物品分词机制传统推荐系统通常使用预训练的词嵌入如Word2Vec或固定分词器如BERT的WordPiece这些方法存在词汇表外OOV问题和语义粒度不匹配的缺陷。ETEGRec提出了一种可微分分词器Differentiable Tokenizer其关键实现包括字符级卷积编码器对物品标题/描述进行字符级卷积生成n-gram特征图。以智能手机为例3-gram卷积核会捕获智能、能手、手机等局部特征。动态聚合门控通过可学习参数决定哪些n-gram应该合并为语义单元。公式表示为g σ(W_g · [h_i; h_j] b_g)其中h_i, h_j为相邻n-gram的向量表示σ为sigmoid函数当g0.5时执行合并。词袋约束损失为防止分词结果偏离自然语言结构添加基于TF-IDF的重构损失L_bow ||BOW(x) - BOW(decoder(tokens))||^2这种设计使得模型能够根据下游推荐任务自适应地调整分词粒度。例如在电商场景中iPhone 13 Pro Max可能被整体作为一个token而在长尾商品推荐时则可能拆分为iPhone和Pro Max两个语义单元。2.2 生成式推荐的三阶段训练ETEGRec采用分阶段训练策略解决端到端学习的优化难题阶段一语义空间预训练使用海量物品描述文本训练分词器采用掩码语言建模MLM目标随机遮盖15%的字符关键技巧对高频商品名采用实体保护策略避免过度拆分阶段二用户行为对齐冻结分词器参数用用户交互数据训练序列推荐模块引入课程学习Curriculum Learning先训练头部商品逐步加入长尾商品阶段三端到端微调联合优化分词器和推荐器采用强化学习策略用NDCG作为reward信号梯度裁剪阈值设为1.0防止分词器崩溃3. 关键技术实现细节3.1 基于Transformer的序列建模ETEGRec的生成模块采用改进的Transformer架构相对位置编码替换原始正弦位置编码解决长序列推荐中的位置敏感性问题。计算公式为e_{ij} (q_i a_{ij})^T k_j其中a_{ij}表示物品i到j的相对位置偏置。稀疏注意力机制使用局部敏感哈希LSH将复杂度从O(n²)降至O(n log n)使模型能处理500长度的用户历史序列。温度采样策略在推理阶段采用动态温度softmaxp_t softmax(logits / τ_t) τ_t max(0.1, 1.0 - t/1000)随着生成步数t增加逐渐降低温度平衡探索与利用。3.2 多任务损失设计模型同时优化三个损失函数生成损失标准交叉熵衡量生成序列与真实交互序列的差异多样性正则项惩罚重复生成相似商品L_div -log det(S^T S λI)S为生成序列的embedding矩阵因果一致性约束确保生成的第t个物品只依赖前t-1个物品L_causal ∑_{t2}^T ||h_t - stop_grad(h_{t-1})||^24. 实战效果与调优经验在Amazon商品数据集上的测试表明ETEGRec相比传统方法有显著提升指标SASRecBERT4RecETEGRecNDCG100.4120.4380.487多样性(Entropy)2.312.453.02冷启动覆盖率18.7%22.3%34.5%在实际部署中我们总结了以下经验分词粒度控制通过调整卷积核大小和合并阈值来适配不同领域。例如电商场景3-5gram卷积核合并阈值0.6新闻推荐2-3gram卷积核合并阈值0.4内存优化技巧对商品embedding使用PQ量化将1.2GB的模型降至300MB使用FAISS进行最近邻搜索加速在线服务策略采用两阶段生成首先生成100个候选再用精排模型筛选top10对高活跃用户启用实时分词器更新每日增量训练5. 典型问题排查指南问题一生成结果重复率高检查多样性正则项权重建议0.1-0.3验证温度采样策略是否生效分析用户历史序列是否过于集中问题二长尾商品曝光不足调整课程学习的阶段过渡节奏在损失函数中添加逆频率加权检查分词器是否过度拆分长尾商品名问题三推理速度慢将LSH桶数从默认64增至128启用TensorRT加速Transformer层对低频用户采用缓存策略一个实际案例某视频平台部署ETEGRec后发现动漫类推荐质量下降。根本原因是日语片假名被拆分为单个字符。解决方案是在预训练时添加动漫标题语料并设置片假名保护规则。