山大软院22级项目实训-- 粗排模型——跨模态融合网络与工业级并行训练

原创

已于 2025-06-13 22:07:36 修改 · 147 阅读

标签

于 2025-05-22 20:28:31 首次发布

在整个两阶段排序流水线中，我把 AlignRec 定位为“粗排核心”的最大理由，并不只是它在论文里展示的指标优势，而是它天生具备一种 “三重对齐—深浅兼顾” 的哲学：一方面，它用跨模态编码器把视觉与文本细节拉进同一表征空间，确保图文内容与商品 ID 内部语义高度贴合；另一方面，它又保留了与传统协同过滤兼容的 ID 嵌入，让“用户-物品交互”的信号能够与多模态语义在高维空间对齐而不是相互掣肘。对粗排来说，这种设计恰好满足“既要高速召回，又要语义容错”的双重要求：你只需在在线阶段快速计算用户端向量与海量商品端向量的点积，就能把 Top-500 乃至 Top-1000 的候选毫不遗漏地推给下游；同时，AlignRec 在离线训练时已经通过对齐损失把模态噪声做了“压缩记忆”，因此即便遇到图片模糊、标题缺字或新上架长尾商品，也不会像纯 ID 模型那样召回全空，更不会像纯内容模型那样把点击噪声当作金科玉律。

再谈结构层面：AlignRec 可以被视作“双塔模型的进化形态”。商品塔里，视觉子塔通常使用 CLIP-ViT 或 Swin 的中间层作为初始特征，再经过一到两层轻量自注意力捕捉局部纹理；文本子塔把标题、属性词和短描述输入 BERT-CLS 或 MPNet，然后通过门控机制与视觉特征融合。随后是模型的“灵魂”——Alignment Head。论文里的做法是同时扔进三种对齐损失：图片-文本 intra-item 对齐，模态向量与商品 ID 嵌入的 content-ID 对齐，以及用户历史行为序列与内容向量的 user-item 对齐。这三个损失在梯度回传时像三股水流互相渗透，逐渐把不同模态的高频与低频语义压缩到同一尺度。最终生成的商品向量尺寸往往被控制在 128 或 256 维——既足够表达跨模态细

最低0.47元/天解锁文章