搜索引擎 - 京东个性化召回DPSR模型

搜索引擎 - 京东个性化召回DPSR模型

作者: nlpming | 来源:发表于2021-09-30 00:12 被阅读0次

搜索引擎 - 京东个性化召回DPSR模型
召回
淘宝首页推荐算法（读后感）
一次内存泄露问题排查
召回 & 精排
个性化推荐系统（八）--- 机器学习深度学习召回集扩量
推荐系统精品文章
推荐系统-召回
个性化推荐算法
2019-12-25推荐总结

简介

当前电商搜索系统面临的两个主要挑战如下：（1）文本不匹配，语义匹配的商品召回；（2）召回结果的个性化； 本文为了解决这两个问题，提出了DPSR（Deep Personalized and Semantic Retrieval）模型。DPSR主要作用于检索的召回层，使得召回结果更加个性化并且能够召回具有语义匹配的商品。最终AB实验发现，能够提升1.29%的转化率，并且对于长尾Query提升的更多约10.03%的转化率。

电商搜索系统简介

电商搜索系统大致分为以下几个模块：
（0）离线商品库建设、及倒排索引的建立。
（1）Query Processing(QP模块)：主要包括分词、拼写纠错、查询改写等；
（2）Candidate Retrieval(候选集召回)：基于离线建立的倒排索引，从几千万个商品中召回几百至上千的商品。用于减少整体服务耗时。
（3）Ranking(排序模块)：用于对召回的结果进行排序，可以经过多层排序包括粗排、精排、重排等阶段。

电商搜索系统大致框架.png

淘宝搜索引擎架构.png

相关工作

传统的检索模型比如LSI, PLSI等都是监督式的模型，通过词语的共现关系及矩阵分解，学习词和Doc的embedding；采用的是一种非监督式的学习方法。DSSM, CDSSM是早期使用神经网络做语义匹配的模型。这些模型直接用于排序阶段，本文提出的模型是用于召回阶段。双塔模型广泛被用于推荐系统的召回过程，本文提出的DPSR模型也是一个双塔模型，在前面的模型基础上进行改进。

DPSR模型结构

DPSR模型主要分为以下几个模块：（1）Offline Model Training [离线模型训练]；（2）Offline Indexing [离线item embedding索引建立]；（3）Online Serving [在线服务]；

DPSR模块划分.png

DPSR模型主要技术点

1. 双塔模型结构

DPSR模型是一个典型的双塔模型，由Query塔 $Q$ 和Item塔 $S$ 组成；对于一个给定的query $q$ ，和item $s$ ，一个经典的双塔模型的输出得分 $f(q,s)$ 如下。 $Q(q)$ 代表 $q$ 对应的embedding向量， $S(s)$ 代表物品 $s$ 对应的embedding向量。通常 $G$ 函数采用的是简单的内积操作，即 $G(Q(q), S(s)) = Q(q)^TS(s)$ ；
$f(q, s) = G \left( Q(q), S(s) \right)$
双塔模型这样的设计，可以使得Query embedding和Item embedding计算独立开来。离线可以计算得到所有Item embedding然后建立索引，在线动态计算用户输入的Query embedding，然后通过最近邻搜索算法找到最近邻的TopK个Item。注意：测试的时候每个头的Query embedding都去召回固定数量的item，然后通过Query embedding, Item embedding的内积对所有的召回结果进行排序和截断。

2. Query塔的多头机制

从论文中图3可以看出，通过User Profile, User History Events, Query Tokens embedding得到一个大的embedding之后，经过 $k$ 次投影得到 $k$ 个不同的embedding然后经过三个激活函数为Relu的MLP层，再经过归一化得到最终的Query embedding。因为有 $k$ 个不同的头，所以会得到 $k$ 个Query embedding；
通过多头的Query embedding，能够学到Query不同的意图；比如同一个Query的不同语义（例如苹果）、同一个query的不同品牌（例如手机）、同一个brand的不同产品（例如三星）；

3. 损失函数优化

假设总共有 $m$ 个头，每个头得到的Query embedding为 $\left( e_1, e_2, ..., e_m \right)$ ，其中 $e_i \in \mathbb{R}^d$ ；item embedding为 $g$ ，其维度为 $\mathbb{R}^d$ 。
$G(Q(q), S(s)) = \sum_{i=1}^{m} w_i e_i^Tg$
权重 $w_i$ 的计算公式如下，使用一个softmax函数得到。下式中参数 $\beta$ 为softmax函数的温控因子。 $\beta$ 的取值越大，输出结果越平滑。
$w_i = \frac{ exp(e_i^Tg/\beta) }{ \sum_{j=1}^{m} exp(e_j^Tg/\beta) }$
最终训练集是一个三元组的形式，包含输入的Query，正样本 $s_i^+$ ，负样本 $s_j^-$

DPSR训练集.png
损失函数采用的是hinge loss，具体公式如下。其中 $\delta$ 是一个固定的边界值。

DPSR损失函数.png

4. 负样本的采样

本文采用了一个混合的负样本采样策略：Random Negatives和Batch Negatives两种策略。 Random Negatives随机的从整个batch中进行采样。Batch Negatives从batch中的正样本进行采样，按照item出现的频率进行采样。最终负样本集合是这两个策略的混合，通过参数 $\alpha$ 进行控制。Random Negatives样本的比例为 $\alpha$ ，Batch Negatives的样本比例为 $1-\alpha$ ；

image.png

image.png

image.png

最终，整个DPSR模型离线训练流程如下：

image.png

5. 人为反馈数据

除了使用点击数据，我们的模型还使用了一些人为反馈数据：（1）Most skipped items：对于某个Query下召回的商品，如果某个人曝光很多次都跳过了没有任何正向行为，把其作为负样本；（2）Human generated data：利用人工的一些领域知识标注的正负样本数据；（3）Human labels and bad case reports：人工标注的数据，和badcase反馈的数据；

参考文献

[京东] Towards Personalized and Semantic Retrieval: An End-to-End Solution for E-commerce Search via Embedding Learning https://arxiv.org/pdf/2006.02282.pdf
[淘宝] Embedding-based Product Retrieval in Taobao Search https://arxiv.org/pdf/2106.09297.pdf

相关文章

搜索引擎 - 京东个性化召回DPSR模型
简介当前电商搜索系统面临的两个主要挑战如下：（1）文本不匹配，语义匹配的商品召回；（2）召回结果的个性化；本文...
召回
1.推荐系统的召回2.如何理解推荐系统召回模型中的召回3.推荐系统从0到1[二]:个性化召回4.推荐系统二---召...
淘宝首页推荐算法（读后感）
淘宝首页推荐算法（读后感）业务技术简介首页个性化在算法技术上主要涉及Graph Embedding召回模型、D...
一次内存泄露问题排查
背景提要深度召回服务在浏览器个性化推荐召回阶段占着重要作用。现在基线上有n路深度召回；深度召回服务流程主要分为...
召回 & 精排
先做一个召回模型，再做一个精排模型
个性化推荐系统（八）--- 机器学习深度学习召回集扩量
个性化推荐系统评价有两个重要指标，一个是召回率一个是准确率。召回率就是：召回率=提取正确信息条数/样本中信息条数。...
推荐系统精品文章
推荐系统召回四模型之：全能的FM模型[https://zhuanlan.zhihu.com/p/58160982]...
推荐系统-召回
目前大部分算法模型资料都是针对于排序模型。对召回的讲解很好，但是召回是推荐系统重要而不可或缺的部门。置顶突然的...
个性化推荐算法
算法评估 1.个性化召回用户行为在个性化推荐系统中一般分两种——显性反馈行为（explicit feedback...
2019-12-25推荐总结
第一个问题：我们知道在个性化推荐系统里，第一个环节一般是召回阶段，而召回阶段工业界目前常规的做法是多路召回，每一路...

网友评论

本文标题：搜索引擎 - 京东个性化召回DPSR模型

本文链接：https://www.haomeiwen.com/subject/ecijnltx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

栏目导航

热点阅读

关于我们|服务条款|联系我们|搜索引擎 - 京东个性化召回DPSR模型|投稿指南|网站地图|RSS订阅|排版工具|手机版

提供经典美文摘抄,优美散文欣赏,现代诗歌精选,短篇小说,心情随笔,表白情书范文,故事会在线阅读欣赏

Copyright © 2014-2023 Haomeiwen.com All Rights Reserved. 好美文阅读网版权所有

备案信息：桂公网安备 45052102000051号 · 桂ICP备13007215号-3

本站所收录作品、热点评论等信息部分来源互联网，目的只是为了系统归纳学习和传递资讯

所有作品版权归原创作者所有，与本站立场无关，如不慎侵犯了你的权益，请联系我们告知，我们将做删除处理！