• 为了保证你在浏览本网站时有着更好的体验,建议使用类似Chrome、Firefox之类的浏览器~~
    • 如果你喜欢本站的内容何不Ctrl+D收藏一下呢,与大家一起分享各种编程知识~
    • 本网站研究机器学习、计算机视觉、模式识别~当然不局限于此,生命在于折腾,何不年轻时多折腾一下

ESMM模型CVR预估

AD admin 5个月前 (06-28) 534次浏览 0个评论 扫描二维码

这个文章阿里妈妈最近公开的,但是这个算法在 MTL 领域应该大家都已经使用,只是没人公布出来,如果你多看看 MTL 的文章就会发现这篇文章其实没有什么太大的创新,但是既然论文发表出来了并且在工业实践上取得了很好的成绩,所以还是值得肯定的。

核心的要点两个方面:权值共享与完备空间

这个网络的有一个很好的地方就是子网络可以自由的去定义,可以根据实际的调参情况确定最终符合业务的网络。

在诸如信息检索、推荐系统、在线广告投放系统等工业级的应用中准确预估转化率(post-click conversion rate,CVR)是至关重要的。例如,在电商平台的推荐系统中,最大化场景商品交易总额(GMV)是平台的重要目标之一,而 GMV 可以拆解为流量×点击率×转化率×客单价,可见转化率是优化目标的重要因子;从用户体验的角度来说准确预估的转换率被用来平衡用户的点击偏好与购买偏好。

阿里妈妈算法团队最近发表了一篇关于 CVR 预估的论文《Entire Space Multi-Task Model: An Effective Approach for Estimating Post-Click Conversion Rate》,提出了一种新颖的 CVR 预估模型,称之为“完整空间多任务模型”(Entire Space Multi-Task Model,ESMM),下文简称为 ESMM 模型。ESMM 模型创新地利用用户行为序列数据,在完整的样本数据空间同时学习点击率和转化率(post-view clickthrough&conversion rate,CTCVR),解决了传统 CVR 预估模型难以克服的样本选择偏差(sample selection bias)和训练数据过于稀疏(data sparsity )的问题。

以电子商务平台为例,用户在观察到系统展现的推荐商品列表后,可能会点击自己感兴趣的商品,进而产生购买行为。换句话说,用户行为遵循一定的顺序决策模式:impression → click → conversion。CVR 模型旨在预估用户在观察到曝光商品进而点击到商品详情页之后购买此商品的概率,即 pCVR = p(conversion|click,impression)。

假设训练数据集为[公式],其中的样本[公式]是从域[公式]中按照某种分布采样得到的,[公式]是特征空间, [公式]和 [公式] 是标签空间, [公式]为数据集中的样本总数量。在 CVR 预估任务中, [公式]是高维稀疏多域的特征向量, [公式][公式]的取值为 0 或 1,分别表示是否点击和是否购买。[公式] 揭示了用户行为的顺序性,即点击事情一般发生在购买事件之前。CVR 模型的目标是预估条件概率 pCVR ,与其相关的两个概率为点击率 pCTR 和点击且转换率 pCTCVR ,它们之间的关系如下:

传统的 CVR 预估任务通常采用类似于 CTR 预估的技术,比如最近很流行的深度学习模型。然而,有别于 CTR 预估任务,CVR 预估任务面临一些特有的挑战:1) 样本选择偏差;2) 训练数据稀疏;3) 延迟反馈等。

图 1. 训练样本空间

延迟反馈的问题不在本文讨论的范围内,下面简单介绍一下样本选择偏差与训练数据稀疏的问题。如图 1 所示,最外面的大椭圆为整个样本空间[公式],其中有点击事件( [公式] )的样本组成的集合为[公式],对应图中的阴影区域,传统的 CVR 模型就是用此集合中的样本来训练的,同时训练好的模型又需要在整个样本空间做预测推断。由于点击事件相对于展现事件来说要少很多,因此[公式]只是样本空间[公式]的一个很小的子集,从[公式]上提取的特征相对于从[公式]中提取的特征而言是有偏的,甚至是很不相同。从而,按这种方法构建的训练样本集相当于是从一个与真实分布不完全一致的分布中采样得到的,这一定程度上违背了机器学习算法之所以有效的前提:训练样本与测试样本必须独立地采样自同一个分布,即独立同分布的假设。总结一下,训练样本从整体样本空间的一个较小子集中提取,而训练得到的模型却需要对整个样本空间中的样本做推断预测的现象称之为样本选择偏差。样本选择偏差会伤害学到的模型的泛化性能。

推荐系统展现给用户的商品数量要远远大于被用户点击的商品数量,同时有点击行为的用户也仅仅只占所有用户的一小部分,因此有点击行为的样本空间 [公式] 相对于整个样本空间[公式]来说是很小的,通常来讲,量级要少 1~3 个数量级。如表 1 所示,在淘宝公开的训练数据集上,[公式]只占整个样本空间[公式]的 4%。这就是所谓的训练数据稀疏的问题,高度稀疏的训练数据使得模型的学习变得相当困难。

阿里妈妈的算法同学提出的 ESMM 模型借鉴了多任务学习的思路,引入了两个辅助的学习任务,分别用来拟合 pCTR 和 pCTCVR,从而同时消除了上文提到的两个挑战。ESMM 模型能够充分利用用户行为的顺序性模式,其模型架构如图 2 所示。

图 2. ESMM 模型

整体来看,对于一个给定的展现,ESMM 模型能够同时输出预估的 pCTR、pCVR 和 pCTCVR。它主要由两个子神经网络组成,左边的子网络用来拟合 pCVR ,右边的子网络用来拟合 pCTR。两个子网络的结构是完全相同的,这里把子网络命名为 BASE 模型。两个子网络的输出结果相乘之后即得到 pCTCVR,并作为整个任务的输出。

需要强调的是,ESMM 模型有两个主要的特点,使其区别于传统的 CVR 预估模型,分别阐述如下。

  • 在整个样本空间建模。由下面的等式可以看出,pCVR 可以在先估计出 pCTR 和 pCTCVR 之后推导出来。从原理上来说,相当于分别单独训练两个模型拟合出 pCTR 和 pCTCVR,再通过 pCTCVR 除以 pCTR 得到最终的拟合目标 pCVR 。

但是,由于 pCTR 通常很小,除以一个很小的浮点数容易引起数组不稳定问题(计算内存溢出)。所以 ESMM 模型采用了乘法的形式,而没有采用除法形式。
pCTR 和 pCTCVR 是 ESMM 模型需要估计的两个主要因子,而且是在整个样本空间上建模得到的,pCVR 只是一个中间变量。由此可见,ESMM 模型是在整个样本空间建模,而不像传统 CVR 预估模型那样只在点击样本空间建模。

  • 共享特征表示。ESMM 模型借鉴迁移学习的思路,在两个子网络的 embedding 层共享 embedding 向量(特征表示)词典。网络的 embedding 层把大规模稀疏的输入数据映射到低维的表示向量,该层的参数占了整个网络参数的绝大部分,需要大量的训练样本才能充分学习得到。由于 CTR 任务的训练样本量要大大超过 CVR 任务的训练样本量,ESMM 模型中特征表示共享的机制能够使得 CVR 子任务也能够从只有展现没有点击的样本中学习,从而能够极大地有利于缓解训练数据稀疏性问题。

需要补充说明的是,ESMM 模型的损失函数由两部分组成,对应于 pCTR 和 pCTCVR 两个子任务,其形式如下:

其中, [公式] 和[公式]分别是 CTR 网络和 CVR 网络的参数,[公式]是交叉熵损失函数。在 CTR 任务中,有点击行为的展现事件构成的样本标记为正样本,没有点击行为发生的展现事件标记为负样本;在 CTCVR 任务中,同时有点击和购买行为的展现事件标记为正样本,否则标记为负样本。

由于 ESMM 模型创新性地利用了用户的序列行为做完模型的训练样本,因此并没有公开的数据集可供测试,阿里的技术同学从淘宝的日志中采样了一部分数据,作为公开的测试集,下载地址为:tianchi.aliyun.com/data。阿里妈妈的工程师们分别在公开的数据集和淘宝生产环境的数据集上做了测试,相对于其他几个主流的竞争模型,都取得了更好的性能。

表 2 是在公开数据集上的不同算法 AUC 效果对比情况,其中 BASE 模型是 ESMM 模型中左边的子神经网络模型,由于其只在点击样本空间训练,会遭遇样本选择偏差和数据稀疏的问题,因为效果也是较差的。DIVISION 模型是先分别训练出拟合 CTR 和 CTCVR 的模型,再拿 CTCVR 模型的预测结果除以 CTR 模型的预测结果得到对 CVR 模型的预估。ESMM-NS 模型是 ESMM 模型的一个变种模型,其在 ESMM 模型的基础上去掉了特征表示共享的机制。AMAN、OVERSAMPLING、UNBIAS 是三个竞争模型。

图 3.在淘宝生产环境数据集上几种不同算法的性能测试对比

图 3 是 ESMM 模型在淘宝生产环境数据集上的测试效果对比。相对于 BASE 模型,ESMM 模型在 CVR 任务中 AUC 指标提升了 2.18%,在 CTCVR 任务中 AUC 指标提升了 2.32%。通常 AUC 指标提升 0.1%就可认为是一个显著的改进。

综上所述,ESMM 模型是一个新颖的 CVR 预估方法,其首创了利用用户行为序列数据在完整样本空间建模,避免了传统 CVR 模型经常遭遇的样本选择偏差和训练数据稀疏的问题,取得了显著的效果。另一方面,ESMM 模型的贡献在于其提出的利用学习 CTR 和 CTCVR 的辅助任务,迂回地学习 CVR 的思路。ESMM 模型中的 BASE 子网络可以替换为任意的学习模型,因此 ESMM 的框架可以非常容易地和其他学习模型集成,从而吸收其他学习模型的优势,进一步提升学习效果,想象空间巨大。

原文链接:arxiv.org/abs/1804.0793


Deeplearn, 版权所有丨如未注明 , 均为原创丨本网站采用BY-NC-SA协议进行授权 , 转载请注明ESMM 模型 CVR 预估
喜欢 (0)
admin
关于作者:
互联网行业码农一枚/业余铲屎官/数码影音爱好者/二次元

您必须 登录 才能发表评论!