一、研究背景与问题提出
在视频推荐系统中,用户观看时长是衡量用户满意度的关键指标,精准预测观看时长对于优化推荐策略、提升用户体验至关重要。然而,观看时长作为预测目标变量,其分布存在高度不平衡的问题:短时长样本数量庞大,而长时长样本却极为稀缺。
当前主流的观看时长预测模型通常会将连续的观看时长离散化为多个区间(分桶),以此来适配其分布特性。但现有研究对于如何从连续的观看时长分布中合理划分这些离散区间缺乏深入探索,现有的离散化方法往往难以平衡学习误差与恢复误差,要么在分类学习过程中产生较大误差,要么在将分类结果还原为连续时长时出现明显偏差,这极大地限制了预测模型的性能。
二、CREAD框架核心设计
针对上述问题,论文提出了一种基于误差自适应离散化(Error-Adaptive-Discretization, EAD)的分类-恢复框架(Classification-Restoration Framework, CREAD),该框架主要包含三个核心模块:
(一)离散化模块
离散化模块是CREAD框架的创新核心。它融合了“等时”分桶和“等频”分桶的思路,通过理论分析离散化对学习误差和恢复误差的影响,动态调整分桶阈值,以实现两种误差的最优平衡。与传统的固定分桶方式不同,误差自适应离散化技术能够根据数据分布特性,在样本密集的短时长区域划分更细的区间,在样本稀疏的长时长区域划分较宽的区间,从而在保证分类任务难度适中的同时,降低后续时长恢复的误差。
(二)分类模块
分类模块采用序数回归(Ordinal Regression)的思路,将观看时长预测转化为一系列二分类问题。具体而言,模型预估的是样本观看时长大于某个分桶阈值的概率(即生存函数$\hat{\phi}i = P(y > t_i|x), i=1...M$),通过多个逻辑回归函数进行建模。这种方式相比传统的多分类(softmax)方案具有明显优势:一方面,它无需精确预估样本落在哪个具体分桶,只需判断时长是否大于某个阈值,模型学习难度更低;另一方面,通过引入序数正则化(ordinal regularization),能够强制保证预测概率的单调性,即$\hat{\phi}{m+1} \leq \hat{\phi}_m$,这不仅维持了逻辑一致性,还有效提升了对长时长(尾部)样本的预测性能。
分类模块的损失函数由三部分组成:
分类损失($L_{ce}$):对每个二分类器采用标准的交叉熵损失,确保模型能够准确学习每个分桶阈值对应的二分类任务。
恢复损失($L_{restore}$):直接惩罚时长恢复过程中的误差,论文实验表明Huber损失在处理不平衡分布时效果最佳,它对异常值的鲁棒性更强,能够有效降低长时长样本预测误差对整体模型的影响。
序数正则化损失($L_{ord}$):通过公式$L_{ord} = \sum_{m=1}^{M-1} \max(\hat{\phi}_{m+1} - \hat{\phi}_m, 0)$强制约束预测概率的单调性,避免出现逻辑矛盾的预测结果。
(三)恢复模块
恢复模块的核心任务是将分类模块输出的概率结果还原为连续的观看时长。其计算公式为: $$\hat{y} = \sum_{m=1}^{M} \hat{\phi}m (t_m - t{m-1})$$ 从数学角度可以证明,当分桶区间足够小时,该公式的计算结果能够无限逼近观看时长的真实期望。具体来说,对于随机变量$y$(观看时长),其期望$E(y|x_i)$等于生存函数$P(y>t|x_i)$在区间$[0, t_M]$上的积分,而上述求和公式正是对该积分的离散近似。当分桶间隔足够小,恢复误差也会随之趋近于零。
三、实验验证与结果
为验证CREAD框架的有效性,作者在多个数据集和部署场景下进行了全面评估:
离线实验:在公开数据集(KuaiRec、CIKM)和快手大规模工业数据集上的实验结果一致表明,CREAD框架相比当前主流模型具有显著优势。在工业数据集上,CREAD实现了18.6716的平均绝对误差(MAE),远低于此前的最优模型。
在线部署:CREAD框架已在快手APP(Kwai)全面上线,实际运行结果显示,该框架有效提升了推荐系统的用户观看时长预测精度,为优化推荐策略提供了有力支撑,最终推动了平台用户活跃度和留存率的提升。
四、总结与展望
CREAD框架通过创新的误差自适应离散化技术和分类-恢复架构,成功解决了视频推荐系统中观看时长预测面临的数据分布不平衡问题,实现了学习误差与恢复误差的有效平衡。序数回归思路的引入和序数正则化损失的设计,进一步提升了模型的学习效率和预测性能。
未来的研究可以从以下几个方向展开:一是探索如何将CREAD框架与深度学习模型(如Transformer、Graph Neural Networks)相结合,进一步挖掘数据中的复杂特征;二是研究在实时推荐场景下,如何优化CREAD框架的计算效率,以满足低延迟的预测需求;三是尝试将该框架扩展到其他具有不平衡分布特性的预测任务中,如用户点击率预测、商品销量预测等。