推荐系统赛题理解

飞熊 • 2023年9月30日下午8:17 • 技术随笔 • 阅读 139

根据赛题简介，我们首先要明确我们此次比赛的目标：根据用户历史浏览点击新闻的数据信息预测用户最后一次点击的新闻文章。从这个目标上看，会发现此次比赛和我们之前遇到的普通的结构化比赛不太一样，主要有两点：

首先是目标上，要预测最后一次点击的新闻文章，也就是我们给用户推荐的是新闻文章，并不是像之前那种预测一个数或者预测数据哪一类那样的问题
数据上，通过给出的数据我们会发现，这种数据也不是我们之前遇到的那种特征+标签的数据，而是基于了真实的业务场景，拿到的用户的点击日志
所以拿到这个题目，我们的思考方向就是结合我们的目标，把该预测问题转成一个监督学习的问题(特征+标签)，然后我们才能进行ML，DL等建模预测。那么我们自然而然的就应该在心里会有这么几个问题：如何转成一个监督学习问题呢？转成一个什么样的监督学习问题呢？我们能利用的特征又有哪些呢？又有哪些模型可以尝试呢？此次面对数万级别的文章推荐，我们又有哪些策略呢？

当然这些问题不会在我们刚看到赛题之后就一下出来答案，但是只要有了问题之后，我们就能想办法解决问题了，比如上面的第二个问题，转成一个什么样的监督学习问题？由于我们是预测用户最后一次点击的新闻文章，从36万篇文章中预测某一篇的话我们首先可能会想到这可能是一个多分类的问题(36万类里面选1)，但是如此庞大的分类问题，我们做起来可能比较困难，那么能不能转化一下？既然是要预测最后一次点击的文章，那么如果我们能预测出某个用户最后一次对于某一篇文章会进行点击的概率，是不是就间接性的解决了这个问题呢？概率最大的那篇文章不就是用户最后一次可能点击的新闻文章吗？这样就把原问题变成了一个点击率预测的问题(用户, 文章) –> 点击的概率(软分类)，而这个问题，就是我们所熟悉的监督学习领域分类问题了，这样我们后面建模的时候，对于模型的选择就基本上有大致方向了，比如最简单的逻辑回归模型。

这样，我们对于该赛题的解决方案应该有了一个大致的解决思路，要先转成一个分类问题来做，而分类的标签就是用户是否会点击某篇文章，分类问题的特征中会有用户和文章，我们要训练一个分类模型，对某用户最后一次点击某篇文章的概率进行预测。那么又会有几个问题：如何转成监督学习问题？训练集和测试集怎么制作？我们又能利用哪些特征？我们又可以尝试哪些模型？面对36万篇文章， 20多万用户的推荐，我们又有哪些策略来缩减问题的规模？如何进行最后的预测？

文章由极客之音整理，本文链接：https://www.bmabk.com/index.php/post/165181.html

推荐系统赛题理解

相关推荐

发表回复

分享到: