关于腾讯算法大赛

频道:社交专题 日期: 浏览:37

腾讯算法大赛

本文参考于我协会

面向高校大学生的算法大赛,是腾讯社交广告高校算法大赛,腾讯社交广告作为腾讯核心的广告业务单元,它通过深入分析海量社交数据,构建多样广告场景,还与8亿用户连接对话,在大数据、机器学习领域持续创新投入爱游戏最新官网登录入口,以此驱动社交广告生态发展,本次大赛旨在开放腾讯在社交和数字广告领域的真实数据,面向高校学生征集最智慧的算法解决方案 。

见详细赛题,记得也要看完 FAQ,其中也涵盖有许许多多很重要信息句号。

赛题存在着不容易被理解的状况,其缘由在于赛题是归属于广告学这一领域。要是确实存在对赛题极其难于进行理解的情况,那么可以先去瞧瞧这一篇文章,而后看完之后再一次去阅读赛题,如此一来就会变得明白通畅许多 。

官方不再关闭那份数据的下载通道,然从前已备份至百度云,于此处提供与大家。

赛题要求

官方要提供处于17天至30天这个时间段内关于移动APP的广告状况,还要提供用户的转化情形,以及与之相关的上下文内容,依据这些数据来预测第31天中指定某个用户和与之对应的广告所具备的转化率。

评估方式 (赛题中提供的计算公式)

借助Logarithmic Loss来进行评估,且该评估是越小越好,其公式如下:

其中,

N是测试样本总数,

yi是二值变量,取值0或1,表示第i个样本的label,

pi为模型预测第i个样本 label为1的概率。

示例代码(Python语言实现):

腾讯社交广告高校算法大赛_腾讯社交广告算法大赛解析_腾讯社交广告算法比赛

项目目的

先是拿来剖析一位在大赛里斩获第64名佳绩的大牛所做的分享,还要对他给出的代码去尽力理解并细致分析,而重中之重着重放在特征工程这方面。

机器学习的主要流程

腾讯社交广告算法比赛_腾讯社交广告算法大赛解析_腾讯社交广告高校算法大赛

机器学习流程

数据分析和清洗方法

腾讯社交广告算法大赛解析_腾讯社交广告算法比赛_腾讯社交广告高校算法大赛

关于数据分析,阅读FAQ可知:

App的激活被界定为,用户于下载之后启动了此App,这也就意味着产生了激活行为。从用户点击广告开始,一直到广告系统知晓用户激活了App(要是存在这种状况的话),一般而言会存在较长的时间间隔,主要是由如下两方面原因所引发的:

1) 用户可能在下载之后过了很久才启动App;

第一,用户启动App这一行为是需要广告主进行上报的。第二,上报之后还要回传至广告系统。第三,通常而言,这整个过程是会存在一定延时情况的。

此处回流时间,所呈现的是广告主向广告系统上报App激活数据的那个时间,而回流时间超出5天的数据,将会被系统予以忽略 。

需要留意的是,此次竞赛所提供的训练数据是以截止到第31天0点的广告日志为准的,所以,针对最后几天的训练数据来看,某些显示label=0的情况并非足够精准爱游戏app官方网站登录入口,也许广告系统将会在第31天之后才知晓label实际上是为1的。

某些app和用户的记录比较少

最后几天有部分数据不准确

对于这个有问题的情况,在这里运用了较为蛮横的行动方式,将临近那几日有可能面临疑难的一些数据给消除掉,。

特征工程

在数据领域中,特征工程指的是,依据基础的数据,提取出更多具备用处的数据;之后,将这些提取的数据,与基本特征相结合,进而,挑选出最终用以决定需要采用训练的特征数据;通常情况下,特征工程对最终预测的效果起着决定性的作用。

官方提供数据表,其中有基本数据描述,对于此,要好好理解每个字段作用,这里不再赘述数据字段 。

先在此着重说明一下,在完成特征工程之后,我们获取到了更多的特征,然而并非每一个特征对于模型的训练都具备效用,所以我们要对特征展开筛选,这种筛选不只是单方面的取舍行为,还得依据重要程度来进行权重的分配爱游戏app入口官网首页,。

通过数据分析,计划以下的特征作为最终的训练数据标签

首先是基础特征,它包含计数特征,还有转化率,以及比例特征等各类基本的特征,这些特征里有各种ID 。

2. 用户当日行为特性:依据当日数据所统计得出的,关于用户行为,以及 app 行为的种种特性 。

3.关于用户历史行为特征的情况如下,通过word2vec这种方式,来计算用户行为与历史行为之间的关联 。

1. 基础特征

基础特征是腾讯官方所提供的数据,是各种各样的ID标签,把一些没有用处的标签去除掉就行,不必要。

要作过多的处理

2、3 用户行为特征的处理

对用户行为特征进行处理的逻辑,是整个项目里最为繁杂琐碎的操作,其较为复杂,很难理清其中的逻辑关系,是很繁琐的。

清,建议通过源码来理解

网友留言(0)

评论

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。