最近开始了一个用户画像项目,真的是满满的“坑”。你一定想问,不就是一个用户画像吗,会这么讨厌吗?现在可能需要把它分解成几个问题来做这个项目。
什么是用户画像?
用户画像又称人群画像,是从用户人口统计信息(自身属性)、社交关系、偏好和消费行为中抽象出来的标签化画像。
如何制作用户画像
构建用户画像的核心工作是给用户“贴标签”。
什么是“标签”?
特定群体或物体的特征的抽象分类或概括。那么你可能会得到这样一张图片:
“标签”是根据用户的行为数据直接获得的,一部分是通过一系列算法或者规则挖掘获得的。直接获取的数据更容易理解,比如用户在网站或app上主动填写上传的数据。
严格来说,有些平台(如电商平台)会要求用户上传身份证、学生证、驾驶证、银行卡等。所以这样的数据准确率更高。
所以,毫无疑问,阿里、JD.COM、腾讯在用户基础数据的准确性上(有自己的用户识别账号,比如你的一串微信号号、淘宝账号、JD.COM账号),给百度留下了几个街区。
关于标签的准确性,你想到几家公司?是的,。。移动,。。联通和。。电信的标签系统非常准确。
为什么这么说?首先,你的信息几乎都被记录了,比如性别、年龄、居住地等用户基本信息。这时候你会想是不是只有这些东西会被记录下来。那你真的想多了,因为你用什么上网?流动。
“流量”基本可以记录你每秒访问了哪些app,访问了哪些页面,浏览了多长时间。
当然,这些信息不算什么。最妙的是,只要带上手机,手机卡大约等于一个GPS。你在哪家咖啡店喝过咖啡,住过哪家酒店,都会有标注。
未来通信基站的定位精度在5m以内(此时可以了解一下基站和通信原理)。(不敢多比较)
为什么被人像标注系统炸了?
在这里,标签按照处理过程和获取标签的方式分为三种,即事实标签、模型标签和预测标签。不同类别有不同的处理方式。可以看到下图:
事实标签:直接从原始数据中提取,如性别、年龄、常住户口、在线时间等。
模型标签:注意这里的模型指的不是机器学习模型,而是类似于品类偏好、RFM模型之类的。
预测标签:预测标签有时候会结合事实标签一起使用,比如某个用户并不会注册性别消息(没有实名制),或者说他填报了一个假的性别,这时候可以通过聚类分析,相似度计算,
看与这个用户相似的一部分人用户行为表现(这一部分人已知性别),根据这些不同的规则判断并mark该人的性别。
通过算法和数据挖掘得到的预测标签也可以这么理解:比如一个用户最近开始购买母婴类商品(比如一段的奶粉,New Baby的纸尿布),那么可以根据用户购买的频次及数量,
结合用户的年龄、性别推断是否为新妈妈/爸爸。实际上就是通过用户行为构建特征工程,然后做预测。
看这么一说感觉很好理解,但实际这些工作却是最耗时耗力的,有时候因为一个逻辑错误可能就需要从新计算ETL脚本作业,不断推翻重来,不断踩坑在爬坑的过程。但这又是一个非常重要的任务,
不管是后面的精准营销亦或是个性化推荐,第一步都是需要有一个完整、准确的用户画像标签体系,最后与业务线对接做验证再调整现有的标签体系形成完美的闭环。
最后说一句,上面的这些工作不是Python能解决的。等真正做一些可视化的用户画像工作或是搭建相关的机器学习算法模型是需要利用已经计算好的各类标签表再开发相应的Python脚本再到线上部署。
所以说一个好的分析师或者算法工程师绝不是“张口闭口数据科学,你竟然连HQL都不会”。
总结:本文只是个人项目工作学习的一个思维过程,会存在一些问题,希望大家多指教讨论。也希望每个人脚踏实地,做好每一次你眼中不起眼的基础工作,如果你把自己分析定位成取数的,那你就是个取数的,
如果你把你的分析理解了为什么,那你就是分析师,不可获缺的分析师。
标题:对用户画像标签体系的一点思考
链接:https://www.52hkw.com/news/rj/70325.html
版权:文章转载自网络,如有侵权,请联系删除!