第404章三道防线
第404章三道防线(第4/9页)
单超出了咱们承诺的时效,该赔客户多少钱,系统自动打进账户,一分钱都不许赖!”
“把这块招牌给我立死在京城的土地上。”
“等过几天,全天下的网民被淘宝的慢递折磨得受不了的时候,他们自然会明白,谁才是真正把他们当人看的平台!”
“是!”
调度室内,高管们齐声应诺。
阳城,辰希大厦董事长办公室。
林辰坐在宽大的实木办公桌后,张栋坐他对面的椅子上,手里拿着一份刚刚装订好的后台监控日报。
办公桌上的笔记本电脑屏幕,正连线着来自京城中关村的高清视频会议画面。
画面的一头,是脸色略显疲态的周博士。
张栋翻开手里的报表,汇报道:“用户在新发现里的停留时长,已经增长到了十五分钟。”
顿了顿,张栋有些苦涩的道:“但大家心里都清楚,这全是用真金白银买回来的时间。”
“但是!”
张栋话题一转道:“这也带来了弊端,很多用户之所以能在里面滑上十几分钟,纯粹是为了让右上角那个小圆圈多转两圈,好多刷点钱。”
“所以,他们根本不看内容,只是机械地在屏幕上隔几秒划一下,甚至有人把手机放在桌上,用手指胡乱扒拉。”
“这种行为,给我们的后台制造了大量的噪声数据。”
视频那一头的周博士接过了话茬,神色严肃地向林辰汇报了这个客观现实。
“林总,现在业界处理大规模数据,主要依赖的还是基于cpu集群的hadoop批处理架构,我们现在的机器算力,只能支持每天夜间跑一次离线数据计算,根本做不到毫秒级的实时特征更新。”
“算法模型方面,我们采用的协同过滤、矩阵分解和tf-idf关键词提取,本质上还是基于统计学概率的粗颗粒度匹配,跟真正意义上的懂人心还是有很大的差距的。”
“在实际推送中,由于缺乏深度的语义理解能力,系统现在表现得很僵硬。”
“比如一个用户偶尔好奇点开了一篇讲怎么修车的文章,或者为了赚金币在里面多停了五秒钟。我们的离线模型晚上跑完数据,第二天就会判定他对修车感兴趣,一股脑地给他推七八篇这种类型的内容。”
“这种推送是缺乏准确度的,甚至经常引起用户在评论区里抱怨,说推荐的内容翻来覆去就那么几样,像个复读机。”
“而且因为大家为了赚金币乱点一气,很多原本不爱看这些内容的人也被算法打上了混乱的标签,导致冷启动阶段的模型收敛速度比我们预期的要慢得多。”
“按现在的开发进度,我们至少需要两三个月的时间去清洗掉这些为了金币而产生的垃圾滑动数据,短期内,算法只能作为一个辅助的
(本章未完,请点击下一页继续阅读)