第404章三道防線
第404章三道防線(第4/9頁)
單超出了咱們承諾的時效,該賠客戶多少錢,係統自動打進賬戶,一分錢都不許賴!”
“把這塊招牌給我立死在京城的土地上。”
“等過幾天,全天下的網民被淘寶的慢遞折磨得受不了的時候,他們自然會明白,誰才是真正把他們當人看的平臺!”
“是!”
調度室內,高管們齊聲應諾。
陽城,辰希大廈董事長辦公室。
林辰坐在寬大的實木辦公桌後,張棟坐他對麵的椅子上,手裡拿著一份剛剛裝訂好的後臺監控日報。
辦公桌上的筆記本電腦屏幕,正連線著來自京城中關村的高清視頻會議畫麵。
畫麵的一頭,是臉色略顯疲態的周博士。
張棟翻開手裡的報表,彙報道:“用戶在新發現裡的停留時長,已經增長到了十五分鐘。”
頓了頓,張棟有些苦澀的道:“但大家心裡都清楚,這全是用真金白銀買回來的時間。”
“但是!”
張棟話題一轉道:“這也帶來了弊端,很多用戶之所以能在裡麵滑上十幾分鐘,純粹是為了讓右上角那個小圓圈多轉兩圈,好多刷點錢。”
“所以,他們根本不看內容,隻是機械地在屏幕上隔幾秒劃一下,甚至有人把手機放在桌上,用手指胡亂扒拉。”
“這種行為,給我們的後臺製造了大量的噪聲數據。”
視頻那一頭的周博士接過了話茬,神色嚴肅地向林辰彙報了這個客觀現實。
“林總,現在業界處理大規模數據,主要依賴的還是基於cpu集群的hadoop批處理架構,我們現在的機器算力,隻能支持每天夜間跑一次離線數據計算,根本做不到毫秒級的實時特征更新。”
“算法模型方麵,我們采用的協同過濾、矩陣分解和tf-idf關鍵詞提取,本質上還是基於統計學概率的粗顆粒度匹配,跟真正意義上的懂人心還是有很大的差距的。”
“在實際推送中,由於缺乏深度的語義理解能力,係統現在表現得很僵硬。”
“比如一個用戶偶爾好奇點開了一篇講怎麼修車的文章,或者為了賺金幣在裡麵多停了五秒鐘。我們的離線模型晚上跑完數據,第二天就會判定他對修車感興趣,一股腦地給他推七八篇這種類型的內容。”
“這種推送是缺乏準確度的,甚至經常引起用戶在評論區裡抱怨,說推薦的內容翻來覆去就那麼幾樣,像個複讀機。”
“而且因為大家為了賺金幣亂點一氣,很多原本不愛看這些內容的人也被算法打上了混亂的標簽,導致冷啟動階段的模型收斂速度比我們預期的要慢得多。”
“按現在的開發進度,我們至少需要兩三個月的時間去清洗掉這些為了金幣而產生的垃圾滑動數據,短期內,算法隻能作為一個輔助的
(本章未完,請點擊下一頁繼續閱讀)