第4章初步整理
第4章初步整理(第3/5頁)
規則記錄、問題記錄、輸出數據。
他先不急著處理,而是花了一個多小時,把所有u盤裡的文件大致瀏覽了一遍,記下每個文件的大小、大概行數列數、可能的關聯字段。在筆記本上畫了一個簡單的關係圖。然後,他開始嘗試整理那些混亂的字段名。對照著天晟之前給過的零星文檔(在公共盤某個角落找到的),以及李濤發來的參考說明,他逐一猜測、標註那些意義不明的列名。這個過程很慢,需要不斷的搜索、比對、推測。遇到實在不確定的,他在問題記錄文件裡標紅,記下文件名和列名。
下午快下班時,王海又晃了過來,站在他身後,看著他的屏幕。
“怎麼樣了?有頭緒冇?”
“正在梳理字段,原始數據比較亂,很多列名需要確認。”陳默頭也冇回,眼睛盯著屏幕上一行行數據。
“嗯,亂是肯定的。抓大放小,先把能確定的、重要的字段理出來。那些邊緣的、實在搞不清的,可以先放放,或者統一歸到一個‘其他信息’字段裡,彆耽誤太多時間在細節上。”王海的聲音從頭頂傳來,“關鍵是快。趙總那邊等著看方向。”
“明白。”陳默說。他手指在鍵盤上停頓了一下,然後繼續敲打。他把一個標註為“可能需要業務確認”的字段,移到了“待定-低優先級”的分類下。
“行,你繼續。下班前給我個初步進展簡報,幾句話就行,說說目前進度和預計完成時間。”王海說完,走了。
陳默看了一眼電腦右下角的時間。繼續埋頭在數據裡。
接下來兩天,陳默幾乎把自己釘在了工位上。除了上廁所和接水,很少離開。他按照清洗規則,編寫腳本處理批量問題:統一日期格式,將文本型數字轉換為數值型,處理明顯的異常值(比如年齡為200歲,金額為負值)。對於缺失值,他根據字段性質,謹慎地選擇填充方法,或者標記為缺失,並在記錄文件裡說明。去重時,他設定了幾個關鍵字段組合作為唯一標識,刪除了大量完全重複的記錄,但對於部分字段相同、部分字段不同的疑似重複記錄,他單獨拎出來,做了個待核查清單。
第三天下午,他遇到了一個棘手的問題。在核心的交易流水文件裡,有一個關鍵字段“交易類型編碼”,按照天晟給過的一份老舊編碼表,應該是幾位數字,對應不同的業務類型。但陳默發現,實際數據中混入了大量字母和特殊字符,甚至有些編碼在給出的碼表裡根本不存在。他檢查了數據來源,發現這個文件似乎是多個子係統導出的結果合並的,編碼規則可能不統一。
他停下腳本,在問題記錄裡詳細描述了這個問題,並截圖了異常編碼的樣本。這已經不是簡單的清洗
(本章未完,請點擊下一頁繼續閱讀)