
數據科學場景設計Data-Science-For-Beginners 第一課作業的系統化完成指南【免費下載鏈接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!項目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本篇指南圍繞 Data-Science-For-Beginners 課程第一課Defining Data Science的課后作業展開帶你系統化掌握從真實業務問題出發用數據科學流程設計完整解決方案的四問框架采集什么數據、如何采集、如何存儲、能得出什么洞察與決策。文章將結合倉庫內的課程講義、示例解答與配套代碼逐一拆解教育、疫苗接種、工作效率三個問題域并給出可直接套用的表格模板、評分標準解讀與自檢清單幫助你完成一份達到 Exemplary 水準的作業。作業定位為什么第一課就要做場景設計這份作業位于 translations/en/1-Introduction/01-defining-data-science/assignment.md與英文原版 1-Introduction/01-defining-data-science/assignment.md 內容一致是課程的第一份作業。它的目的不是考代碼而是訓練數據科學思維在動手分析之前先想清楚一個業務問題能不能被數據改進、應該怎么改進。這與 第一課課程講義 中定義的數據科學核心理念一脈相承——數據科學是用科學方法從結構化與非結構化數據中提取知識并將其轉化為**可執行的洞察actionable insights**的過程。講義把數據的旅程劃分為五個步驟數據采集Data Acquisition收集數據例如來自 IoT 傳感器的數據量大通常需要經過緩沖端點統一接入數據存儲Data Storage根據未來查詢方式選擇存儲方案數據處理Data Processing把原始數據轉換為可用于可視化或模型訓練的形態可視化 / 人工洞察Visualization / Human Insights通過圖表與統計手段發現關系訓練預測模型Training a Predictive Model用機器學習構建預測能力。作業里的四個問題正是讓你把數據旅程倒過來推演從想要達成的決策出發反推需要什么數據、從哪來、怎么存。用數據科學改進業務流程本質上始于把業務過程數字化digitalization進而用數據驅動決策實現數字化轉型digital transformation——作業要求你為每個問題域完整描述這條鏈路。核心框架拆解作業的四個關鍵問題作業要求針對每個問題域回答以下四個問題這是整份作業的骨架1. 可以采集什么數據需要區分數據的不同類型。參考 定義數據一課 的分類方法定量數據Quantitative數值型觀測可測量、可做數學運算如學生的出勤次數、疫苗接種劑次、完成任務耗時定性數據Qualitative / Categorical描述質量的主觀數據如學生對課程的評論、疫苗不良反應類型、工作任務的優先級結構化 / 半結構化 / 非結構化表格、CSV、JSON、文本、圖像、視頻等形態差異會直接影響存儲方案。回答采集什么時建議同時標注數據類型這決定了后續存儲和處理的復雜度。2. 如何采集講義列舉了典型數據源IoT 傳感器、用戶調查問卷、行為分析、文本、圖像/視頻、Web 服務器日志、社交網絡圖等。判斷采集方式的可行性時要同時考慮成本與倫理——課程還專門設有 數據科學倫理一課涉及隱私的采集方式如攝像頭、手機藍牙追蹤需要額外的倫理審視。3. 如何存儲數據規模有多大這是作業中最容易丟分的問題也是最需要結合講義深度回答的問題。講義給出了三種主流存儲形態作業中必須明確選擇并說明理由存儲形態適用場景特點關系型數據庫Relational DB結構規整、需要復雜查詢以表和 schema 組織數據用 SQL 查詢可保證參照完整性NoSQL 數據庫層級化 JSON 文檔、圖數據等復雜結構不強加 schema但查詢能力弱于 SQL數據湖Data Lake大規模原始數據以原始非結構化形態存儲常配合 Parquet 等列式格式用于大數據同時必須估算數據規模數據量級、增長速率這決定了存儲選型是否合理。例如每節課拍 510 張照片與每秒一條傳感器記錄對應的存儲方案完全不同。4. 能得出什么洞察能做什么決策這是閉環的終點從數據中提取的知識必須落到具體行動上。回答時需要寫清可驗證的關系如出勤率與考試成績的相關性和可執行的決策如公布周出勤榜單并抽獎激勵。講義提醒相關性分析會涉及統計與概率知識可進一步參考 概率與統計一節。三個問題域的展開思考作業建議了三個問題域要求每個都完整回答上述四個問題。下面以倉庫 示例解答 為基礎展開并對另外兩個域給出示例性質非唯一答案的思考路徑。問題域一教育Education倉庫示例解答給出的是一個非常完整的范式值得逐行拆解維度內容問題大學課堂出勤率低假設出勤的學生平均考試成績更好希望刺激出勤并驗證假設采集什么通過教室安防攝像頭拍照或追蹤學生手機藍牙/Wi-Fi 地址來記錄出勤考試成績已存在于學校數據庫如何存儲攝像頭圖片屬于非結構化數據每節課存 510 張照片再用 AI 識別學生面部將其轉換為結構化數據洞察與決策計算每個學生的平均出勤率與考試成績做相關性分析在學校門戶公布每周出勤榜單并為高出勤學生抽獎這個示例展示了三個關鍵能力多源數據組合新采集的出勤數據 已有的成績數據、非結構化到結構化的轉換圖像 → AI 識別 → 結構化記錄、洞察到決策的閉環相關性分析 → 激勵措施。問題域二疫苗接種Vaccination疫情背景下數據可以支撐疫苗分配、預約管理與覆蓋率分析。一個完整的方案示例維度內容問題疫情期間疫苗數量有限且分配不均需要讓高風險人群優先接種并提高整體接種率采集什么接種記錄劑次、疫苗類型、接種時間、預約信息、人口與風險畫像數據年齡、基礎疾病、接種點庫存數據如何采集接種點信息系統實時上報預約平臺記錄用戶預約行為風險畫像來自疾控中心已有數據庫如何存儲接種記錄是結構化數據適合關系型數據庫按 ID 關聯人群與接種點每日匯總報表可另存為 CSV 進入分析管道跨地區聚合數據可放入數據倉庫/數據湖洞察與決策按地區、年齡層統計接種覆蓋率識別低覆蓋區域預測各接種點未來需求以動態調配疫苗向未接種人群推送預約提醒該方案同樣覆蓋采集—存儲—洞察—決策全鏈路且天然涉及數據規模估算全國接種記錄可達千萬級行需考慮數據庫擴展性與聚合查詢性能。問題域三工作效率Productivity如何用數據保證工作效率可以聚焦到個人或團隊的時間分配與產出度量維度內容問題團隊成員經常在低價值任務上消耗過多時間希望識別效率瓶頸并優化工作安排采集什么任務管理系統中的任務類型與耗時、代碼提交/文檔產出等交付物記錄、日歷會議時長、專注時段可由效率工具記錄如何采集從項目管理工具與版本控制系統導出日志結構化數據必要時通過時間追蹤工具或問卷補充主觀數據定性數據如何存儲任務與提交記錄是典型結構化數據可存入關系型數據庫并按團隊/項目建 schema自由文本周報屬于半結構化/非結構化數據可存文本或 JSON 文檔洞察與決策按任務類型聚合耗時占比識別時間黑洞任務分析產出高峰時段以合理排期基于歷史數據給出個人/團隊效率基準與改進建議注意此處涉及對員工行為的數據采集務必結合 數據科學倫理 討論透明性與知情同意這能顯著提升作業的深度。表格填寫與替換建議作業要求將思考結果填入如下表格可替換為自選問題域Problem DomainProblemWhat data to collectHow to store the dataWhat insights/decisions we can makeEducationVaccinationProductivity填寫時注意三個技巧每個單元格都要寫實收集學習數據是無效答案記錄每節課的出勤情況布爾值與每單元測驗分數才是有效答案存儲單元格必須給出選型明確是關系型數據庫、NoSQL 還是文件/數據湖并一句話說明理由與規模估算洞察與決策單元格要成對出現先寫從數據中能發現什么再寫據此會采取什么行動兩者缺一不可。作業明確允許將建議的問題域替換為你自己熟悉的領域如零售、醫療、物流選擇你了解業務背景的領域通常更容易寫出深度。評分標準解讀如何達到 Exemplary作業的 Rubric 分為三檔是自評的精確依據等級要求Exemplary優秀為所有問題域識別出合理的數據來源、存儲方式以及可能的決策/洞察Adequate合格部分內容缺乏細節、未討論數據存儲或只描述了至少 2 個問題域Needs Improvement需改進只描述了數據方案的部分內容且只考慮了 1 個問題域對照 Rubric 自檢三個問題域是否全部覆蓋每個域的存儲是否被討論數據來源是否具體合理決策/洞察是否完整只要任一問題域缺少存儲討論或只有兩個域完成就達不到 Exemplary。這也是為什么上面三個展開示例刻意保持同一套四問結構——結構完整本身就是評分項。配套資源與拓展練習完成表格后可以從倉庫中進一步驗證數據科學流程的真實落地方式動手挑戰第一課附帶的 notebook.ipynb 演示了完整的數據旅程——用requests抓取 Wikipedia 文本、用 BeautifulSoup 清洗 HTML、用 RAKE 提取關鍵詞、用 matplotlib 與 WordCloud 可視化直觀展示采集 → 處理 → 洞察 → 可視化四步閉環真實工作流示例examples/05_real_world_example.py 以鳥類撞擊飛機數據為例演示定義問題 → 加載 → 探索 → 清洗 → 分析 → 可視化 → 得出結論的完整項目流程與你作業中的四個問題形成呼應更基礎的入門示例見 examples/README.md數據存儲實戰2-Working-With-Data 章節深入講解關系型數據庫與 NoSQL其中 05-relational-databases 的作業 用 SQLite 機場數據庫訓練表設計與 JOIN 查詢能力幫助你理解作業中如何存儲的工程細節可視化支撐3-Data-Visualization 章節覆蓋數量、分布、比例、關系四類圖表為如何把洞察展示出來提供方法庫數據素材倉庫 data 目錄 提供了多份真實數據集如emails.csv、honey.csv、birds.csv及 COVID 時序數據可以用來檢驗你設想的數據規模與形態。常見誤區與最終自查清單完成作業前逐條核對以下要點避免最常見的丟分項誤區一只寫問題不寫方案。作業核心是數據驅動的改進方案每個問題域都必須落到數據鏈路誤區二跳過存儲環節。Rubric 明確將未討論數據存儲列為降檔原因存儲選型與規模估算是硬性要求誤區三洞察與決策脫節。發現出勤率與成績相關是洞察必須跟上一句所以我們要做什么誤區四三個域深度不一。Exemplary 要求所有域同等完整不要厚此薄彼誤區五忽視數據倫理。涉及個人數據的方案攝像頭、位置追蹤、員工行為監控應主動討論隱私與透明性這在課程 倫理一節 中是明確要求。按照四問框架 三域完整 表格填寫 Rubric 自評的流程你完成的不只是一份作業而是對數據科學工作方式的一次完整預演——這正是本課程第一課希望奠定的思維基礎。【免費下載鏈接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!項目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考