【電子書】一冊讀懂資料科學
活動訊息
內容簡介
目錄
第一章 資料科學入門總論
本章是全書的基本地圖,說明資料科學到底在研究什麼,以及它為什麼成為現代社會的重要能力。章中不急著進入技術細節,而是先釐清資料、資訊、知識與決策之間的關係,並說明資料科學如何結合統計學、電腦科學、領域知識與溝通能力。本章也會介紹一個資料專案的基本流程:提出問題、取得資料、整理資料、探索模式、建立模型、評估結果、溝通與部署,讓讀者先知道後面各章的位置。
第二章 資料從哪裡來
資料不是自然掉下來的真相,而是被人類設計、蒐集、測量與保存下來的紀錄。本章從資料的來源談起,介紹問卷、交易紀錄、感測器、網站點擊、醫療資料、政府開放資料與社群媒體資料等常見來源。讀者會理解資料格式的差異,包括結構化資料、半結構化資料與非結構化資料,也會認識資料庫、資料表、欄位、紀錄、ID、時間戳等基本概念。本章的核心是讓讀者明白:資料的品質,從資料產生的那一刻就已經開始被決定。
第三章 資料整理的技藝
許多人以為資料科學最迷人的部分是模型,但在真實工作中,大量時間其實花在資料清理與整理。本章介紹資料品質的重要性,帶讀者理解缺失值、異常值、重複資料、格式不一致、單位錯誤、欄位定義混亂等常見問題。章中會用生活化案例說明,為什麼「姓名欄位不一致」「日期格式不同」「同一個商品有三種名稱」都可能讓分析失真。本章也會介紹資料轉換、合併、篩選、分組、標準化與特徵建立等基本操作概念。
第四章 讓數字開始說話
本章進入資料分析的第一層:不急著預測,而是先理解資料長什麼樣子。讀者會認識平均數、中位數、眾數、百分位數、變異、標準差、分布、離群值與相關係數等描述統計概念。本章也會介紹探索性資料分析的精神:用圖表與簡單統計量不斷提問,找出資料中的模式、差異與可疑之處。章中會用收入分布、考試成績、店鋪銷售、城市交通與網站流量等例子,說明不同圖表適合回答不同問題。
第五章 從樣本到判斷
資料科學不只描述過去,也常要根據有限資料推測更大的世界。本章介紹機率與統計推論的基本觀念,讓讀者理解抽樣、母體、信賴區間、假設檢定、誤差與不確定性。章中會避免艱深公式,而是用選舉民調、醫學檢測、產品 A/B 測試、教育成效評估等案例,說明為什麼資料分析必須誠實面對「可能錯」這件事。本章也會特別處理因果推論,說明相關不等於因果,以及實驗設計、對照組與混淆因素的重要性。
第六章 機器如何從資料中學習
本章帶讀者進入機器學習的核心世界。機器學習不是讓電腦真正像人一樣理解世界,而是讓電腦從過去案例中找出規律,並用這些規律處理新資料。章中會介紹監督式學習與非監督式學習,並用房價預測、垃圾郵件分類、顧客分群、電影推薦、信用評分等案例說明迴歸、分類、分群與推薦系統。本章不追求演算法細節,而是幫助讀者理解不同模型任務在解決什麼問題,以及模型為什麼需要訓練資料。
第七章 好模型不是看起來很準
建立模型只是開始,判斷模型是否可靠才是資料科學的關鍵。本章說明訓練資料、驗證資料與測試資料的差異,介紹準確率、精確率、召回率、F1 分數、均方誤差、混淆矩陣等評估概念。章中會用醫療篩檢、詐欺偵測、垃圾郵件分類與信用審核等例子,說明不同情境下「錯誤」的代價不同。本章也會討論過度擬合、資料洩漏、類別不平衡、特徵選擇與模型可解釋性,讓讀者知道為什麼高分模型不一定能在真實世界中成功。
第八章 不只是表格資料
現代資料科學面對的資料早已不只是 Excel 表格。社群貼文、客服對話、新聞文章、醫學影像、衛星照片、金融時間序列、物流紀錄與社交網路都可能成為分析對象。本章介紹幾種重要資料型態與基本處理思路:文字資料需要斷詞、向量化與語意表示;圖像資料需要像素、特徵與深度學習;時間序列資料重視趨勢、季節性與突發變化;網路資料則關心節點與關係。本章也會簡要介紹大規模資料處理的概念,說明為什麼資料量變大後,儲存與計算本身也會成為問題。
第九章 從分析報告到資料產品
資料科學若停留在漂亮圖表與一次性報告,影響力往往有限。真正進入組織運作時,資料分析需要變成流程、系統與產品。本章介紹資料工程、資料管線、儀表板、決策系統、模型部署與監控等概念,說明資料科學如何在企業、政府與非營利組織中落地。章中也會介紹資料團隊常見角色,包括資料分析師、資料科學家、資料工程師、機器學習工程師、產品經理與領域專家。本章的重點是讓讀者理解:資料科學不是單人英雄式工作,而是跨部門協作。
第十章 資料科學的現代應用與下一步
最後一章整理資料科學在現代生活中的應用與限制。本章會介紹醫療風險預測、金融風控、電商推薦、智慧城市、教育科技、媒體平台、公共衛生與環境監測等場景,也會討論常見誤解:資料越多越好、模型一定客觀、準確率高就能放心使用、AI 可以取代專業判斷等。本章會帶出重要爭議,包括隱私、監控、演算法偏見、資料所有權、自動化決策責任與模型透明度。最後,本章會提供下一步學習建議,幫助讀者依照自己的目標選擇統計、程式、機器學習、資料視覺化或資料治理的進階路線。
附錄
附錄一 本書關鍵詞整理
本附錄整理全書最重要的資料科學關鍵詞,作為讀者複習與快速查找之用。每個詞條以白話方式說明其意義、用途與常見誤解,涵蓋資料來源、資料品質、統計推論、機器學習、模型評估、資料產品、資料治理、隱私與演算法公平性等核心主題。
附錄二 重要人物、理論、工具或制度速查
本附錄以速查方式整理資料科學相關的重要人物、理論、工具與制度,協助讀者建立學科背景。人物部分包括 Thomas Bayes、Ronald Fisher、John Tukey、Leo Breiman 等;理論與方法部分整理貝氏思維、假設檢定、迴歸分析、決策樹、隨機森林、神經網路、交叉驗證、A/B 測試與因果推論;工具與制度部分則說明 SQL、Python、R、Jupyter Notebook、資料庫、資料治理、個資保護與模型風險管理等。
附錄三 下一步學習地圖
本附錄依讀者目標設計不同學習路線。一般讀者可先熟悉圖表閱讀、統計直覺與資料倫理;學生可從統計、Python 或 R、SQL 與基礎機器學習開始;職場人士可優先練習問題定義、指標設計、儀表板閱讀與 A/B 測試;想轉入資料工作者,則可依序補強程式、資料清理、資料庫、機器學習、專案作品與溝通能力。真正成熟的資料能力,不是永遠相信數字,而是知道如何用數字負責任地理解世界。
第一章 資料科學入門總論
本章是全書的基本地圖,說明資料科學到底在研究什麼,以及它為什麼成為現代社會的重要能力。章中不急著進入技術細節,而是先釐清資料、資訊、知識與決策之間的關係,並說明資料科學如何結合統計學、電腦科學、領域知識與溝通能力。本章也會介紹一個資料專案的基本流程:提出問題、取得資料、整理資料、探索模式、建立模型、評估結果、溝通與部署,讓讀者先知道後面各章的位置。
第二章 資料從哪裡來
資料不是自然掉下來的真相,而是被人類設計、蒐集、測量與保存下來的紀錄。本章從資料的來源談起,介紹問卷、交易紀錄、感測器、網站點擊、醫療資料、政府開放資料與社群媒體資料等常見來源。讀者會理解資料格式的差異,包括結構化資料、半結構化資料與非結構化資料,也會認識資料庫、資料表、欄位、紀錄、ID、時間戳等基本概念。本章的核心是讓讀者明白:資料的品質,從資料產生的那一刻就已經開始被決定。
第三章 資料整理的技藝
許多人以為資料科學最迷人的部分是模型,但在真實工作中,大量時間其實花在資料清理與整理。本章介紹資料品質的重要性,帶讀者理解缺失值、異常值、重複資料、格式不一致、單位錯誤、欄位定義混亂等常見問題。章中會用生活化案例說明,為什麼「姓名欄位不一致」「日期格式不同」「同一個商品有三種名稱」都可能讓分析失真。本章也會介紹資料轉換、合併、篩選、分組、標準化與特徵建立等基本操作概念。
第四章 讓數字開始說話
本章進入資料分析的第一層:不急著預測,而是先理解資料長什麼樣子。讀者會認識平均數、中位數、眾數、百分位數、變異、標準差、分布、離群值與相關係數等描述統計概念。本章也會介紹探索性資料分析的精神:用圖表與簡單統計量不斷提問,找出資料中的模式、差異與可疑之處。章中會用收入分布、考試成績、店鋪銷售、城市交通與網站流量等例子,說明不同圖表適合回答不同問題。
第五章 從樣本到判斷
資料科學不只描述過去,也常要根據有限資料推測更大的世界。本章介紹機率與統計推論的基本觀念,讓讀者理解抽樣、母體、信賴區間、假設檢定、誤差與不確定性。章中會避免艱深公式,而是用選舉民調、醫學檢測、產品 A/B 測試、教育成效評估等案例,說明為什麼資料分析必須誠實面對「可能錯」這件事。本章也會特別處理因果推論,說明相關不等於因果,以及實驗設計、對照組與混淆因素的重要性。
第六章 機器如何從資料中學習
本章帶讀者進入機器學習的核心世界。機器學習不是讓電腦真正像人一樣理解世界,而是讓電腦從過去案例中找出規律,並用這些規律處理新資料。章中會介紹監督式學習與非監督式學習,並用房價預測、垃圾郵件分類、顧客分群、電影推薦、信用評分等案例說明迴歸、分類、分群與推薦系統。本章不追求演算法細節,而是幫助讀者理解不同模型任務在解決什麼問題,以及模型為什麼需要訓練資料。
第七章 好模型不是看起來很準
建立模型只是開始,判斷模型是否可靠才是資料科學的關鍵。本章說明訓練資料、驗證資料與測試資料的差異,介紹準確率、精確率、召回率、F1 分數、均方誤差、混淆矩陣等評估概念。章中會用醫療篩檢、詐欺偵測、垃圾郵件分類與信用審核等例子,說明不同情境下「錯誤」的代價不同。本章也會討論過度擬合、資料洩漏、類別不平衡、特徵選擇與模型可解釋性,讓讀者知道為什麼高分模型不一定能在真實世界中成功。
第八章 不只是表格資料
現代資料科學面對的資料早已不只是 Excel 表格。社群貼文、客服對話、新聞文章、醫學影像、衛星照片、金融時間序列、物流紀錄與社交網路都可能成為分析對象。本章介紹幾種重要資料型態與基本處理思路:文字資料需要斷詞、向量化與語意表示;圖像資料需要像素、特徵與深度學習;時間序列資料重視趨勢、季節性與突發變化;網路資料則關心節點與關係。本章也會簡要介紹大規模資料處理的概念,說明為什麼資料量變大後,儲存與計算本身也會成為問題。
第九章 從分析報告到資料產品
資料科學若停留在漂亮圖表與一次性報告,影響力往往有限。真正進入組織運作時,資料分析需要變成流程、系統與產品。本章介紹資料工程、資料管線、儀表板、決策系統、模型部署與監控等概念,說明資料科學如何在企業、政府與非營利組織中落地。章中也會介紹資料團隊常見角色,包括資料分析師、資料科學家、資料工程師、機器學習工程師、產品經理與領域專家。本章的重點是讓讀者理解:資料科學不是單人英雄式工作,而是跨部門協作。
第十章 資料科學的現代應用與下一步
最後一章整理資料科學在現代生活中的應用與限制。本章會介紹醫療風險預測、金融風控、電商推薦、智慧城市、教育科技、媒體平台、公共衛生與環境監測等場景,也會討論常見誤解:資料越多越好、模型一定客觀、準確率高就能放心使用、AI 可以取代專業判斷等。本章會帶出重要爭議,包括隱私、監控、演算法偏見、資料所有權、自動化決策責任與模型透明度。最後,本章會提供下一步學習建議,幫助讀者依照自己的目標選擇統計、程式、機器學習、資料視覺化或資料治理的進階路線。
附錄
附錄一 本書關鍵詞整理
本附錄整理全書最重要的資料科學關鍵詞,作為讀者複習與快速查找之用。每個詞條以白話方式說明其意義、用途與常見誤解,涵蓋資料來源、資料品質、統計推論、機器學習、模型評估、資料產品、資料治理、隱私與演算法公平性等核心主題。
附錄二 重要人物、理論、工具或制度速查
本附錄以速查方式整理資料科學相關的重要人物、理論、工具與制度,協助讀者建立學科背景。人物部分包括 Thomas Bayes、Ronald Fisher、John Tukey、Leo Breiman 等;理論與方法部分整理貝氏思維、假設檢定、迴歸分析、決策樹、隨機森林、神經網路、交叉驗證、A/B 測試與因果推論;工具與制度部分則說明 SQL、Python、R、Jupyter Notebook、資料庫、資料治理、個資保護與模型風險管理等。
附錄三 下一步學習地圖
本附錄依讀者目標設計不同學習路線。一般讀者可先熟悉圖表閱讀、統計直覺與資料倫理;學生可從統計、Python 或 R、SQL 與基礎機器學習開始;職場人士可優先練習問題定義、指標設計、儀表板閱讀與 A/B 測試;想轉入資料工作者,則可依序補強程式、資料清理、資料庫、機器學習、專案作品與溝通能力。真正成熟的資料能力,不是永遠相信數字,而是知道如何用數字負責任地理解世界。
訂購/退換貨須知
購買須知:
使用金石堂電子書服務即為同意金石堂電子書服務條款。
電子書分為「金石堂(線上閱讀+APP)」及「Readmoo(兌換碼)」兩種:
- 請至會員中心→電子書服務「我的e書櫃」領取複製『兌換碼』至電子書服務商Readmoo進行兌換。
退換貨須知:
- 因版權保護,您在金石堂所購買的電子書僅能以金石堂專屬的閱讀軟體開啟閱讀,無法以其他閱讀器或直接下載檔案。
- 依據「消費者保護法」第19條及行政院消費者保護處公告之「通訊交易解除權合理例外情事適用準則」,非以有形媒介提供之數位內容或一經提供即為完成之線上服務,經消費者事先同意始提供。(如:電子書、電子雜誌、下載版軟體、虛擬商品…等),不受「網購服務需提供七日鑑賞期」的限制。為維護您的權益,建議您先使用「試閱」功能後再付款購買。


商品評價