發表文章

目前顯示的是有「資料庫」標籤的文章

使用Python進行資料整理 – 初探Pandas

圖片
李孟諵 資料整理是資料分析和建模前的準備工作,包括資料的讀取、檢核、修改、重新編碼和合併等。市場上有不少專為量化研究所設計的商業軟體,例如: SPSS 、 SAS 和 Stata 等,都能進行這項任務,但共通問題是價格所貲不菲。因此,有些人轉向使用開源軟體,其中,具資料整理功能的代表軟體就是「 R 」。 近年來,隨著資料科學 [1] ( Data Science )一詞廣泛被討論,另一套追求開源精神的程式語言 Python ,因第三方函式庫 [2] ( library ) Pandas 日漸成熟,使其在資料整理的功能上也逐漸受到關注。因此,為了使大家更容易了解 Pandas 在調查資料的運用,本文以一個符合調查資料結構的小資料表,藉由調查資料的整理過程,來介紹所使用的函式以及說明程式碼和輸出結果。 一、 Python 簡介 Python 一個開源、簡潔、易讀的程式語言──由 Guido van Rossum 創建,於 1991 年首次發布,設計哲學為「優雅」、「明確」、「簡單」,其直譯式 [3] 、易擴充和跨平台的特性,加上豐富多元的第三方函式庫和社群,使其在各種程式應用上都能看見它的身影,例如:網頁開發、系統管理、資料處理、科學計算,以及近年熱門的機器學習和深度學習等。在近期的 TIOBE 指數 [4] 和 KDnuggets 調查 [5] 都有不錯的熱門度。 二、 Python 環境安裝 由於跨平台的特性, Windows 、 Mac 和 Linux 系統都能安裝。一般從 Python 原生環境加上所需的函式庫到整合開發環境( Integrated Development Environment ,簡稱 IDE ) [6] ,對初學者來說安裝就是一個挑戰,因此建議直接下載「 Anaconda 」(號稱 Python 資料科學懶人包)來安裝,優點是安裝簡單,只需點選「下一步」即可,缺點是有些函式庫可能用不到,會佔據太多磁碟空間。安裝步驟可參考 官網 說明 ,惟補充兩個安裝時會遇到的問題(以 Windows 為例),第一個是環境變數( PATH environment variable )的選擇(如圖一),主要作用在於透過命令提示字元( cmd.exe )呼叫 Python 或相關程式時,是否需指引到絕對路徑。 Anacond...