跳到主要內容

發表文章

閱讀 |《超負荷時代》閱讀心得

《 超負荷時代:即將崩潰的流通世界 》 DOOR to DOOR: The Magnificent, Maddening, Mysterious World of Transportation 自從開始有閱讀習慣之後,總會在實體或網路書店尋寶時,留意是否有與自己學科或工作背景相關的科普書籍。我指的不是教科書或技術手冊,而是針對某個特定主題的知識普及雜談,不用什麼預設知識門檻便能閱讀的那種。大多數你能想得到的科系,都能找得到類似的著作,但偏偏我的科系比較冷門少見……一直到去年,我在書店看到這一本書的時候,我一邊翻閱書籍,一邊在心頭吶喊「總算讓我找到一本專門談運輸物流的書了!!!!」(感動握拳拭淚 本書的作者並非相關領域的學者或者業界人士,而是一位得過普立茲獎的記者。這一點很明顯地可以從該書的章節命名來看,作者透過智慧型手機、鋁罐、咖啡、披薩、與機器人等等辭彙開始延伸,輔以大量報導文獻及數據,漫談日復一日維持人們生活的運輸物流系統,究竟有多麼「不簡單」(尤其中文書名,我相信物流基層從業人員、以及超商超市店員,應該非常有感......),最後再談到本書的核心探討議題「運輸的最後一哩路」(在教科書稱為「及門運輸」「 door to door 」) 這種題材,如果是教科書,那大概就以陸海空等空間區別,或者以載具之不同來劃分了。比起後者,前者的內容編列方式有趣多了不是嗎? 本書的討論範疇都是美國本土的交通運輸物流,故某些章節所提到的觀點與論述,其實十分值得讀者去與其居住的城市、地區、國家比較。該書的成書年代還算新(原文著作在2016年出版),即便是有關新興運輸科技的內容(例如智慧駕駛與無人車),也不會有時代落差。作為一位 不稱職的 運輸人,真心推薦任何想瞭解當代運輸物流運作體系的朋友們,來看看這本書。 題外話,我讀完之後,例行性地去GOOGLE了一下相關心得。一樣是原文著作在2016出版,繁體中文版本在2017出版的書籍,我看的前一本書《大數據的傲慢與偏見》這種時下熱門題材書籍,網路上的書評、心得、與簡介一狗票,而關於這一本的心得……真的少得可憐啊 XD(也呼應到,平時沒啥人會注意到交通運輸物流,如果有,那通常是出包的時候 Orz -----------------------(下收內容節錄) ----------------------- ...

二轉人生 | 淺談灰色理論

最早知道灰色理論這玩意是在大學部,在選課系統上面看到外系的碩士班有開授專門課程。當時我一度把灰色理論跟模糊理論搞混 (你不覺得這兩樣東西,光是聽起來就有 87 成像嗎?) 直到我看到開授這門課的老師,在另一學期也開一門「模糊理論與應用」,我才知道原來這兩樣是不同的東西。  雖然說是不同的玩意,但是其應用上其實十分相近。廣義而言,該兩者都能用來處理「資訊不確定」(或者資訊不充足)情況下的問題分析,相關的應用方法包含關聯性分析、資料分群、預測等等。應用領域也十分廣泛,諸如:自然科學、社會科學、工程技術、生物醫學、商業決策、財務金融、乃至於教育、心理等領域,皆可看到其應用。我們可以透過下方表格簡單知道灰色理論、模糊理論、與機率統計三者的差異:  Grey System Probability Fuzzy 核心 內涵 小樣本& 資訊不確定 大樣本& 資訊不確定 認知不確定 演算 依據 原始資料的 資訊覆蓋程度 機率分佈 隸屬函數 演算 方法 生成 (Generating) 統計 取邊界值 特點 少量樣本 即可運算 樣本數量 愈大愈好 經驗數據的 豐富程度 樣本 要求 允許任意分佈 常態分佈 依據模糊函數 而定 目標 現實規律 呈現歷史 統計規律 認知表達 1. 針對只需要小量樣本即可進行運算的這項特點,對於許多外部分析單位而言,是一件好消息。有時候公司或者政府單位雖然委託外部分析人員進行分析,但是資料卻給得不齊全或者不乾脆,請案主提供更完整、資料的資料時,還會被各種推託或者不重視(當然這還是要看情況)。而在這種情況下,又要對上級有所交代的時候,灰色理論就是一個可用的分析方法。(但還是要評估問題類型,也不見得所有問題都能透過灰色理論而有所解)  2. 關於「灰預測」,看過它的演算概念及過程之後覺得......啊這不就是一種移動平均法的變形嗎?只是透過看似複雜的數學轉換讓它看起來好像很高深(這裡得澄清一下,我不是決策科學領域的專家,這裡只是依照我過去所學印象,所提出的看法。若有在該領域更專業人士或前輩有不同的看法,歡迎批評指教)  3.  承第二點,「灰預測」的演算步驟當中,有一個檢定其「精確度」的過程(「灰預測」方法當中,依據採納樣本的不同,所得...

二轉人生 | 淺談系統模擬

因為重回校園再進修的緣故,意外地接觸到「系統模擬」( Simulation )這門技術。先前的求學經驗當中,靜態的數量規劃與分析技術是接觸了不少,偏偏動態規劃與模擬這方面的課程就沒啥接觸。 系統模擬( Simulation ) ,可以泛指根據一項或多項特定目的,透過電腦建構數學模型來描繪真實世界之情境,並以模擬結果的作為決策輔助參考的技術其亦為作業研究的一項重要分歧。這樣的描述可能還有點模糊,不妨參考以下簡單舉例: 以每半小時為時間切割單位,模擬一家速食店在一個月當中的來客數、餐點銷售數量、以及速食店對訂單的消化量,以作為最佳化人員排班及物料採購規劃的參考。 以每半小時為時間切割單位,模擬一條公車路線的各站牌的等候人數、上下車人數、班次數量、發車時間間隔等等。以作為最佳化發車班距與路線調整的參考依據。 透過上述的例子,讀者們應該可以發現,模擬的重點在於一定時間與空間狀態的條件下,系統內所發生的變化,這也是之所以為什麼說系統模擬是動態分析技術的原因。就實務上,靜態的分析技術、與動態的模擬技術,時常是互補的,都是使用者在進行決策時的一項支援工具。相關介紹我就不多提了,在這裡僅簡單聊聊這學期的修課心得: # 目的 其實這該是一個通用性的法則:你總得先清楚明白你是為了什麼目的而要來建一個模擬專案。從瞭解目的,到進一步拆解問題架構,然後才是轉化成你所使用的模擬工具的樣子。 # 成本 對於愈龐大、愈複雜的系統而言,要建構出夠全面、詳細的模擬系統,是很花時間且很累人的一件事。如果用傳統靜態的數量方法再搭配專家建議,就能夠達成所要的目的,那何必大費周章去刻一個模擬系統出來?又或者,你原本就擅長某項程式語言或其他模擬工具,在不影響目標達成的情況下,又何必從頭再去學另一套模擬工具? # 工具 瞭解目的與成本之後,再來就可以來思考,有哪些模擬工具或技術可以使用。現行所能找得到的系統模擬專門軟體非常多,光是  Open Source  的模擬軟體,就能用來建構非常強大的模擬專案了,更別提商用的套裝模擬軟體。此外,使用者也該根據模擬的目、專業性、成本等等因素,而選用不同的模擬軟體。 # 融會貫通 作為一名未來的資料科學工作者,上述的三項心得重點,完全能套用在資料科學的專案工作上。這也是我重回校園後的一項習慣,就是不斷地思考...

雜談 | 邁向資料科學家之路 其二

在上一篇文章當中,我們帶各位總覽資料科學的樣貌、以及資料科學家應具備的重要觀念。在這篇文章當中,我們將把焦點放在工具、技術、求職、人才供需等面向上。 【工具  &  技術】 Programming 事實上,無論是人工智慧、商業智慧,或者統計、系統模擬、作業研究等領域,坊間皆能找到現成軟體與運算平台,多數甚至具備設計良好的圖形化使用者介面,且運算功能強大,資料科學家或者分析人員只要對問題以及數學方法有足夠的瞭解,便能透過這些現成的工具來完成任務。 〈 寫程式是資料分析的必要技能 〉一文,則提出了不同的看法。內文提及, 學習寫程式並不是要變成軟體工程師,而是知道它在什麼情境下可以派上用場,提高工作效率。 現成套裝 軟體或許強大,但總會有無法透過一套工具打遍天下的情況發生,這種時候,程式語言則提供了解決這類困境的彈性。 SQL & 資料工程 同樣是呼應「提高工作效率」這一點,〈 資料科學家為何需要了解資料工程 〉與〈 為何資料科學家需要學習 SQL 〉則是說明了資料工程以及  SQL  對資料科學家的重要性。前文以資料科學家平常的一天,來描述少了資料工程支援的資料科學家,會有多麼彆腳。而  SQL 讓資料科學家可以專注在需要「什麼」資料而非要「怎麼」取得。當中的核心概念,不外乎是要 將各種工具互補使用,來使工作效率最佳化 。 R & Python 談過程式設計、 SQL 、資料工程之後,我們終於要來談 R 與 Python 。但這大概是最不缺乏說明的部分,坊間媒體、廣告、以及推廣機構都已經有了大量的介紹,而且一篇筆一篇詳盡,這裡只放上這一篇〈 從套件的發展談 R 與 Python 〉,提供給還在游移不定該選擇哪種語言先學的初學者們參考。 數學  &  統計 前述的部分,主要都還是討論在資訊工具的使用,但是這些資訊工具要發會功能,除了要對問題有所足夠理解之外,最重要是能夠將問題轉譯成數學語言,也就是硬底子的數學及統計相關方法論。這是一個龐大的知識與技術體系,〈 資料科學與幾個「分析」相關領域的比較 〉一文則為我們提供了簡明的分類參考。 【職場】 這個層面,我想了好久該放哪些內容上來,經...

閱讀 |《大數據的傲慢與偏見》閱讀心得

《 大數據的傲慢與偏見:一個「圈內數學家」對演算法霸權的警告與揭發 》 Weapons of Math Destruction: How Big Data Increases Inequality and Threatens Democracy 在大數據標語與口號滿天飛、以及演算法充斥著網頁瀏覽器及社群平台的時代,即便是不曉得演算法為何物的輕度網路使用者(例如許多人的父母長輩),也或多或少能從其瀏覽的網頁資訊、社群軟體當中發現一些端倪。但本書所提到的演算法,並不局限於網路,而是遍佈於你我的生活當中,諸如求職、工作表現評比、廣告、保險、乃至於政府行政與法律問題。作者大量引用了相關報導以及研究,說明錯誤地運用這些複雜的數學演算法,將如何使人類社會失衡並帶來災難。 看完之後令我特別感到有趣的,是本書的作者。作者 Cathy O’Neil 女士,是美國哈佛大學數學博士,除了在大學任教之外,她還有在金融業、行銷、傳媒、等事業單位擔任資料科學家的經歷。在以男性為主要成員的數學與資訊科學相關領域當中,是少見的女性成員。有趣的點,正因為她是一位女性、而且還是一位家庭主婦。 我們常見的大數據、AI、或者其他基於統計學、程式演算法的相關技術,通常應用於工業、商業等領域。坊間也不難找到相關書籍以及收費課程。但上述的應用大多僅強調這些技術的強大以及益處,延伸來解讀,我們可以說其強調如何使應用者邁向成功;但幾乎不會提到,在某些演算機制的缺陷下,或者誤用(乃至於惡意地)這些數學方法,可能有受害者產生(尤其是對那些原本就處於弱勢的人們)。而在傳統社會的印象當中,會認為男性就是應該要有一番作為、被期許要成功、個性要剛強有主見等等;正好而這些「失敗」、「弱勢」等等概念詞彙,相對立的。 同樣地,傳統上,在男人們專注於打拼事業、專注於邁向成功之虞,誰來照顧那些弱勢者?(這裡指弱勢者,可能是老弱婦孺、或泛指社會上生活困頓無可依靠者)以及,誰更容易關切這些弱勢者?是女性。想想戰爭期間,男人上戰場作戰,女人則留守家園照顧老幼、以及進行各種後勤工作。延伸到現代,無論是東方或西方,這種「男人在外工作打拼;女人留在家照顧老幼」的模式,仍不在少數。(啊,這裡沒有表達性別歧視或偏見的意味,我只是在描述從早期一直延伸到現代的一種社會文化認知情況) 我在想,是否正因為作者是女性,且又是一名家庭主婦,她所看到、所想...

雜談 | 邁向資料科學家之路 其一

我在曾在〈 不是工程師的工程師 〉一文當中,開宗明義地介紹這個部落格的目的。 既然是以成為「未來的資料科學家」為目標,那麼總該清楚回答:資料科學是什麼?資料科學家平常在幹嘛?以及其價值定位……等等問題。於是,我決定用兩篇文章的篇幅,第一篇談「 入門 」與「 觀念 」;第二篇談「 技術 」與「 職場 」,依序回答每個層級的相關疑惑。 多數內容或許都是老生常談(尤其對業界人士,或者像我一樣有同樣目標的在學者而言),但我仍希望將自己的學習歷程,做個有系統的回顧與統整,乃至於和我有相同目標的同好、亦共同參考學習。 【入門】 如同文章開頭提到的,我們總得從最根本的問題回答起: 什麼是資料科學? 〈 揭開資料科學的神秘面紗 〉這篇文章中給了簡單扼要的說明。 作者Meng Lee本身就是一名資料科學家,他根據他個人的經驗,說明了到底啥是資料科學?資料科學到底在夯什麼?為什麼我要學資料科學? 如何成為一名資料科學家? 〈 如何成為一名資料科學家? 〉裡頭提到,一位資料科學家,不外乎同時具備以下這三項專業能力:Hacking Skills, Math & Statistics Knowledge, Substantive Expertise 此外,他也以自身企管顧問背景的經驗,提出了另一套看法,他說明了「商業力」、「分析力」、「技術力」這三種專業能力結合的重要性,也就是能理解業務(Domain Knowledge)、知道如何有系統地分析與業務相關的問題(Analysis)、以及透過數學、程式語言、軟體等工具來解解決上述問題的能力(Programming、Coding),尤其對商業環境當中的資料科學家而言,尤是如此。 關於資料科學的迷思 現在我們對資料科學與資料科學家,都能有個87成概念了,但是目前為止談的都是美好的理想與目標,而現實總是殘酷的, 我們總得認清哪些是媒體、廣告商、與補習班過度跨大及美化的噱頭、還有自己幻想出來的美好泡泡。 〈 資料科學的五大迷思 〉一文,就為我們歸納並解惑了許多常見迷思,包含對資料科學的功用的過度誇大、什麼都得來個大數據的浪潮、還有「以為上過幾堂Python、SQL、Machine Learning課程,就可以是一名資料科學家/工程師」等等膚淺的認知。〈 資料科學家的告白:給幼...

SQL | MS SQL 初心者筆記 其一

該學哪一套 SQL ? 這是我決定要開始學  SQL  之後所遇到的第一個問題,常見的方案就有  Oracle 的  MySQL 、 Microsoft  的 SQL Server 、和 Open Source  的  PostgreSQL 。雖然指令及語法基本上一致,但個別資料庫軟體的操作細節還有其對應的作業平台也都有所差異,這對資工或資管背景的朋友而言可能不會造成太大問題,可是對程式素人的我而言就有差了。 回顧一下前文章提到的重點: 「 先確認目的  or  需求是什麼,再來決定要做些什麼。 」 於是我先調查了一下我的理想職缺當中,主要要求的是哪一種資料庫系統,再考量到我熟悉的作業系統平台,我決定從 Microsoft SQL Server( 以下簡稱 MS SQL) 來學習  SQL 。 選擇教材資源 在這個網路如此發達,各種線上教學資源多如繁星的時代,我覺得還去報名什麼 X 匠電腦之類的補習班課程,實在是傻子。我不否認這種成套的付費課程仍舊有其優點,但我秉持著 「如果學習者自己不夠積極努力,那麼無論報名再怎麼濃縮懶人高效的付費套裝課程,也都只是在浪費成本而已。」 於是,我開始蒐羅、篩選適合自己的教材及資源。 說到線上資源,許多人會想到的可能是大專院校當中的  Open Course Ware 或是  MOOCs 。然而我選擇的是從  YouTube 上尋找專業技術人員的教學影片,例如這個: 【 SQL Server tutorial for beginners 】 【 SQL Server Report Builder 2016 】 【 SQL Server Reporting Services (SSRS) Tutorial 】 【 SQL Server Integration Services (SSIS) Tutorial 】 【 SQL Server Analysis Services (SSAS) 】 這項選擇的原因是, Open Course Ware  或是  MOOCs  的一堂課程影片,通常是針...