發表文章

大數據人才培訓方向

圖片
2015年大數據的人才需求看似都是工程師類,實際真實狀況卻是,工程師可以找到,寫程式也沒問題,但是資料怎麼分析卻沒有人可以分析。如果說財經資料最龐大,華爾街早已經使用大數據分析財經走勢,那麼這肯定也是金融海嘯後的事情了。 大數據需要的技能可分為四類: 資料分析( data analysis ) 資料取得( data acquisition ) 資料探勘( data mining ) 資料結構( data structures ) 最根本的問題還是在於 大數據怎麼定序? 大數據該怎麼分析? 當上面兩個問題解決了,那麼軟體才可以著手進行撰寫。根據大數據定序方法,將其以母體方式討論,只有對與錯的分別,沒有任何的模糊地帶,這才是大數據告訴我們的真相。於是公司的營收與背後的製程將成為隨機變數與機率分配,透過資料形成的機率分配進行測定,了解各隨機變數之間的因果關係,從而為公司提供最佳的決策意見,甚至公司可能發生的問題也可從中發現。 不過有趣的是,無論是Cisco、IBM、Oracle與各自的供應商、合作夥伴或供應鏈的公司群都增加對大數據的人才需求,唯有IBM反而是減少。 資料來源: 富比世雜誌 其實這是因為IBM走行銷而非研發,更進一步來說,IBM並沒有需要大數據分析人才。 有意思的點是IBM的廣告多是提供顧問服務,若顧問服務不需要分析,那麼IBM就沒有需要大數據分析人才。 但是,大數據代表公司的所有資料,IBM不需要公司的所有資料就能夠分析出公司所有完整狀況,提供公司顧問服務,這顯得有點矛盾。 因此,可以知道IBM只走行銷路線! 缺少大數據分析的顧問服務,對IBM將是很大的衝擊! 另外一點就是美國的幾家大公司都認為大數據人才需求必須具備的技能都是電腦程式,不過,電腦程式工程師是否也是統計專家或財經專家,這有待商榷。 所以大數據人才培訓的方向,除了程式工程師外,更重要的是基礎的研究人才:分析人員! 大數據分析師將是成為主要的人才之一,偏偏都缺少了這樣的人才培訓。 問題在於人員看到大數據,但沒有軟體可以分析,想要讓軟體出現,又需要人員對資料定序,定序的原則須符合統計原則,就像雞生蛋、蛋生雞的問題一樣。 即便如此,分析人員在沒有大數據可以分析下,可以透過適度大的數據資料,經由分析之報表,練習如何解讀公司現況或是金融現況,從而推導出未來可能發生狀況或走勢,進而訂出策略。

古典經濟世界觀

圖片
經濟學的教科書大多是使用凱因斯的概念來說明總體經濟的總合供需,這是因為在古典學派的觀點上是以實質面為主,導致經濟體系內的市場呈現類獨立。 這樣的感覺在繪製圖形上特別明顯。 下圖的5個市場合成的圖內,勞動市場、生產函數與45度線都是為了畫出商品市場的總合供給。 而總合需求則是使用劍橋方程式(或貨幣數量學說:py =MV)得到的。 至於外匯市場的均衡線則是購買力平價說得到。 5張圖的關聯就在橘色線上。 這邊並沒有加入可貸資金市場圖來調節家計單位與廠商之金流。

Durbin-Watson檢定與LM檢定的存在意義

圖片
每一本統計學、計量經濟學、時間序列分析、迴歸分析、市場預測的書籍都會提到資料自我相關問題。為了找到資料的自我相關性,有的學者從樣本相關係數出發進行資料的假設檢定,有的學者則是創造與樣本相關係數很相近的數學公式進行資料的假設檢定,其中,最知名的便是Durbin-Watson檢定與LM檢定(Breusch–Godfrey)。兩個檢定公式的出發點都是一樣的,那就是從迴歸分析的殘差出發。 Durbin-Watson檢定公式 LM檢定公式 從資料角度去看,無庸置疑的是資料的數值都是已知的,我們使用迴歸分析來瞭解資料間的因果關係。換言之,此時,解釋變數與被解釋變數之間是樣本條件關係。然而,我們卻遺忘了一件事情,那就是資料也是可以形成分配的,那就是抽樣分配。 既然資料可形成抽樣分配,這意味著解釋變數與被解釋變數都是抽樣分配,需要以分配的概念去解讀。於是,在統計學內就明確寫著: 每個樣本服從母體分配 樣本的變異數一樣都是母體變異數 樣本之間是無線性相關 同樣在迴歸分析的解釋變數、被解釋變數與誤差都有各自的母體分配,並且滿足上面的三個條件。同時解釋變數與被解釋變數之間可以是聯合關係,也可以是條件關係。 進一步推導所得到的係數、殘差、甚至是殘差的數學組合、變異數分析表內的SSR、SSE、MSR、MSE、自我相關係數都是抽樣分配。 請注意,這些都是隨機變數或隨機變數的數學組合,所以都是抽樣分配( 只討論一個數字,不是分配 )。當樣本數夠大時,才能夠代表母體分配( 樣本要多大,沒人知道 )。 所以要使用公式前,問問: 你確定資料的抽樣分配了嗎? 你確定資料的抽樣分配轉換過程了嗎?(是數值的亂數表,不是機率生成的亂數表) 隨機變數的數學組合之間有沒有成為函數關係?(例如自我相關係數與MSE) 當我們確定每一個轉換步驟狀況後,就可以觀察到解釋變數數值、解釋變數個數、誤差母體分配、樣本數、殘差限制對Durbin-Watson檢定與LM檢定的抽樣分配變化。 確實,Durbin-Watson檢定適合所有樣本大小,但是Durbin-Watson檢定的決策規則本身有問題,不符合統計公式的原則,那就是灰色地帶判定給虛無假設,因此只有虛無與對立假設的二分法,以及分配的臨界值只會有一個數字,而不會有所謂的上下界。除非沒有控制住解釋變數數值與殘差限制影響,才會讓這兩個影響融入分配當中,造成臨界值的不確定,產生了...

人才培訓概念

圖片
基礎人才與中階人才都是屬於實務人才,所以在訓練基礎人才與中階人才時給與他們的訓練就是屬於技能性的訓練,讓他們可以在職場上具有未來三至五年的存活技能。例如:Word排版能力、文字組織能力、EXCEL分析能力、簡報說明能力、專業基本知識能力等。 不過,相比於基礎與中階人才,高端人才可分為兩種,一種是實務人才,另一種則是基礎研究人才。高階實務人才就是目前所見的CEO,而多出來的基礎研究人才,則是做高端研究的人員,這類人員是走在所有實務之前,就如同是開路先鋒一樣,先在各領域研究出新的理論,並且在理論與實務之間還有一層人員進行如何將理論轉為實務的資訊人員。 這群資訊人員將理論轉為實務可用的系統後,這些系統就會被使用在適用的行業內。 因此,在教育體系內同樣也該運用如此方法去落實人才的培訓機制。以目前從高中職、大學、研究所等體制來看,各科系所設計出來的課程規劃多是多種人才的部分技能訓練,換言之,如果就讀單一科系的話,那些人員進入職場就會產生巨大的職能落差。 現階段的人才訓練不是單一科系培訓出來的人員就可以進入職場,反而需要接受更多的訓練後才能上手他們的工作內容。也就是說,現在的工作內容與校園職能培訓並沒有對等上,多數技能都是需要多種不同領域的課程組合在一起,並且內容需要搭配多種能力的訓練。所以在制定所謂核心能力或專業能力的訓練時,更需要注意課程連接性與職場契合度。 例如,基礎課程會是眾多進階課程的基礎。基礎的內容又如何與進階內容結合,可以讓進階內容不需要再次說明基礎內容,如此既可以省時,又可以有效率地讓人員吸收課程內容。 補習班的興起就是課程內容的整合度夠,課程內容各單元間的連接性夠,可以有效率地讓人員吸收課程內容。雖然學歷逐漸無效了,但歸納其原因不外乎就是學習的內容過於理論,流於表面。最終詢問他們在高等教育下學習到什麼可用的內容時,皆是無法答覆出個所以然。當進入職場的新進人員連自己所學習的內容都無法自己整理後說出,那麼等於是他們學習過程沒有任何效果。 教育體制的改革是有必要性的,但是卻不需要繼續僵固下去。 我國培育的人才是為了讓人民在職場上存活,更甚者是可以成為終身志業。絕非現在所見的一灘死水,或是捨教育體系而就證照體系。 最近美國MIT的教授Andraw Lo也鄭重對美國提出報告書,指出美國的科學研發支出下降,影響美國未來的競爭力,特別是其他地區,如歐盟與中國,對科學研發支...

[貨幣銀行學]貨幣就是政府的負債-問世間錢為何物

圖片
用很簡單的影片就能夠展現出貨幣的出現與意義, 為什麼大銀行家可以站在食物鏈的頂端, 他們是怎樣透過貨幣、債券反覆交換而從中獲利,並且產生貨幣創造。 同時,他們也介紹貨幣(currency)與金錢(money)的不同。 貨幣是種借條,而金錢則是具有價值儲存功能。

大資料庫三問

熱門中的熱門議題之一就是大資料庫。 從Google、微軟、Facebook到各家公司都在想盡辦法從過去累積出來的巨量資料內尋找出他們想要的答案,作為決策依據。 有趣的是聽到、看到那麼多大資料庫的消息,連台灣知名的龍頭公司都說他們是用大資料庫解決公司問題。看完相關的 新聞 報導後,大資料庫用來做預警功用是結果,而使用的方法是用統計分析去分析資料,那麼我想提出第一個問題: 大資料庫的數據資料是被用來當作「小」來看「大」嗎? 你認為大資料庫是樣本,才會用統計分析方法去分析那些資料,去找出迴歸模型。那麼,巨量資料是屬於母體?還是樣本?這總得先弄清楚才行。而且,我們還得注意下面的延伸問題: 資料是線性嗎? 運作過程中有將資料轉換以符合線性嗎? 能確定轉換後資料保有「原始」(母體)特性嗎? 資料是非線性時,系統用哪種方法估算?準度多少? 每次新資料進入後,有沒有重新估算預測模型? 有沒有剔除異常值?異常值也是現象之一,該被踢除嗎? 我想他們會說這些都是機密(笑)。 其實,光是看到使用統計分析方法去大資料庫內找規則(模型或模式)就已經令人有點困惑了。因為這違反大數法則概念,換句話說,他們始終都將巨量資料視為樣本,即使已經是巨量了,還是樣本,所以使用樣本的方式估算模型。 那接著,我想問 巨量資料就是呈現常態嗎? 這引發了另一個問題那就是:「 資料有進行測定嗎?有沒有確認資料的分配為何? 」 可別說是使用QQ plot這種方法是用來測定巨量資料的。 若只測定資料是否為常態分配,那僅是冰山一角。 至少也要檢定15種的分配,甚至更多才能夠真正測定資料。有時候那些已知的機率分配不足以告訴我們資料的分配為何,還得用Curve-fitting估算出分配形式,或更進一步確認那種數學模式適合資料。 既然前面問題試圖定義出大資料庫的基本概念,以及大資料庫內的巨量資料規則,那麼我想問的最後第三個問題是 大資料庫要多少資料才算大? 有人可以明確說出大資料庫內的資料要有多少才算是大? 給個例子,如果我將巨量資料視為樣本,進行檢定後發現,10萬筆資料與1億筆資料得到相同拒絕虛無假設的結果。 那麼是10萬筆資料為巨量資料,還是1億筆資料為巨量資料? 若從數量來看,當然要選擇1億筆資料,只是由資料分析角度來看,10萬筆資料就可以知道母體特性,我何必用1億筆資料來知道母體特性呢? 這時候,是資料量的問題,還是分析...

Internal Restriction on Residuals in Linear Regression Model

Mei-Yu Lee (2014) proposes a new concept about the central limit theorem of the residuals from the view of the restriction of the residuals. Computer Simulates the Effect of Internal Restriction on Residuals in Linear Regression Model with First-order Autoregressive Procedures , Journal of Statistical and Econometric Methods, 3(3), 1-22. The general concept of central limit theorem is about a group of variables, {X 1 , ..., X T }, whose average value approaches to the population mean when T is large enough. Thus, when the number of the residuals becomes larger, each residual does not necessarily occur the property of central limit theorem, but the sample mean of the residuals converges to the mean of the errors.   The fact is that the residuals are Normal distribution, but the errors are not necessary Normal distribution.  Lee (2014) provides the evidences and gives an reason due to the conditions of the zero sum of the residuals and the zero sum of the residuals multiplied by...