發表文章

目前顯示的是有「統計學」標籤的文章

統計學本質和架構筆記 - 101認識統計學的兩大板塊

圖片
 AI新知力系列 統計學本質和架構筆記 - 101認識統計學的兩版塊 數學和統計學是大數據分析和人工智慧領域中的基礎,也是核心。多數已經將大數據分析和人工智慧視為高等分析和高等技術領域,其人才具備的知識量是高深且需要花費大量時間才能有所成。確實也是如此,因為要真正成為大數據分析和人工智慧核心技術研發人員就得具備數學、統計、機率、電腦科學的高等專業知識。 在美國1970年代,正在研發人工智慧的時候,曾有一項學術計畫 - 他們想要培養可以同時具備上述四類專業知識的理科人才。很可惜這項計畫最終失敗,並且人工智慧後來也不再被提起,直到網路時代開展到一定程度後,再一次被提及並實現著。網路時代下的人工智慧不同於1970年代前後所做的人工智慧。所以主導的學科也不相同。 圖片來源:自製 我開啟AI新知力的新篇章,將和學校教學的內容全然不同,從統計學的本質出發,以簡單易懂的方式,讓對此有興趣的你能夠快速理解統計學整體架構,脫離統計學和機率論的數理推導。 什麼是統計學兩大板塊 圖片來源:自製 統計學的世界觀就是這兩大板塊組成 - 母體(population)和樣本(samples)。一般教科書也就提個一句話,然後定義一下什麼是母體,什麼是樣本,就開始進入統計學主題。可我要說,別小看這樣的兩大板塊,這就是統計學的立基。我用此二板塊歸納對應出哲學觀、背後的方法(見上圖)。 1. 母體和樣本就像柏拉圖和亞里士多德的哲學世界觀。 兩的板塊從哲學觀來說,就如同柏拉圖和亞里士多德的哲學關係。柏拉圖認為這世間萬物都有原型,你可以將原型當作是完美的型態。而世間萬物就是原型的投射,帶著原型特徵。柏拉圖的世界觀是站在全知全能的神的角度在看世界,而亞里士多德則是主張從世間萬物去觀察、拼湊出老師所說的原型。 於是,母體和樣本的關係中,母體就像柏拉圖所說的原型。你是全知全能的神,母體的所有資訊你都知道。樣本就像亞里士多德所說的世間萬物,我們需要觀察樣本才能知道母體長怎樣。 2. 母體和樣本都需要數學,差異是在於母體是機率論,樣本是統計學。機率是統計之母,如果知道機率,那麼統計就可以退休了。 了解統計學兩大板塊的重要性 萬事皆有起頭,任何學科都是如此。知識傳承需要這樣的做法,而非照本宣科。你會以為我在譁眾取寵,特立獨行地用些和課本上不同的架構和名詞,讓你感覺不同。 我和團隊超過10年以上的研發後,已經發展...

【踢爆】你在K線圖上看到的支撐線和壓力線是真的嗎?【第二個觀念】

圖片
 讓我接續已經說明「 觀念1:常見的壓力線和支撐線只是高中數學的兩點決定一直線 」的前篇文章,繼續講講第二個觀念,壓力線和支撐線的先決條件。想要講這個觀念之前,我要先說一下,請不要用你常見或已經學過的技術分析懟我。你有你的技術分析觀念和知識,而我則用數學和統計學觀念和知識在解讀和分享。感謝大家的認可與喜歡,如果感受到冒犯了,請左拐更換關鍵詞搜尋,謝謝理解。 第二個觀念:壓力線和支撐線的先決條件 當你看到下圖的壓力線和支撐線時,有什麼感覺?是不是「往下走」的兩條平行線呢?所謂的「往下走」就是 趨勢方向 。平行的壓力和支撐線賦予一個趨勢方向感。 那什麼是趨勢(Trend)? 請注意上圖的橫軸是時間,從左到右代表從過去到現在,因為線的存在,產生了指引方向,進而讓觀看圖形的人有了趨勢感覺。這個非常簡單的事實現象,以及人們的感覺,只是你可能遺忘潛意識一直使用的固有思維。 兩條黃線可以讓你有趨勢感,就只需用四個收盤價決定!換句話說, 用四個收盤價就決定趨勢,並代表這段時間內所有的股票價格 ,你能認可這種事嗎?這代表其他收盤價的藍點都能消失,不用再看。只要看決定第一個觀念得到的壓力和支撐線的四個點,就夠了!聽起來很天方夜譚,但從上一篇文章的支撐線和壓力線產生方式就是如此。 可是,這一群數字的趨勢意味著,代表這群數字告訴我們的方向和規律性。其中的兩點不能代表這群數字,所以,兩點連成一直線的支撐線和壓力線都不能代表「這群數字的方向和規律性」。 此時,我們就得考慮 有沒有哪種趨勢的表現方式可以代表「這群數字的方向和規律性」呢 ?能夠代表這群數字的直線,既是趨勢線,也是存在誤差的直線。因為趨勢只是平均概念,和實際的數字存在差距。這差距稱為誤差(Error),也稱為風險(Risk)。所以支撐線和壓力線的先決條件是「先要有條趨勢線」,而且是能夠代表所有數字的「趨勢線」。之後再藉趨勢線,產生上下限,各自代表支撐線和壓力線。如此一來,支撐線和壓力線不再是簡單的兩點連成一直線,而是可以「容忍誤差」存在的趨勢上下限。 趨勢從哪來? 直至現在很多專家學者在講時間序列資料的趨勢時,總愛SHOW出折線圖,以此代表趨勢。我今天沒有要說折線圖能否代表趨勢的問題,如果你對折線圖是否能代表趨勢線有興趣,請參考「 股市走勢圖是詐騙還是奇蹟 」的簡報資料。 回到趨勢,人類最簡單的表現方式就是直線。這直線未必穿...

恐慌指數和S&P500指數的相關性

圖片
 想衡量兩變數的相關性,第一個想到的就是「相關係數」(Correlation coefficient)。所謂相關係數是兩變數的直線相關程度。愈趨於1或-1就代表兩變數之間的線性相關愈強烈。 恐慌指數和股價指數的研究認為兩者存在負相關,也就是一個指數的數字愈高,另一個指數的數字就會愈低。這邊我得特別說明一下,這樣的負相關是指兩者存在負的線性相關。而線性相關不代表每個數對都是符合這樣的特性。這是什麼意思呢? 統計學的相關係數是需要一定數對量才能計算相關係數。如果只有兩個數對,那相關係數不是正1就是負1,超過兩個數對就產生介於-1和1之間的數字了。 另外,你加入的數對量會有規律性,也就是累加性出現。這裡指的累加性是數字量帶來的數字規律,在一開始可能不明顯,隨著數對愈來愈多,之前的影響就會逐漸累積產生。 當你使用相關係數時就得考慮要如何界定時間序資料放入計算相關係數的資料量。在這,我提出三種方法: 從時間序的起始日開始,固定此起始日,開始加入新的數對資料,直到結束日。 從時間序的結束日開始,固定此結束日,開始加入最近的舊數對資料,直到起始日。 從時間序的起始日開始,固定N日,每計算完N日的相關係數後,丟棄前一日的數對,加入新一日的數對,繼續計算。 這三種對計算相關係數的資料量定義將帶來不同的相關係數計算方式。而彭博提供的技術指標當中,也有相關係數的計算。有使用彭博資料庫的朋友,再留言分享一下它的計算方法吧。 下圖藍點為第一種方法,紅點為第二種方法得到的相關係數走勢圖。 你看無論是第一種還是第二種的相關係數從22年2月1日開始的相關係數都介於-1到-0.4之間。這代表恐慌指數和S&PP500指數之間確實是負的線性相關。 藍點結果 那我們來看藍點的結果。藍點從22年2月1日開始,第一個相關係數值由五天的數對計算得到,然後繼續增加到6天、7天,依此類推。從22年2月28日到4月29日持續落在-1至-0.9之間,屬於高度負相關。 隨著S&P500指數因通貨膨脹從7月中開始下滑,中間也有超過4000點的期間,但和恐慌指數的相關係數卻下降,甚至出現新聞所謂的關鍵相關性斷裂。不過,從22年9月27日後,相關係數回到-0.6和-0.5之間。 橘點結果 第二種方法從最後的結束日,22年10月13日往前看相關係數的規律性。圖形的橘點從右往左看。在9月和10月中,僅有9月...

兩組資料比對,尋找差異

當我們取得兩組資料後,通常就會開始做兩母體平均數之差的檢定,以及兩母體變異數之比的檢定。那是基於常態分配假設下,將區間估計和檢定可以互通的特性發揮出來。但如果你並不知道資料是否為常態分配時,就不能只做檢定,而是區間估計和檢定都要做。而檢定或區間估計所需要的臨界值也需符合資料的母體分配,才不會在統計可容錯的範圍內,無形增加更多的錯誤。 那我們該怎麼做呢?

[掃雷]什麼是建模,有什麼注意事項

很多人都會講建模,但是為什麼要建模?這樣的目的需要確認的,特別是在人工智能或大數據分析時。那我簡單的說明一下。

[掃雷]誰說變異數異質性只能檢定

圖片
計量經濟學當中,談到變異數異質性就是架構在線性迴歸模型上的假設被破壞後所造成的問題,而我們希望能夠解決這樣的問題,所以延伸出變異數異質性的檢定。 為什麼會有變異數異質性問題呢?以下有幾個原因是常見並且被提出的理由: 我們應該選擇衡量個人的數據,但因為獲取不到而使用替代數據。替代數據可能來自平均概念,例如平均家戶就不等於平均每人,造成變異數受到干擾。 自變數數據可能受到其他因素影響,造成自變數應被視為隨機變數,並且其變動會被納入變異數當中,造成異質性發生。 解釋變數是來自偏態係數不為0的分配時,也會造成變異數異質性。 錯誤的數據轉換或是錯誤的模型形式造成變異數異質性。(David Hendry) 第1到3點都是數據的問題,第4點有數據問題,也有模型錯誤問題。 一般的做法就是認為在估計完迴歸模型[註1]後,認為殘差具有變異數的代表性,所以透過檢定殘差確認是否有變異數異質性。常見的檢定方法有Batlett test, Breusch Pagan test, Goldfeld Quandt test, Glesjer test, White test, Ramsey test, Szroter test. 我在這僅說明前四種檢定方法,所有的檢定方法都可以在維基百科上找到。 無論是哪種檢定,虛無假設都是n個變異數值皆相等,那麼對立假設就是至少有一變異數值不相等。 Bartlett's test Bartlett's test的模型為 如果每次有mi個樣本就能夠跑一次上式,所以這代表我們將會有n組的上式進行估計,得到殘差後,利用變異數的計算方法得到估計值。 第二步運用Bartlett's test 上式會有極限分配存在,然後進行檢定。 Breusch Pagan test Breusch Pagan test則認為變異數是解釋變數(或稱為自變數)的線性方程式,亦即 所以我們可以先不管變異數異質性,直接先跑迴歸模型,然後計算出殘差。 第二步建立個別殘差平方除以(殘差平方和除以n) 第三步設定Z為自變數的組合,然後用第二步的g為應變數,跑迴歸模型,計算出殘差與殘差平方和。 第四步產生檢定統計量Q為(g的平方和 - 第三步的殘差平方和) / 2。此時同樣是使用卡方分配,自由度為p - 1去做檢定。 Goldfeld Quandt test Goldfeld t...

台積電和台股指數相關性

我們在看相關性時,統計學的相關係數是個非常不錯的衡量指標,雖然僅是說明線性關係,但仍足夠協助我們知道兩組數字之間的情況。 所謂的相關係數是指兩組數據之間的線性相關程度,其值介於-1至1。用數值可以區分出 相關係數為0  → 兩組數據無線性相關 相關係數為1  → 兩組數據有完全正的線性相關(同向) 相關係數為-1  → 兩組數據有完全負的線性相關(反向)

[掃雷]分析法差之毫釐 - 你真認識迴歸分析的二三事?

圖片
你沒正確拆解迴歸分析的數學結構就別說你學過迴歸分析。無論是統計學、迴歸分析或計量經濟學的課程中,都會說到迴歸模型。當然深入討論迴歸模型的課程多落在迴歸分析或計量經濟學上。可是你知道迴歸分析的數據要求、自變數要求、殘差要求、整個的模式狀態嗎?

[掃雷]分析法差之毫釐 - 你以為的線性真的正確嗎?

圖片
我們常用來尋找兩個變數的關聯方法有兩種 -- 相關係數或迴歸分析。這兩者的基礎都是線性!這是因為我們將線性視為最能表現趨勢方向的指標,所以在經濟學或是股市分析上常以直線來表述長期趨勢。 我們也以這條直線將數據區分出長期趨勢與短期波動。在股市分析上就是長期價值投資與短線操作。

[掃雷]你真的知道MSE嗎?

圖片
MSE是 mean squared error 的縮寫,指實際值與估計值之差的平方和,再除以個數。此定義來自於維基百科。從此定義來說,MSE可以視為變異數的估計量(Estimator)。 通常這定義寫法上都以參數的估計值符號做為表示,而不是使用Y的估計值符號,這意味著網頁表示的 才是真正的表達方式。

[掃雷]你知道如何表達時間序列資料?

圖片
時間序列資料是指當我們在記錄數據時是受到時間影響而形成的資料。例如說股票市場最常見的就是日資料,經濟數據常見的是季資料與年資料。另外企業根據規定需要公布的月營收是月資料、季財報就是季資料、年報就是年資料。 這些因為記錄時有時間因素在其中的資料,可以使用折線圖展示出時間與數據的關係。如此一來就形成了走勢。

[掃雷]當統計量沒有代表性怎辦

當樣本不具代表性,這也代表統計量不具代表性,那麼該怎辦呢? 首先,我們得先確定統計量不具代表性的意思。對所有的統計量,可以是樣本的平均數、變異數、中位數、絕對離差、相關係數、變異係數、峰態係數、偏態係數、分位數等。而統計學則是主要針對樣本的平均數做為理論說明,因此樣本所得到的統計量需要具有充分、不偏、效率、一致性。

[掃雷]樣本與母體不得不說的二三事

圖片
在大多數的網站和書籍上,提到大數據分析,總是說統計學是其分析方法。但是真是如此嗎?大數據的數據量已經超過統計學是用的樣本個數,對於樣本與母體的情況,讓我在這邊跟朋友們分享其二三事吧。 既然要說說兩者的差異,就得從統計學開始說。統計學的基礎是來自於機率、事件的樣本空間。而一個理論的存在就如同柏拉圖提出的哲學觀點一樣:人有其原型。他的弟子亞里斯多德則運用歸納法,從歸納出世間萬物的規律後,從而獲得原型。這兩個觀點就像在說機率的機率空間和樣本空間。讓我們先了解樣本空間和機率空間。 樣本空間則是所有元素的集合(宇集合)以及子集合的集合。所有元素的子集合的集合相當於統計學抽取樣本。這須從宇集合先確定(基礎),再發展出所有元素的子集合的集合。這樣的子集合的集合是種另一種層次的運作。如此才被稱為「樣本空間」。 機率空間是以樣本空間為基礎,而且樣本空間內的「所有元素的子集合的集合」以事件表示,形成事件的所有可能集合,最後再加上事件的機率後就是「機率空間」。這樣的定義(或是符號表是順序)就代表著每次操作時的動作或確認順序。 有時候很多人會將樣本空間與機率空間搞混,甚至牽扯上母體和樣本的關係。無論是母體或樣本都是具有隨機性的。在隨機情況下仍有其規律,所以對其根本的描述要清楚且可區分。我們可以透過機率空間(運作方法為機率公設)協助完成確定討論的範圍與描述。 母體與樣本的差異 在了解樣本空間與母體空間後,對於母體與樣本的差異也可以從集合角度來看。其實樣本來自母體,所以 樣本就是母體的子集合 。另外,我們可將樣本當作是事件的實驗(有時候稱為試驗,此為翻譯問題)。所以統計學在一開始的學習內容中就是先討論機率、事件、隨機變數等的關係。 其次, 樣本可以反映母體的參數特性 。因為這樣的觀點,所以統計學又稱為推論統計,特別針對樣本的數學組合能否代表母體參數進行推估。這才會出現點估計要滿足充分、不偏、效率與一致性。而驗證點估計量是否具有這些特性就需要使用各種的點估計方法,例如迴歸分析愛用的BLUE,或是UMVUE法、MME法、MLE法等。 第三,要滿足第二點還需要一個條件,那就是樣本數(或稱為樣本規模)愈大,愈接近母體個數時就愈容易反映母體特性。雖然是如此說,但這有個問題就是樣本數到底要多大去反映母體特性。請注意所謂的母體特性都只是母體參數。所以大數據分析就是特別喜歡用這樣的角度去說母體分析。但實際上沒...