發表文章

目前顯示的是有「autocorrelation」標籤的文章

開放性資料的估計

過去傳統的計量經濟學、迴歸分析或甚至博士班之相關課程都是建構在抽樣分配、假設檢定與配適出適切的模型,因此,延伸出因分析所需的 Tobit 、 Probit 模型,而在時間序列上則由AR模型延伸出 VAR 等系列模型。 觀察這些模型特徵,不外乎都是建構在線性概念上,換句話說,無論有無前後期關係,模型首先就是展現分類法(可以二分、三分....)以及資料區分出線性可解釋與不可解釋部分。 在「 為何使用曲線化線性迴規模型 」已經提到了重要的兩個觀念後,曲線化線性迴歸模型的特色上,確實與眾不同,同時也難以用紙筆來運算。即使如此,我們不得不說微積分當中的一個觀念是非常有用的,那就是 無論哪種數學模式都可以用泰勒展開式去逼近,其後再加上一個誤差即可代表那個數學模式。 通常經濟學家喜歡用兩階展開來代表,例如,名目與實質利率之間的關係。 問題是真實的資料是否用兩階展開就可以了呢?最後的那個誤差項,又被控制多少呢? 如果遇到的是研究者最常使用的開放性資料,每天(或每分鐘)都在更新的資料來說,愈細微的資料就可以用線性來衡量產生趨勢,預測下一期就會更為精準。所以,若使用的是每分鐘的資料,等於是將一天的資料切割成1440筆資料,然後由1440筆資料估計出線性規則,再由此規則,估計出明天的平均數字。 如此做,好嗎? 這問題就出在於既然是每分鐘更新的開放性資料,那麼研究者想要預測明天第一筆資料就必須將分分鐘鐘的新資料再次的放入,重跑估計與預測。好玩的是,有哪種軟體可以在一分鐘內跑完所有開放性資料,估計出來,並讓其他人使用,或者去買賣股票、網路上進行交易? 所以,當我們遇到開放性資料時,每次新的資料生成後就需要放入資料集內,重跑估計,再比對過去的實際值與估計值,每次都再調整。 而曲線化線性迴歸模型其實很像再使用細微的資料產生線性,再由線性產生曲線。 例如:某股票股價可以反映基本面,所以,先用基本面的財務比率估計股價,再由此股價以曲線方式估計真實股價。 對於開放性資料的估計不一定只能用時間變數(趨勢變數)來估計,當然也可以如上面所言的曲線化線性方式來估計。 而指數的數字則可以呈現出股價的轉折現象,這也是其他模型無法做到的部分,更是捕捉出規律性的方法之一。

Durbin-Watson檢定與LM檢定的存在意義

圖片
每一本統計學、計量經濟學、時間序列分析、迴歸分析、市場預測的書籍都會提到資料自我相關問題。為了找到資料的自我相關性,有的學者從樣本相關係數出發進行資料的假設檢定,有的學者則是創造與樣本相關係數很相近的數學公式進行資料的假設檢定,其中,最知名的便是Durbin-Watson檢定與LM檢定(Breusch–Godfrey)。兩個檢定公式的出發點都是一樣的,那就是從迴歸分析的殘差出發。 Durbin-Watson檢定公式 LM檢定公式 從資料角度去看,無庸置疑的是資料的數值都是已知的,我們使用迴歸分析來瞭解資料間的因果關係。換言之,此時,解釋變數與被解釋變數之間是樣本條件關係。然而,我們卻遺忘了一件事情,那就是資料也是可以形成分配的,那就是抽樣分配。 既然資料可形成抽樣分配,這意味著解釋變數與被解釋變數都是抽樣分配,需要以分配的概念去解讀。於是,在統計學內就明確寫著: 每個樣本服從母體分配 樣本的變異數一樣都是母體變異數 樣本之間是無線性相關 同樣在迴歸分析的解釋變數、被解釋變數與誤差都有各自的母體分配,並且滿足上面的三個條件。同時解釋變數與被解釋變數之間可以是聯合關係,也可以是條件關係。 進一步推導所得到的係數、殘差、甚至是殘差的數學組合、變異數分析表內的SSR、SSE、MSR、MSE、自我相關係數都是抽樣分配。 請注意,這些都是隨機變數或隨機變數的數學組合,所以都是抽樣分配( 只討論一個數字,不是分配 )。當樣本數夠大時,才能夠代表母體分配( 樣本要多大,沒人知道 )。 所以要使用公式前,問問: 你確定資料的抽樣分配了嗎? 你確定資料的抽樣分配轉換過程了嗎?(是數值的亂數表,不是機率生成的亂數表) 隨機變數的數學組合之間有沒有成為函數關係?(例如自我相關係數與MSE) 當我們確定每一個轉換步驟狀況後,就可以觀察到解釋變數數值、解釋變數個數、誤差母體分配、樣本數、殘差限制對Durbin-Watson檢定與LM檢定的抽樣分配變化。 確實,Durbin-Watson檢定適合所有樣本大小,但是Durbin-Watson檢定的決策規則本身有問題,不符合統計公式的原則,那就是灰色地帶判定給虛無假設,因此只有虛無與對立假設的二分法,以及分配的臨界值只會有一個數字,而不會有所謂的上下界。除非沒有控制住解釋變數數值與殘差限制影響,才會讓這兩個影響融入分配當中,造成臨界值的不確定,產生了...