發表文章

目前顯示的是有「timeseries」標籤的文章

【踢爆】你在K線圖上看到的支撐線和壓力線是真的嗎?【第二個觀念】

圖片
 讓我接續已經說明「 觀念1:常見的壓力線和支撐線只是高中數學的兩點決定一直線 」的前篇文章,繼續講講第二個觀念,壓力線和支撐線的先決條件。想要講這個觀念之前,我要先說一下,請不要用你常見或已經學過的技術分析懟我。你有你的技術分析觀念和知識,而我則用數學和統計學觀念和知識在解讀和分享。感謝大家的認可與喜歡,如果感受到冒犯了,請左拐更換關鍵詞搜尋,謝謝理解。 第二個觀念:壓力線和支撐線的先決條件 當你看到下圖的壓力線和支撐線時,有什麼感覺?是不是「往下走」的兩條平行線呢?所謂的「往下走」就是 趨勢方向 。平行的壓力和支撐線賦予一個趨勢方向感。 那什麼是趨勢(Trend)? 請注意上圖的橫軸是時間,從左到右代表從過去到現在,因為線的存在,產生了指引方向,進而讓觀看圖形的人有了趨勢感覺。這個非常簡單的事實現象,以及人們的感覺,只是你可能遺忘潛意識一直使用的固有思維。 兩條黃線可以讓你有趨勢感,就只需用四個收盤價決定!換句話說, 用四個收盤價就決定趨勢,並代表這段時間內所有的股票價格 ,你能認可這種事嗎?這代表其他收盤價的藍點都能消失,不用再看。只要看決定第一個觀念得到的壓力和支撐線的四個點,就夠了!聽起來很天方夜譚,但從上一篇文章的支撐線和壓力線產生方式就是如此。 可是,這一群數字的趨勢意味著,代表這群數字告訴我們的方向和規律性。其中的兩點不能代表這群數字,所以,兩點連成一直線的支撐線和壓力線都不能代表「這群數字的方向和規律性」。 此時,我們就得考慮 有沒有哪種趨勢的表現方式可以代表「這群數字的方向和規律性」呢 ?能夠代表這群數字的直線,既是趨勢線,也是存在誤差的直線。因為趨勢只是平均概念,和實際的數字存在差距。這差距稱為誤差(Error),也稱為風險(Risk)。所以支撐線和壓力線的先決條件是「先要有條趨勢線」,而且是能夠代表所有數字的「趨勢線」。之後再藉趨勢線,產生上下限,各自代表支撐線和壓力線。如此一來,支撐線和壓力線不再是簡單的兩點連成一直線,而是可以「容忍誤差」存在的趨勢上下限。 趨勢從哪來? 直至現在很多專家學者在講時間序列資料的趨勢時,總愛SHOW出折線圖,以此代表趨勢。我今天沒有要說折線圖能否代表趨勢的問題,如果你對折線圖是否能代表趨勢線有興趣,請參考「 股市走勢圖是詐騙還是奇蹟 」的簡報資料。 回到趨勢,人類最簡單的表現方式就是直線。這直線未必穿...

【踢爆】你在K線圖上看到的支撐線和壓力線是真的嗎?【第一個觀念】

圖片
 很多人都在K線圖上畫著各種的線,移動平均線、壓力線、支撐線、三關線等。各種的線條在K線圖上飛舞著,而解說的人就著這些線和股價的K棒位置講得口沫橫飛。然而,正在聽著的人是否真的知道支撐線和壓力線從何而來,為何而來呢? 這篇文章告訴你三個觀念,看完後你就能夠明白壓力線和支撐線的意義,兩者的先決條件是什麼,以及怎樣的線才是壓力線和支撐線。 觀念1:常見的壓力線和支撐線只是高中數學的兩點決定一直線 你看到在K線圖上畫出的支撐線和壓力線,都是畫者自己依照看圖的經驗,找出兩K棒畫出來的。甚至,他們也不管是不是有對應到收盤價位置,可能是K棒的最高價拉到另一個K棒的最高價,形成壓力線。然後再拉出兩個K棒去形成支撐線。 畫者還會說大約畫出來就好,再精準也沒有用。這只是判斷用。我們最後是要看後續有沒有形成三角收斂,然後K棒有沒有突破壓力線。 聽起來都很美好。若大學有學過大一數學和大二統計學的人還因此相信,那大學等於白學了重要的知識和技能。 讓我緩緩道來原因。 那些畫者確實找出兩根K棒,這相當於兩個點幫助他畫出直線,形成壓力和支撐線。此道理在 高中數學的二元一次方程式 就有教。忘記的朋友可以上網看YouTube二元一次方程式就有說明。我在這不再多加贅述。換句話說,高中生和高中老師都懂的知識,他們都能解說K線圖了,何必有那麼多「老師」們在宣傳和招收會員呢? 由此可見,他們用的K線圖只是「宣傳」工具,真正投資給的資訊不是K線圖的資訊,也許是消息面,也許是技術指標的判斷訊號。但「宣傳」時K線圖上壓力和支撐線肯定不是重點。 既然是二元一次方程式,肯定可以找出方程式吧。前述提到「畫得差不多位置就好」已經預先阻止你去思考他們畫線的漏洞了。也就是說,如果你有辦法算出壓力線和支撐線的二元一次方程式,就能找下一個時間點的壓力值和支撐值,直到兩條線交會點(這在高中數學也有教)。 有壓力值和支撐值,你就能和股價去比對。如果股價超過壓力值,那超過多少都能算出來。那為什麼你明明讀過高中,卻還做不到算出壓力線和支撐線的方程式呢?答案特別特別簡單! K線圖的每根K棒有四個數字,請問你選哪個算壓力線和支撐線? 如果你直接在K線圖上畫線,永遠都無法算出壓力線和支撐線,如此就產生了模糊地帶,讓人可以做手腳。例如說可能猜錯,有風險等。事實上, 方程式是沒有誤差的 !這壓力和支撐線從頭到尾都是兩根K棒連線起來的,沒有...

恐慌指數和S&P500指數的相關性

圖片
 想衡量兩變數的相關性,第一個想到的就是「相關係數」(Correlation coefficient)。所謂相關係數是兩變數的直線相關程度。愈趨於1或-1就代表兩變數之間的線性相關愈強烈。 恐慌指數和股價指數的研究認為兩者存在負相關,也就是一個指數的數字愈高,另一個指數的數字就會愈低。這邊我得特別說明一下,這樣的負相關是指兩者存在負的線性相關。而線性相關不代表每個數對都是符合這樣的特性。這是什麼意思呢? 統計學的相關係數是需要一定數對量才能計算相關係數。如果只有兩個數對,那相關係數不是正1就是負1,超過兩個數對就產生介於-1和1之間的數字了。 另外,你加入的數對量會有規律性,也就是累加性出現。這裡指的累加性是數字量帶來的數字規律,在一開始可能不明顯,隨著數對愈來愈多,之前的影響就會逐漸累積產生。 當你使用相關係數時就得考慮要如何界定時間序資料放入計算相關係數的資料量。在這,我提出三種方法: 從時間序的起始日開始,固定此起始日,開始加入新的數對資料,直到結束日。 從時間序的結束日開始,固定此結束日,開始加入最近的舊數對資料,直到起始日。 從時間序的起始日開始,固定N日,每計算完N日的相關係數後,丟棄前一日的數對,加入新一日的數對,繼續計算。 這三種對計算相關係數的資料量定義將帶來不同的相關係數計算方式。而彭博提供的技術指標當中,也有相關係數的計算。有使用彭博資料庫的朋友,再留言分享一下它的計算方法吧。 下圖藍點為第一種方法,紅點為第二種方法得到的相關係數走勢圖。 你看無論是第一種還是第二種的相關係數從22年2月1日開始的相關係數都介於-1到-0.4之間。這代表恐慌指數和S&PP500指數之間確實是負的線性相關。 藍點結果 那我們來看藍點的結果。藍點從22年2月1日開始,第一個相關係數值由五天的數對計算得到,然後繼續增加到6天、7天,依此類推。從22年2月28日到4月29日持續落在-1至-0.9之間,屬於高度負相關。 隨著S&P500指數因通貨膨脹從7月中開始下滑,中間也有超過4000點的期間,但和恐慌指數的相關係數卻下降,甚至出現新聞所謂的關鍵相關性斷裂。不過,從22年9月27日後,相關係數回到-0.6和-0.5之間。 橘點結果 第二種方法從最後的結束日,22年10月13日往前看相關係數的規律性。圖形的橘點從右往左看。在9月和10月中,僅有9月...

時間序列模型分析 - 是否需要定態

數據分析可以成功的原因來自於使用統計學的分析方法,以及電腦軟體的運用。觀察迴歸分析與計量經濟學的基礎皆是從「線性模式」出發,藉由最小平方法的計算,得到估計係數的數學式,此時,一點都不需要分配的假設 - 常態分配。 於是,在高等計量經濟學當中,逐漸地只寫出iid的符號,至於Normal假設則是慢慢消失。但,我們反思,即使沒有寫出Normal符號,是否估計係數的分配就能夠得到,或許讀者可以問問你的老師 (笑)。 有趣的是,同樣的狀況發生在線性模式改為二次式或三次式,即使教科書上寫出來高階次方數的函數,我們卻沒有見過有人跑出結果來 (笑)。這是否表示那是所有撰寫者與理論家的最終極目標呢?我們不可而知....... 此時,為了能夠讓資料符合線性模式,資料使用者只能做一件事情,那就是 - 資料轉換 ,也就是定態( Stationary )。 讓資料定態的方式最簡單的就是差分,然後檢查是否滿足定態條件(請參考任何一本時間序列教科書都會寫)。只因欲檢定的序列資料若不是定態的話,要做「差分」直到定態( 連結  p.2)。對資料分析的人員而言,當資料進行差分後將會發生什麼事情呢? 可想而知,部分資料特性將會消失! 如果你驗證過資料特性,如 從巨量資料分析方法找台日韓兌美元匯率機率密度函數 ,從排序後的資料了解匯率母體分配圖與係數告知之資料特性,那麼,當資料不排序,而是依時間進行迴歸分析,是否就能知道時間變數(固定趨勢)其實就是可以抓住的趨勢,無論固定趨勢、波動或小部分不規則性(但具備短時間同方向)都可以被時間變數所表示。 唯一的問題就是你用線性模式看資料!所以,才需要捨棄部分資料特性,方能使用線性模式去配適,以及忘記了配適後還要轉回原本的資料(但數學轉不回去,Jacobin算不出來),所以,我們看到的都是資料差分、差分、再差分,滿足定態後的資料再去線性估計,而不是真實資料配適出估計多項式或線性估計後再反轉回原始資料的方程式。 於是,我們可以得到一個結論 資料為了適用線性模式需要做定態 找出資料真實模式須使用原始資料  參考資料 1.  連結 2. www3.nccu.edu.tw/~jthuang/class16b.ppt 3. https://www.cyut.edu.tw/~finance/docs/1030-1.pdf 4. 連結

開放性資料的估計

過去傳統的計量經濟學、迴歸分析或甚至博士班之相關課程都是建構在抽樣分配、假設檢定與配適出適切的模型,因此,延伸出因分析所需的 Tobit 、 Probit 模型,而在時間序列上則由AR模型延伸出 VAR 等系列模型。 觀察這些模型特徵,不外乎都是建構在線性概念上,換句話說,無論有無前後期關係,模型首先就是展現分類法(可以二分、三分....)以及資料區分出線性可解釋與不可解釋部分。 在「 為何使用曲線化線性迴規模型 」已經提到了重要的兩個觀念後,曲線化線性迴歸模型的特色上,確實與眾不同,同時也難以用紙筆來運算。即使如此,我們不得不說微積分當中的一個觀念是非常有用的,那就是 無論哪種數學模式都可以用泰勒展開式去逼近,其後再加上一個誤差即可代表那個數學模式。 通常經濟學家喜歡用兩階展開來代表,例如,名目與實質利率之間的關係。 問題是真實的資料是否用兩階展開就可以了呢?最後的那個誤差項,又被控制多少呢? 如果遇到的是研究者最常使用的開放性資料,每天(或每分鐘)都在更新的資料來說,愈細微的資料就可以用線性來衡量產生趨勢,預測下一期就會更為精準。所以,若使用的是每分鐘的資料,等於是將一天的資料切割成1440筆資料,然後由1440筆資料估計出線性規則,再由此規則,估計出明天的平均數字。 如此做,好嗎? 這問題就出在於既然是每分鐘更新的開放性資料,那麼研究者想要預測明天第一筆資料就必須將分分鐘鐘的新資料再次的放入,重跑估計與預測。好玩的是,有哪種軟體可以在一分鐘內跑完所有開放性資料,估計出來,並讓其他人使用,或者去買賣股票、網路上進行交易? 所以,當我們遇到開放性資料時,每次新的資料生成後就需要放入資料集內,重跑估計,再比對過去的實際值與估計值,每次都再調整。 而曲線化線性迴歸模型其實很像再使用細微的資料產生線性,再由線性產生曲線。 例如:某股票股價可以反映基本面,所以,先用基本面的財務比率估計股價,再由此股價以曲線方式估計真實股價。 對於開放性資料的估計不一定只能用時間變數(趨勢變數)來估計,當然也可以如上面所言的曲線化線性方式來估計。 而指數的數字則可以呈現出股價的轉折現象,這也是其他模型無法做到的部分,更是捕捉出規律性的方法之一。

為何使用曲線化線性模型

圖片
當我們想知道資料特性或規律性時,傳統做法是根據統計學概念,認為資料=樣本,必然帶有母體特性。藉由資料找到母體參數即可確認母體特性,從而知道資料特性或規律性為何。 然而,受限在使用資料找到的母體參數卻是有限,例如,一定要找到一、二階動差,即平均數與變異數,如此就能配合樣本數找到極限分配,知道母體特性。在大數法則下,無論是p.或a.s.,都趨近為常態分配。 問題是多少資料點才能算大數? 這如同我們在問大數據多少才算? 如果4,000筆已經達到,那何必4,000,000,000筆資料。 這想法並非正確! 因為每筆資料都有存在的意義,而且,大數據資料下,未必真成為常態分配或極限常態分配。 這點更明顯地顯示在時間序列資料,因為這種資料會破壞迴歸分析的三個基本假設: 常態分配 齊質變異數 兩兩無線性相關 為了解決這些問題,特別是像變數之走勢,無法用線性模式去估計的序列資料,計量經濟學發展出多種的檢定公式,檢定上面的三個基本假設,並且希望更能準確地找出資料問題,試圖解決。 縱使如此,我們卻發現 分配的檢定方法無法控制誤差,資料的殘差幾乎可以滿足常態分配 變異數的齊一性建立在線性迴歸上,誰能保證資料一定是線性,特別是工業工程。若是用非線性迴歸模型,或許變異數就齊質了。 架構在線性迴歸模型上,序列相關運用差分方式,試圖找出差分到幾階才能踢除序列相關。可是,差分後的資料,部分特性將會消失。 更有趣的是,Silverman (1985) 提出無母數版本的曲線配適法,觀察範例後可以發現其轉折點不能超過兩點,也可以從他的數學式看出,僅有二階微分。 Motulsky and Ransnas (1987) 則是提到需要資料點來自於常態分配(進入迴圈:如何確定資料點滿足常態分配),以及非線性迴歸模型很容易經過多次的電腦運算後配適得到(問題:怎麼進行誤差控制?多次的運算需要多少次?)。 無論如何,使用曲線化線性模型或曲線配適法都是比線性迴歸模型來得好,特別是現在的經濟環境在科技進步到一定的程度後,必須提高精準度,才能夠突破現況。這不是工業4.0(要求精密)、金融3.0(要求跨平台與安全),而是分析技術的創新與提升。 於是,我們需要更新兩個思維: 第一、一般而言,我們認為線性之外就是屬於變異(波動)。 圖片來源:http://stats.stackexchange.com/questions/1910...

理性投資人偏好正向偏態還是負向偏態?

圖片
2010年David Merkel在網路上寫了一篇文章「 Do Investors Prefer Negative Skewness? 」。他從經濟學的代理人問題模型與黑天鵝理論,提出投資人是偏好「負向偏態」(Negative skewedness)。在其中的一段文字敘述當中, It can be extremely difficult to ascertain the true distribution of an extremely negatively skewed bet from historical data. A long run without an observed loss makes us less confident about any initial negative thesis. This is also the primary explanation for why we prefer longshots in horse races or play the lottery. Merkel更從道德風險角度說明 the Great Moderation has been characterised by a Fed that is willing to cut interest rates at the smallest hint of trouble, even in situations where systemic risk was far from severe. 所以,Merkel認為 The moral hazard subsidy, the principal-agent problem and investor “irrationality” each incentivise economic actors to take on considerably negatively skewed bets. 以及 Assessing the relative contributions of each from historical market data is extremely difficult given that there is no plausible way to separate the e...

台灣95汽油大數據分析

圖片
我國汽油的訂價策略是根據每週原油價格加權指數的變化,此指數包括70%的杜拜原油與30%的布蘭特原油。 若不考慮原油價格,純粹就95汽油的訂價來看,從CMoney資料庫內,選擇自2000年1月3日到2015年12月31日的日資料視為母體資料,進行強大數法則(SLLN)規則控制誤差,由資料展現出分配函數。 95油價機率函數 上圖的第一圖為機率密度函數,第二圖則為累積機率密度函數。其中,最低的95油價為15.6655元,而最貴的95油價為33.7745元 由於我國對汽油價格嚴格管制,2008年中華民國消費者文教基金會針對我國油價不透明的浮動油價機制提出質疑。可到了 2012 年,中油說明虧損嚴重的原因之一就是國際油價上漲與政府管制所致。另外,曾志超( 2011 )提到台灣油價未完全反映成本,凍漲反而造成成本分攤不均問題。特別是在春節前後,政府為了討好選民就會運用油價凍漲的政策( 2014 , 2015 )。 眾多的新聞內容再再說明我國對汽油價格的嚴格管制,然而,上述所言之新聞並沒有辦法提出有效的證據來證實我國對汽油價格管制之嚴格程度。因此,上圖可發現,我國95油價會有特別常出現的油價,28.1325元。有多常出現呢?圖形顯示45.9159%的經常性出現28.1325元價位。 你可能懷疑,45.9159%,這樣的出現機率算是很高嗎? 布蘭特原油現貨價機率函數 看看,上圖的布蘭特原油價格的機率密度函數,最常出現價位的機率也僅有2.9996%而已。這也難怪我國國民對於油價訂價公式的不理解。因為95油價的機率密度函數最常出現價位之機率太高了,若真的是依照浮動油價公式定價,那麼在公告前一定還會有微調,使得95油價常可維持在同一個價位。當然這也有可能是因為遠期期貨契約的因素所致。 透過大數據分析,可以很明顯地看出我國95油價的特性。 詳情可參考 李玫郁 、李堯賢、林哲揚,2016,「國際油價與中油油品價格之大數據特徵分析」,台灣銀行季刊,67(2),53-78.

Durbin-Watson檢定與LM檢定的存在意義

圖片
每一本統計學、計量經濟學、時間序列分析、迴歸分析、市場預測的書籍都會提到資料自我相關問題。為了找到資料的自我相關性,有的學者從樣本相關係數出發進行資料的假設檢定,有的學者則是創造與樣本相關係數很相近的數學公式進行資料的假設檢定,其中,最知名的便是Durbin-Watson檢定與LM檢定(Breusch–Godfrey)。兩個檢定公式的出發點都是一樣的,那就是從迴歸分析的殘差出發。 Durbin-Watson檢定公式 LM檢定公式 從資料角度去看,無庸置疑的是資料的數值都是已知的,我們使用迴歸分析來瞭解資料間的因果關係。換言之,此時,解釋變數與被解釋變數之間是樣本條件關係。然而,我們卻遺忘了一件事情,那就是資料也是可以形成分配的,那就是抽樣分配。 既然資料可形成抽樣分配,這意味著解釋變數與被解釋變數都是抽樣分配,需要以分配的概念去解讀。於是,在統計學內就明確寫著: 每個樣本服從母體分配 樣本的變異數一樣都是母體變異數 樣本之間是無線性相關 同樣在迴歸分析的解釋變數、被解釋變數與誤差都有各自的母體分配,並且滿足上面的三個條件。同時解釋變數與被解釋變數之間可以是聯合關係,也可以是條件關係。 進一步推導所得到的係數、殘差、甚至是殘差的數學組合、變異數分析表內的SSR、SSE、MSR、MSE、自我相關係數都是抽樣分配。 請注意,這些都是隨機變數或隨機變數的數學組合,所以都是抽樣分配( 只討論一個數字,不是分配 )。當樣本數夠大時,才能夠代表母體分配( 樣本要多大,沒人知道 )。 所以要使用公式前,問問: 你確定資料的抽樣分配了嗎? 你確定資料的抽樣分配轉換過程了嗎?(是數值的亂數表,不是機率生成的亂數表) 隨機變數的數學組合之間有沒有成為函數關係?(例如自我相關係數與MSE) 當我們確定每一個轉換步驟狀況後,就可以觀察到解釋變數數值、解釋變數個數、誤差母體分配、樣本數、殘差限制對Durbin-Watson檢定與LM檢定的抽樣分配變化。 確實,Durbin-Watson檢定適合所有樣本大小,但是Durbin-Watson檢定的決策規則本身有問題,不符合統計公式的原則,那就是灰色地帶判定給虛無假設,因此只有虛無與對立假設的二分法,以及分配的臨界值只會有一個數字,而不會有所謂的上下界。除非沒有控制住解釋變數數值與殘差限制影響,才會讓這兩個影響融入分配當中,造成臨界值的不確定,產生了...