發表文章

目前顯示的是有「巨量資料」標籤的文章

[掃雷]你的資料真的是來自常態分配嗎?

圖片
 有模擬器的人肯定會知道這件事情,那就是資料檢定後是常態分配,但未必真的是! 為什麼我會如此說呢?有很多因素影響著數據看起來像常態分配,例如序列相關[註1]。當你依著順序輸入資料時,就產生了順序感。這個順序感會讓數字之間產生關係,當然也可能不會。一旦產生關係後,你的資料可能在檢定時就是常態分配。

人工智能?人工智慧?大數據?巨量資料?大資料?

最近發現總有人會用名詞來針對。這就像寫論文時,有的人總說不能使用We 或是 I,一定要使用the paper, the article或this study之類的。可是,我所看的期刊論文,全部都有人使用,沒有一定要強制讓We變成the study之類的情況。這應該是個人在寫作時的風格才對。 所以,我就在這篇網誌的標題上以這些常見的名詞來說明一下吧。

大數據分析的突破點 - 模擬器認識機率分配

圖片
機率分配是統計學開始學習時的第二個重點。即使如此,我們所能認識的機率分配有限,可能限於課本所提,以及機率分配的特性無法全面摸透。所以這篇文章就是說明可以使用模擬器了解機率分配,也可以用模擬器建模檢測。 機率分配的起頭 當我們學習機率分配是在認識機率、事件、隨機變數、機率空間後,就會想要知道隨機變數與機率之間的關係。 但在這邊,我要說明的是隨機變數不是隨便將事件轉換成任意數字就可以,而是這些數字必須為有意義的數字,而且還要能匹配隨機特性,後續的數字運算也同樣要有意義。而不是我自己隨便將事件說是12345,實際上這12345形成的數字運算,根本沒有任何意義,就像問卷的尺度數字或是經濟學的效用值。 機率分配的意思與特性 機率分配就是表現隨機變數與對應機率的關係。這個關係可以用數學方程式表現。因此,開始了機率密度函數與累積機率密度函數特性,間斷型機率分配與連續型機率分配。常見的母體機率分配可以有45種[1],例如極端值的分配 -- U-quadratic分配和Arcsin分配,當然還有非對稱分配 - F分配,特定參數值下的Gamma分配等,也有找不到參數或參數很複雜的韋伯分配、柯西分配、一般常態分配(縮寫GND)等。 下面對於這些機率分配的特性,例如, 常態分配相加還是常態分配 常態分配相減還是常態分配 標準常態分配平方是卡方分配 標準常態分配相除是柯西分配 Gamma分配 卡方分配是Gamma分配((ν/2, 2)    v是自由度 指數分配(參數為λ)是Gamma分配(1, 1/λ)  if  X  ~ Gamma( k , θ ), then  {\displaystyle X^{q}}  for  {\displaystyle q>0}  follows a  generalized gamma distribution  with parameters  p  = 1/ q ,  d  =  k / q , and  {\displaystyle a=\theta ^{q}} f  X  ~ Gamma( k ,  θ ), then 1/ X  ~ I...