發表文章

意向大數據分析_分辨資料視覺化下的聯合機率和條件機率

圖片
有人問我資料視覺化不就是資料進來後,經過整理就使用漂亮的UI來展現資料就可以知道資料的關聯嗎? 現在很多資料視覺化確實都是走向這樣的方向。可是讓我們回到資料分析的初衷,為什麼要做資料分析! 資料分析的目的就是希望從資料當中根據我的問題去找到答案,可以是驗證我所想的,也可能是發現問題點,或是意想不到的結果。那你所使用的資料真的可以就這樣丟進去,然後展現嗎? 我看到很多情況都是弄個走勢圖,就像匯率走勢、股價走勢、營收結構(圓餅圖或環狀圖)等,這些對我們提出的問題有什麼意義呢? 我在自己的研究中,特別是匯率關聯性,以及特定魚種價格關聯性,就發現了如果只是用走勢圖展現出資料來,其實根本就看不出個所以然。就其原因那是時間序列資料,你用走勢圖顯示,卻不代表不同國家匯率走勢就能表現他們之間的關聯性。 有人又說,我可以求相關係數(矩陣),這樣一樣可以知道那些資料的關聯性。我承認確實可以用相關係數矩陣,但這是有前提的,那係數值是建立在線性關係上,如果不是線性關係😵。好吧,你可以說課本沒教,受限於工具與學習經驗,所以不管! 那真是受限工具與學習經驗嗎?好像並非如此。 意向大數據分析是建立在機率論上,以機率值幫助我們知道數字或文字特徵。所以,如果可以將那些文字或數字以意向大數據分析方法來解讀,自然也是有理論基礎,而且也是過去學習過的知識。 這時,又發生了一個問題!我們可以計算邊際機率(這是我們最常看到的計算機率方式),條件機率(學統計學或計量經濟學時都會學到的迴歸分析就是架構在條件下),聯合機率(全部一起看,特別複雜,有時候很難解釋)。 所以,當我們計算出這些機率值後,就要根據自己詢問的問題特色來選擇邊際、條件或是聯合機率,而不是通通都認為是邊際機率或聯合機率。 我們最常發生的是條件與邊際傻傻分不清,特別是在資料視覺化圖像上! 這是怎麼一回事呢?下面的資料是來自常態分配的一組條件機率。為了能夠繪製出圖形,所以經過排序後,可以形成列聯表,列為Y,欄為X,然後繪製出圖形。 我們可以看到在對應的分類(對角線)很明顯條件機率為0.8~0.819,其左右,對角線的機率值則為0.22~0.25,在條件機率下,可以看出分類號碼相同,以及分類號碼加減1就會產生機率。 那聯合機率呢?下方圖內為Excel的截圖。可以看出聯合機率也是在對角線上有機率值,在鄰近的分類號也有機率值,但是,可以發現 對角線的機率...

意向大數據分析_資料視覺化_聯合機率法

圖片
意向大數據分析方法可以適用於同時出現文字與數字的資料。然後透過計算每個層次的機率與每個層次之間所形成的條件機率,我們可以繪製出樹狀圖來顯示每個可能路徑。樹狀圖會因為層次的排序不同而不同,所以這樣的樹狀圖會非常龐大的,計算起來也非常麻煩。 下面,我用三個層次的例子來說明意向大數據分析方法的使用。 資料內容 隨機調查一萬個人,記錄他的性別、居住區域、年所得(萬元) 男   北          52.4863746029 男   南         123.4805768599 女   北         331.9074010055 男   北         243.1755663228 男   南         180.8876075778 男   北         158.3195187234 男   北         193.4245893981 男   北         236.3479604666 男   南         146.9041270653 女   北         228.9483905483 男   北         187.6686910211 女   北         358.9686625266 男   南         14...

應用意向大數據分析於銷售

情   境 現下取得產品品項名稱、銷售數量(以X4表示),單價分類與區域,對此四組資料,可以了解特定產品品項在哪些區域賣得比較好,以及在當地銷售的數量和單價如何。 為了回答這樣的問題,我設定了層次順序為 產品品項 → 區域 → 單價分類 → 銷售數量 對唯一的數字資料,分為2組。X4 最小值=1.000000  最大值=507.000000 對單價則分為低單價、中單價、高單價、超高單價 其他文字類型的資料,以文字來分類 資料來源:使用模擬銷售資料,並調整部份數據 分    析    結    果 第一個問題特定產品在哪個區域賣最好呢?想回答這個問題,我們要選擇條件機率的最大值會是比較好的。所以經過意向大數據分析後,得到 由 家用紙品 估計結果 北部 由 女性衛生用品 估計結果 北部 由 嬰兒尿褲 估計結果 北部 無論是哪種產品品項條件下,都是在北部最好販售(出現機率最高)。 既然是在北部最好販售,那麼定價上有什麼特徵呢? 由 家用紙品 and 北部 估計結果 超高單價 由 家用紙品 and 中彰投 估計結果 超高單價 由 家用紙品 and 南部 估計結果 中單價 由 家用紙品 and 東部 估計結果 中單價 由 女性衛生用品 and 北部 估計結果 超高單價 由 女性衛生用品 and 中彰投 估計結果 中單價 由 女性衛生用品 and 南部 估計結果 低單價 由 女性衛生用品 and 東部 估計結果 低單價 由 嬰兒尿褲 and 北部 估計結果 超高單價 由 嬰兒尿褲 and 中彰投 估計結果 超高單價 由 嬰兒尿褲 and 南部 估計結果 超高單價 由 嬰兒尿褲 and 東部 估計結果 中單價 從意向大數據分析的結果中,我挑出產品品項且在北部的定價分類,分別有 由家用...

surface pro 3 滑鼠游標卡在左上

今天在使用OneNote一段時間後,忽然螢幕畫面不能控制了。滑鼠的游標就像中毒一樣,卡在螢幕畫面左上方,然後一直跳動,根本沒辦法控制畫面,造成打字時無法打字。 我以為是耕莘未完全,那就關機後重開機,然後進行windows更新。更新完後,有改善,而且此時還沒開啟OneNote。 既然滑鼠可以重新控制,並且移動得很順暢,那就繼續使用OneNote 2016,沒想到...... 就是 OneNote的問題!!!!!!!!!!!!!!!!! 滑鼠游標又一直飄回畫面左上角...................😖😖 好吧,還是要使用,就勉強用好了,趕緊用工作管理員關閉全部的OneNote 可以請微軟更新一下嗎?我是很久沒用OneNote,今天想要紀錄事情,這才發現新的Windows更新,讓OneNote跟滑鼠相衝............ 註:網上說是硬體觸控螢幕問題,我關閉螢幕驅動,沒有用,滑鼠一樣不能控制。

怎樣的健康促進比較有效?

圖片
健康促進的宣導包含口腔、飲食、防止跌倒與菸害。對於高齡的受試者的性別、年齡與經宣導後的受測分數進行分析,我們想知道 性別會影響宣導後的受測總分嗎? 不同年紀會影響宣導後的受測總分嗎? 當我們知道宣導後的受測總分時,哪種宣導活動是高齡受試者最容易且關注的活動呢? 數字經過次數分配表的分類後可以得到 年齡的分類 總分的分類 X3 口腔運動的分數 健康飲食宣導的分數 防止跌倒的宣導分數 菸害宣導的分數 ******************************************************************************* 第一個問題的分析結果為 不同性別對總分影響 中位數法 由 F 估計結果 X3分類= 77 由 M 估計結果 X3分類= 83.2 平均數法 由 F 估計結果 E(X3分類)= 73.9 由 M 估計結果 E(X3分類)= 80.7 最大值法(眾數) 由 F 估計結果 X3分類= 70.8 由 M 估計結果 X3分類= 83.2 最小值法 由 F 估計結果 X3分類= 64.6 由 M 估計結果 X3分類= 64.6 根據上述的分析結果,我們可以發現中位數法、平均數法與眾數法都顯示女性(F)的總分低於男性(M)。而且三種方法比較下,明顯可以看出女性(F)的總分以中位數法最高,其次是平均數法,最低為眾數法。這代表女性的總分應呈現左偏的分數分佈。而男性(M)的總分分佈不同於女性。經觀察後可發現平均數法的總分最低,中位數法與眾數法是相同的總分。 至於最小值法則是代表總分出現的可能性最低的數值,也可以代表為極端值。因為無論男性或女性是最少人獲得的分數。這也代表多數受試者在宣導後對健康促進都有所了解,很少受試者落於分類1(最低分)。 ******************************************************************************* 第二個問題則是不同年齡對總分的影響。       中位數法 由 X2分類= ...

醫療數據的意向大數據分析應用 - 醫療實驗有效嗎?

圖片
我使用醫療數據說明了如何 建立樹狀圖與貝氏定理的機率 ,這篇網誌則是我們想知道 醫療實驗中,總膽固醇的前後變化是如何,實驗有效嗎? 所以,我們有實驗組與對照組。所謂實驗組是有進行醫療實驗的,而對照組則是沒有進行醫療實驗的。 因為有樹狀圖的每個路徑的機率,同樣也可以計算出所有條件下的條件機率,再加上這都是文字類型的數據,所以,我從機率當中排序找出中位數、眾數還有最小機率對應的數據,討論實驗後的總膽固醇反推實驗前的總膽固醇為何。 我設定的流程是先確定是否在實驗組→在實驗前測量總膽固醇→實驗後再測量總膽固醇。所以,在所有的數據分析後,實驗組在實驗前的總膽固醇是正常,同樣對照組也是。也就是說實驗體都是正常的。 如果使用最小機率法,則是實驗前的總膽固醇為動脈硬化高危險群。 如果在實驗類別與實驗前總膽固醇分類條件下,分析實驗後總膽固醇狀況是否改善。從中位數法與眾數法可以發現,實驗組的實驗前總膽固醇過高會在實驗後便正常,而一開始正常,實驗後仍是正常。至於對照組,同樣也發生實驗後有改善現象。 至於最小機率法則是實驗組的總膽固醇變化很極端,同樣對照組也一樣。 -------------- 接著,我想知道實驗後的總膽固醇結果下,他們在實驗前的總膽固醇是如何。這是一個貝氏定理的概念。甚至我也想知道總膽固醇的前後面化是來自哪種實驗類型。 下表顯示無論實驗後膽固醇是正常、過高或過低,都對應實驗前是正常。甚至實驗後的總膽固醇是動脈硬化高危險群,但實際上實驗前是過高而已。至於若使用最小機率法來判斷,則實驗後的總膽固醇正常或過高,都會反推為實驗前是動脈硬化高危險群。若實驗後是過低的總膽固醇,則實驗前是過高的總膽固醇。至於實驗後是動脈硬化高危險群,在實驗前則是正常。 如果從三個層次來看,更能看出怪異的情況。從實驗前後的總膽固醇條件下,是來自哪種實驗類型的結果可以看出, 由中位數與眾數得到 當實驗後是正常,實驗前是過高的情況是來自於對照組 當實驗後是過低,實驗前是過高的情況是來自於對照組 當實驗後是正常,實驗前是正常的情況是來自於實驗組 上面的三個現象是我希望看到的,代表實驗確實能夠改善總膽固醇。但是,三個結果,兩個來自對照組,一個來自實驗組,實驗組還是前後都是正常。換句話說這個實驗是無效的。 當實驗後是過高,實驗前是過高的情況是來自於實驗組 當實驗後是過高,實驗前是正常的情況是來自於對照組 當時實驗...

醫療數據的意向大數據分析應用 - 樹狀圖與貝氏定理

圖片
【前言】 醫療數據可以透過檢驗後得到數據紀錄,我們可以取得醫療數據後進行意向大數據分析。現在的文明病之一就是膽固醇太高,導致心血管疾病,以及引發出其他的疾病。不過,所有的膽固醇都是有其重要性(參考1)。 【數據分類說明】 本次範例為膽固醇狀況。透過抽血檢驗後,我們可以根據膽固醇標準為檢測值做分類。根據的原則來自 高密度膽固醇(HDL) / 膽固醇 < 2 => 低密度膽固醇越大顆 低密度脂蛋白膽固醇(LDL) < 130mg/dl  該指標可以預測低密度膽固醇不是細細小小顆。如果三酸甘油酯越高且高密度膽固醇越低,指標值就會高於2,此時相對的低密度膽固醇會越小顆 。(參考自 https://www.commonhealth.com.tw/article/article.action?nid=75538 ) 總膽固醇(CHOL)正常值介於為130--200mg/dl,平均約190mg/dl 總膽固醇的臨界值為 200~239mg/dl,容易發生 高膽固醇血症 總膽固醇超過 250mg/dl時,可能會形成動脈硬化 HDL膽固醇的正常值,男性為40-60mg/dl,女性為50-70mg/dl HDL 若低於40mg/dl,最好注意心肌梗塞,腦血栓,高血脂症等疾病 (參考自  http://tpfile.tcavs.tc.edu.tw/teacher/20305/教學資源/膽固醇連結.htm ) LDL-C 超過 130 mg/dl,或 LDL-C / HDL-C 的比值超過 3.5,都是發生心血管疾病 (冠心症、中風等) 的高危險群 HDL-C 小於 30 mg/dl ,或 「總膽固醇 / HDL-C」 的比值大於 5.0,都代表有較高的機率發生動脈粥狀硬化 (參考自 http://www.kgh.com.tw/health/15-226.html ) 【意向大數據分析】 這裡的範例將顯示製作樹狀圖與意向大數據分析的貝氏定理的機率計算。對於意向大數據分析,最重要的就是「意向」。所以本例設定的是第一層次為總膽固醇值、第二層次為LDL / HDL、第三層次為CHOL / HDL。 樹狀圖 經過計算後,我們可以得到樹狀圖。樹狀圖的機率為聯合機率,所以總和為1。 意向大數據分析結果 根據貝氏定理的計算,下表的第二與三欄為條件事件,第一欄為我們的問...