發表文章

醫療數據的意向大數據分析應用 - 醫療實驗有效嗎?

圖片
我使用醫療數據說明了如何 建立樹狀圖與貝氏定理的機率 ,這篇網誌則是我們想知道 醫療實驗中,總膽固醇的前後變化是如何,實驗有效嗎? 所以,我們有實驗組與對照組。所謂實驗組是有進行醫療實驗的,而對照組則是沒有進行醫療實驗的。 因為有樹狀圖的每個路徑的機率,同樣也可以計算出所有條件下的條件機率,再加上這都是文字類型的數據,所以,我從機率當中排序找出中位數、眾數還有最小機率對應的數據,討論實驗後的總膽固醇反推實驗前的總膽固醇為何。 我設定的流程是先確定是否在實驗組→在實驗前測量總膽固醇→實驗後再測量總膽固醇。所以,在所有的數據分析後,實驗組在實驗前的總膽固醇是正常,同樣對照組也是。也就是說實驗體都是正常的。 如果使用最小機率法,則是實驗前的總膽固醇為動脈硬化高危險群。 如果在實驗類別與實驗前總膽固醇分類條件下,分析實驗後總膽固醇狀況是否改善。從中位數法與眾數法可以發現,實驗組的實驗前總膽固醇過高會在實驗後便正常,而一開始正常,實驗後仍是正常。至於對照組,同樣也發生實驗後有改善現象。 至於最小機率法則是實驗組的總膽固醇變化很極端,同樣對照組也一樣。 -------------- 接著,我想知道實驗後的總膽固醇結果下,他們在實驗前的總膽固醇是如何。這是一個貝氏定理的概念。甚至我也想知道總膽固醇的前後面化是來自哪種實驗類型。 下表顯示無論實驗後膽固醇是正常、過高或過低,都對應實驗前是正常。甚至實驗後的總膽固醇是動脈硬化高危險群,但實際上實驗前是過高而已。至於若使用最小機率法來判斷,則實驗後的總膽固醇正常或過高,都會反推為實驗前是動脈硬化高危險群。若實驗後是過低的總膽固醇,則實驗前是過高的總膽固醇。至於實驗後是動脈硬化高危險群,在實驗前則是正常。 如果從三個層次來看,更能看出怪異的情況。從實驗前後的總膽固醇條件下,是來自哪種實驗類型的結果可以看出, 由中位數與眾數得到 當實驗後是正常,實驗前是過高的情況是來自於對照組 當實驗後是過低,實驗前是過高的情況是來自於對照組 當實驗後是正常,實驗前是正常的情況是來自於實驗組 上面的三個現象是我希望看到的,代表實驗確實能夠改善總膽固醇。但是,三個結果,兩個來自對照組,一個來自實驗組,實驗組還是前後都是正常。換句話說這個實驗是無效的。 當實驗後是過高,實驗前是過高的情況是來自於實驗組 當實驗後是過高,實驗前是正常的情況是來自於對照組 當時實驗...

醫療數據的意向大數據分析應用 - 樹狀圖與貝氏定理

圖片
【前言】 醫療數據可以透過檢驗後得到數據紀錄,我們可以取得醫療數據後進行意向大數據分析。現在的文明病之一就是膽固醇太高,導致心血管疾病,以及引發出其他的疾病。不過,所有的膽固醇都是有其重要性(參考1)。 【數據分類說明】 本次範例為膽固醇狀況。透過抽血檢驗後,我們可以根據膽固醇標準為檢測值做分類。根據的原則來自 高密度膽固醇(HDL) / 膽固醇 < 2 => 低密度膽固醇越大顆 低密度脂蛋白膽固醇(LDL) < 130mg/dl  該指標可以預測低密度膽固醇不是細細小小顆。如果三酸甘油酯越高且高密度膽固醇越低,指標值就會高於2,此時相對的低密度膽固醇會越小顆 。(參考自 https://www.commonhealth.com.tw/article/article.action?nid=75538 ) 總膽固醇(CHOL)正常值介於為130--200mg/dl,平均約190mg/dl 總膽固醇的臨界值為 200~239mg/dl,容易發生 高膽固醇血症 總膽固醇超過 250mg/dl時,可能會形成動脈硬化 HDL膽固醇的正常值,男性為40-60mg/dl,女性為50-70mg/dl HDL 若低於40mg/dl,最好注意心肌梗塞,腦血栓,高血脂症等疾病 (參考自  http://tpfile.tcavs.tc.edu.tw/teacher/20305/教學資源/膽固醇連結.htm ) LDL-C 超過 130 mg/dl,或 LDL-C / HDL-C 的比值超過 3.5,都是發生心血管疾病 (冠心症、中風等) 的高危險群 HDL-C 小於 30 mg/dl ,或 「總膽固醇 / HDL-C」 的比值大於 5.0,都代表有較高的機率發生動脈粥狀硬化 (參考自 http://www.kgh.com.tw/health/15-226.html ) 【意向大數據分析】 這裡的範例將顯示製作樹狀圖與意向大數據分析的貝氏定理的機率計算。對於意向大數據分析,最重要的就是「意向」。所以本例設定的是第一層次為總膽固醇值、第二層次為LDL / HDL、第三層次為CHOL / HDL。 樹狀圖 經過計算後,我們可以得到樹狀圖。樹狀圖的機率為聯合機率,所以總和為1。 意向大數據分析結果 根據貝氏定理的計算,下表的第二與三欄為條件事件,第一欄為我們的問...

意向大數據分析介紹

圖片
在大數據分析當中,我們會遇到很多的資料是同時有文字或是數字,有時候全部都是文字。於是,出現了結構性與非結構性分析。而文字探勘成為大數據分析當中很重要的一個學習與應用功能。然而,在文字的資料分析中,多是基於挖礦與敘述性統計與圖像分析。 然而,若要進一步使用統計分析卻沒有辦法。過去有貝氏定理簡易版的馬可夫鏈,讓樹狀圖可以發揮作用,產生前後關係的關聯性計算。 什麼是意向大數據分析 如果數據當中同時有文字跟數字,或都是文字,想用統計分析是不容易的。意向大數據分析是個非常好用的方式協助我們同時分析文字、文字+數字的資料類型。而所謂的意向是指決策者或使用者的意向為主,也就是先決定問題,然後再根據問題從數據當中找尋證據。尋找證據的方法就稱為意向大數據分析。 基礎概念 既然有文字或文字+數字,那麼,讓我們回到統計學最基礎的概念,那就是事件(event)。 事件可以以文字或數字表示,所以我們可以根據事件得到機率。如果將事件轉換成以數字表示,就會形成隨機變數。由隨機變數與對應的機率就可形成機率分配。有了機率分配就能夠了解分配特性(參數)。若數據為樣本,則可進行統計分析,包含區間估計和假設檢定。 想要了解相關性,可以使用迴歸分析,除此之外,還有就是下面要介紹的貝氏定理的樹狀圖。 樹狀圖可以讓分類產生層次,只要分類足夠多就能一直增加層次。而且所有的分類並非固定的。你可以選擇讓A在第一層,也可以讓B在第一層(如下圖)。 例如,只考慮性別跟婚姻狀況,樹狀圖就如同下圖所示。 至於上圖內的機率,第一層為邊際機率,第二層與更多層的機率為條件機率(相關觀念可以參考維基百科或是任一本的統計學教科書)。 但是想要有更多層次的樹狀圖機率計算就得依賴電腦運算,我們手算是非常困難計算出的。所以,想要超過五層的樹狀圖計算都是不容易的。另外,貝氏定理提供我們可以在後面的層次去算前面的層次發生機率。甚至跳躍選擇層次計算發生機率。例如,現在有A到E的層次,並且層次為A - C - E - B - D。貝氏定理可以讓我們找出 P( E | D)、P(C | B & E)或是 P( A | E & B & D)等。當然,直接照著層次計算機率也是可以的,例如,P( E | A & C)。 不過,貝氏定理的運用為什麼會那麼困難呢?由於貝氏定理是以樹狀圖的基礎,所以只要層次越多就會讓整個樹狀圖越大...

【計量大數據分析】【人工智慧基礎】概念

圖片
人工智慧(Artificial Intelligence, AI)從1970年代就開始的概念與持續追求的目標。這數十年來,為了達到人工智慧,從資料探勘、大數據、人工智能到人工智慧,其目的都在尋找 資料的規律性 若能尋找出資料的規則,將之寫成代碼,形成程式,就能夠讓電腦產生運算,並自我判定。然而,所有的資料均需要被定序,然後再開始檢測,尋找出規則,產生數學模式,寫成代碼。這樣的步驟,最方便的方式不是產生數學模式,而是產生資料庫,讓電腦運用比對方式,找到最近似的模式,以此為『最適模式』進行分析。 換句話說,這是兩個階段性的問題。 第一個階段是電腦能夠運算數據的數字規則, 第二個階段是電腦能夠自我判定何者最佳。 第二個階段比較好回答。『何者最佳』等於均方差(Mean-square-errors, MSE)最小。因為誤差最小,所以精準度就高,模式就會是最好的。 第一個階段雖說是演算法計算數字規則,但卻需要能夠建構數字規則的模式,同樣也得可以解構數字規則模式,如此才能自我驗證。 計量大數據分析意義 這次計量大數據分析主要是學習 如何將已經取得的數據進行建構數字規則,以及解構數字規則模式 。過去,計量經濟學是根據統計學基礎,加上迴歸分析,特別針對迴歸係數估計方法,並且必須滿足 二維常態分配(同時討論X與Y),或條件常態分配(給定X,討論Y)的假設 下進行討論。然後延伸到當誤差具有異質性,以及誤差具有序列相關的解決方法。另外,也有討論到大樣本趨近的漸進分配(Asymptotic distribution),試圖讓數據滿足中央極限定理(Central limit theorem)。 然而,在計量經濟學當中有兩個最大的問題點,第一點是討論的漸進分配僅是理論,無法實務操作( 參考大數據分析基礎 - 大數法則 (中央極限定理) )。第二點就是沒有人敢保證數據符合常態分配! 沒錯,常態分配+常態分配還是常態分配,資料分析者需要保證成對樣本均來自常態分配。此外,多數的數據常發生『常態分配+非常態分配』或是兩個非常態分配的加減乘除。 沒有人知道這兩個問題的解答!更有趣的是 成對樣本的結果會等於條件樣本的結果嗎? 光從聯合機率與條件機率來看就知道不可能的事情,而計量經濟學教科書卻都轉為用條件來討論迴歸分析。 迴歸分析一定要常態分配假設嗎? 即使我沒設定誤差服從常態分配,僅使用高中數學所學的最小平...

OneNote教師在課堂使用的好工具

圖片
OneNote對教師而言是個非常方便的工具,只要使用學校的電子郵件,申請微軟教育版,那麼就可以開始,然後安裝OneNote Class Notebook就可以產生課程筆記本。如果是安裝Microsoft OneNote 2016,就會內建OneNote Class Notebook。 認識課程筆記本 首先,OneNote 課程筆記本跟一般筆記本不同的地方是 師生可以一起在共同作業空間編輯內容,  分組專題研習  教師發放課程資料給學生,嵌入影片及其他平台的教材  觀看每一位學生的個人筆記本,照顧學生的個別需要  在同一地方處理不同的多媒體資源,方便使用  容易更新課程,為特定學生增加新的資訊 當新增一個課程筆記本時,筆記本的節點會預設共用節點,「內容庫」與「共同作業空間」。 課程筆記本會有預設共用節點 「內容庫」是教師輸入資料,提供講義給學生的地方。所有的內容對學生來說都是唯讀的,無法進行編輯。  「共同作業空間」則是課程中所有成員都能讀取與寫入的地方,可以進行共享資料與作業。 如何增加課程筆記本 在工具列會有「建立課程筆記本」的按鈕 點選「建立課程筆記本」後,會跳出網頁至OneNote課程筆記本的設定畫面。如果沒有連線就沒辦法使用。 設定課程筆記本需要連線到微軟的office帳號那邊進行設定 簡報匯入OneNote一樣可以撥放 對教師而言,如果能夠將簡報匯入OneNote,如同播放簡報一般使用,對教師的資料整理也是極為有幫助的。 第一步:找到你想要插入的簡報並且開啟,然後按下【Windows鍵+N】 運用Send to OneNote功能 第二步:選擇你想要放置的頁面位置,然後按下【確定】 確認放置位置 第三步:開啟全螢幕畫面,就可以變成撥放畫面。右上會有操作按鈕,同時也可以選擇在簡報上直接增添你的註解(手寫) 參考資料 https://www.microsoft.com/zh-tw/videoplayer/embed/9775808f-ad7a-4505-8efc-eec9d3947de6?pid=ocpVideo0-innerdiv-oneplayer&postJsllMsg=true&market=zh-tw 文章同步發表於 http://telegra.ph/OneNote...

OneNote介紹

圖片
對OneNote的第一次接觸是2002年,那時候在微軟的紙飛機計畫當中,就有提到希望可以直接在電腦上手繪。當時平板電腦還沒有很盛行,最知名的就是Acer的TravelMate C110與C300。 C110 圖片來源:http://electricdoc.net/archives/128 我自己曾使用過Acer C110、工人舍S32-SC3KP08HTW、大同天機等。最快陣亡的是工人舍。大同天機在當時寫筆記時,風扇總是嗚嗚作響,加上那重量,我的小胳膊實在是無力長時間承受,所以果斷在使用三週後立即賣掉。 工人舍TPC 圖片來源:http://blog.andytn.tw/2008/11/kjss32-sc3kp08htw.html 大同天機 資料來源:http://www.fhm.com.tw/article?id=21231 OneNote的版本 在所有平板電腦的使用者而言,微軟的OneNote真的是非常方便的筆記本紀錄,OneNote的設計上也是確實如此。 OneNote可以做什麼 目前OneNote版本有兩種,一種是「OneNote」是Windows市集可以下載的;另一種則是「OneNote 2016」,這是來自於安裝Windows Office時一併安裝的版本。 OneNote 2016 安裝在Windows 10,以及使用畫面 OneNote 安裝在Windows 10以及使用畫面 OneNote + Surface 真的是非常好用! 畫面設計 OneNote畫面設計是三層式設計: 筆記本  節次  頁面 OneNote三層架構 圖片來源:https://www.educatorstechnology.com/2018/02/the-redesigned-onenote-is-powerful-note.html 如何開始使用OneNote 對所有使用者而言,在使用前需要了解以下幾點事情: 需要先確定你想要建立的筆記本,需要分哪些節點,以及頁面是否足夠表達你希望展現的。因為我們常會遇到超過三層的筆記架構,所以這需要事先想好。  一開始可以嘗試直接建立筆記本,甚至是做一個「蒐集箱」筆記本,然後將節點設計為「今日」、「明日」、「未來」。這就成為一開始蒐集資訊的分類筆記,同時也可以做GTD或專案。同一個筆記可以設定很多節點,所以,...

【推廣】大數據分析軟體

圖片
所謂的大數據是指機率模型,在巨量的資料下找到機率模型模式。若要憑空學習大數據分析並不容易,所以根據機率與統計的概念當中,對樣本個數進行切割,分成大樣本與小樣本。 統計學就是使用在分析小樣本,從小樣本了解母體的狀況。而大數據分析則是從大樣本去進行分析,而由於是在大樣本下,所以 適用於所有母體分配 。因此,若想知道大樣本的狀況,同樣也是可以用統計學的分析方法進行分析,例如: 資料來源:Psccc機率與統計粉絲專頁(不經授權不得轉載) 只是在大數據分析的公式上略有不同,經「機率分配模擬器」與「大數法則」的驗證,可得到大數據分析所需要使用的樣本平均數與變異數的公式: 資料來源:Psccc機率與統計粉絲專頁 (不經授權不得轉載) 資料來源:Psccc機率與統計粉絲專頁(不經授權不得轉載) 資料來源:Durbin Watson 檢定統計量 對於軟體的使用上,資料取得後,大數據分析可是用各種分配,其原因如上。只是對可計算與執行的平均數與變異數估計式必須先行取得。對此,作者在統計分析、模擬分析與大數據分析上取得三者的交集,由模擬器模擬資料來進行統計分析的公式驗證,再逐步推展到大數據下的資料關聯。因此,這套軟體是可以進行公開測試與自行創造變數變換的公式。 至於使用的方式,是使用指令檔將資料與軟體呼叫的檔案分開,讓使用者容易用指令檔更改,並選擇對應之資料來源與選項所需的參數設定。 假設檢定 迴歸分析 適合度檢定 大數據分析軟體放置在Facebook的Psccc_機率與統計的粉絲專頁。 https://www.facebook.com/Psccc_機率與統計-1664152793914411/