顯示具有 大資料庫 標籤的文章。 顯示所有文章
顯示具有 大資料庫 標籤的文章。 顯示所有文章

2019年11月8日 星期五

意向大數據分析_資料視覺化_聯合機率法

意向大數據分析方法可以適用於同時出現文字與數字的資料。然後透過計算每個層次的機率與每個層次之間所形成的條件機率,我們可以繪製出樹狀圖來顯示每個可能路徑。樹狀圖會因為層次的排序不同而不同,所以這樣的樹狀圖會非常龐大的,計算起來也非常麻煩。


下面,我用三個層次的例子來說明意向大數據分析方法的使用。

2016年11月11日 星期五

大數據 (big data) 分析的困境

從蒐集資料開始

#大數據 (#bigdata) 的起源是採用網路蒐集資料,但是資料的代表性與正確性沒有一套方法做比對和分析,自然就不能做時間性的變動狀況分析或是資料來源不同的差異性分析,只能呈現蒐集資料的狀態。
資料蒐集與測定是此部分必須要做的工作,目前台灣的大數據分析都以資料蒐集為主,至於資料特性都是以數字型態做說明,並且至今無有效方法做有分析方法與軟體做測定。當資料特性無法確定時,無法確定進一步分析的方法和分析後所得結果就無法確定結果符合分析的目標。其實蒐集後的資料就是「資料礦( #datamining )」,要使用分析方法探討資料的特性才能進行分析資料。
蒐集資料的困難及資料特性是否一致,(1)不能簡單的假設所有蒐集的資料是同一特性,因為有假設就必須檢定。(2)分析不同資料來源的特性與差異性分析和相關係分析。(3)「#數字科學」不是說明資料而是反應資料的內容,並且必須採用數學模型解釋資料。

分析資料的理論

大數據的分析方法是「八仙過海各顯神通」,但是都是針對別性狀況且都是個別的方法並無系統的分析方法,同時分析的理論與方法都是「祕而不宣」,其實就是沒有一系列的分析方法形成科學。
既然大數據分析是科學方法,就必須採用科學或數學方式建立一套分析的理論與方法並提供大眾做驗證與批評。
#統計學 (#statistics)就是分析資料的方法。只要將統計學中的分析對象與資料量做擴充與修正,就可以有系統的分析資料與採用統計學的角度說明分析的結果,並且可以使得教育時間縮短有利用分析方法的推展。 然而,統計學方法擴展到「大數據分析」的困境有其以下問題:
  1. 母體分配必需為常態分配,無法擴展到其他母體分配。
  2. 統計的檢定臨界值受到樣本的限制(數值分析無法有效獲得),無法提供大數據分析的樣本個數的臨界值。
  3. 「大數法則」與「中央極限定理」並無數學與計算方法發展正確的「極限分配」。
  4. 沒有精確的檢定統計量的抽樣分配作為基礎。
目前市售的「統計學套裝軟體」是以目前統計學的樣本個數與方法所發展,無法解決統計學方法擴展到「大數據分析」的困境, 自然無法使用於大數據分析。想解決上述的問題就是得採用其他的數學方法。「#機率分配模擬器」 可以克服「#微積分」與「#數值分析」的限制,可以提供以上問題的解決方法。 目前已經完成統計學分析大數據的公式與方法,可以處理 1,000,000,000筆資料並且對母體分配有特殊要求,也就是 distribution free,可以跨越「數字科學」的藩籬。除此之外,還有
  1. 大資料庫的母體機率分配的估算(包含Curve-fittting)
  2. 一個母體的平均數與變異數的檢定
  3. 兩個獨立母體的平均數與變異數的檢定
  4. 兩個相關母體的平均數與變異數和相關係數的檢定
  5. 一類因子分析
  6. 多個獨立母體平均數與變異數檢定
  7. 簡單線性模式分析(包含非線性模式與Curvi-linear分析)
  8. 複迴歸分析(包含逐步分析)
  9. Durbin Watson檢定統計量
  10. 時間數列分析

2016年10月11日 星期二

大數據分析方法論(1)

無論中文如何翻譯Big data為大數據或巨量資料,實際上,這些資料的目的就只有一個,那就是找出資料特徵,告訴我們一些規則(Rule)、規律(Regularity)或模式(Pattern)。

過去的研究方法對於模式的認定上,首先萃取出的即是線性趨勢。 受限於線性,偏離線性的部分都歸納在離差(Deviation)上,這產生了變異數(Variance)。於是,線性迴歸模型延伸出ARCH與GARCH模型,這也是事件研究法的根基。

但是,當我們使用這些方法時,對於資料特徵的檢測卻是不足的。例如,研究者有沒有先檢查原始資料的分配為何?還是直接跑完迴歸或實驗設計,再用殘差去檢查誤差分配呢?

2016年3月14日 星期一

開放性資料的估計

過去傳統的計量經濟學、迴歸分析或甚至博士班之相關課程都是建構在抽樣分配、假設檢定與配適出適切的模型,因此,延伸出因分析所需的TobitProbit模型,而在時間序列上則由AR模型延伸出VAR等系列模型。

觀察這些模型特徵,不外乎都是建構在線性概念上,換句話說,無論有無前後期關係,模型首先就是展現分類法(可以二分、三分....)以及資料區分出線性可解釋與不可解釋部分。

在「為何使用曲線化線性迴規模型」已經提到了重要的兩個觀念後,曲線化線性迴歸模型的特色上,確實與眾不同,同時也難以用紙筆來運算。即使如此,我們不得不說微積分當中的一個觀念是非常有用的,那就是

2016年1月19日 星期二

台灣95汽油大數據分析

我國汽油的訂價策略是根據每週原油價格加權指數的變化,此指數包括70%的杜拜原油與30%的布蘭特原油。

若不考慮原油價格,純粹就95汽油的訂價來看,從CMoney資料庫內,選擇自2000年1月3日到2015年12月31日的日資料視為母體資料,進行強大數法則(SLLN)規則控制誤差,由資料展現出分配函數。

2015年7月20日 星期一

從巨量資料分析方法找台日韓兌美元匯率機率密度函數

話說台灣是以出口為導向的國家,新台幣匯率的穩定與否與國際情勢深深地影響台灣出口狀況。所以在匯率相關文獻上,例如,王泓仁(2005)使用結構式自我迴歸模型探討央行持有國外資產淨額變動率、銀行隔夜拆款利率、M2變動率、自然對數下之CPI、自然對數下之工業生產指數、新台幣兌美元匯率、外貿比例、貿易條件為內生變數進行匯率與其他變數關係討論,另外使用GARCH討論新台幣匯率成長率之波動。

蔡聰勇(2006)以ARCH模型分析日本央行干預日元兌美元匯率對新台幣匯率波動影響。何棟欽(2001)則是建立誤差校正模型(ECM),使用隔夜拆款利率、基本放款利率、存款利率與10年期中央公債次級市場利率,發現台灣央行的存放款利率調整無僵固性,短期利率傳遞至公債利率效果不佳,但長天期存款利率則較為理想。傅澤偉、黃國安、林曼莉(2014)比較僵固型價格貨幣理論模型、資產組合平衡模型與行為均衡匯率模型,認為僵固型價格貨幣理論模型為佳。

不過這些分析匯率之模型多仍建構在
  1. 線性模型上,即使是GARCH模型也是一樣。
  2. 誤差是常態分配上。

事實上,在資料定序的基礎上,各國匯率不太可能是常態分配,即使解釋變數放入後的迴歸模型也是一樣。這不只是假迴歸問題,而需要從根本討論起。

在巨量資料分析下,若選擇1779/1/1至2015/04/17期間的日資料,可發現新台幣匯率之機率密度函數是可以被找到的。


左圖為日元兌美元匯率之機率密度函數圖、中間圖為韓元兌美元匯率之機率密度函數圖、右圖為新台幣兌美元匯率之機率密度函數圖。觀察圖形可知,

  1. 從全距與變異數來看,新台幣兌美元匯率 < 日元兌美元匯率 < 韓元兌美元匯率
  2. 從偏態、峰態與變異係數來看,新台幣兌美元匯率 < 韓元兌美元匯率 < 日元兌美元匯率
  3. 從機率密度函數圖來看,台日韓匯率都有雙峰傾向
  4. 從特定匯率值出現機率來說,台灣有39.83%最大機率盯住特定匯率值、日本有3.87%最大機率盯住特定匯率值、南韓僅有0.58%最大機率盯住特定匯率值

南韓在外匯市場上的干預是最少的,這是起源於1997年南韓為了度過東南亞金融風暴而向IMF借款救經濟時,要求依據國際組織之外匯管制規範,不再高度干預外匯市場。因此,在匯率的機率密度函數圖表當中特別明顯可以看到這樣的結果。

詳情參考李堯賢、王譯賢、李玫郁,2015,大數據資料下新台幣匯率與日元、韓元之連動研究,臺灣銀行季刊,第66卷,第4期,56-74。

資料如何算巨量?

巨量資料顧名思義即是大量的資料,然而資料量多大才算是巨量呢?
誰能說得清?1個億?10個億?


現階段的開放資料(open data),哪個是有上億資料?若整個資料庫來說確實有,但對於分析人員來說,特定幾個資料表才是重點。例如,貨幣政策的研究員在意利率、貨幣供給量、國內生產毛額、發行定期存單量。若由最大時間單位的變數決定(季),且假設從1955年至2014年皆有資料,則60年*4,此時,每個變數有240筆資料,本例有4個變數,所以共計960筆資料。
這不算是巨量資料,但可視為母體資料,並且資料量會隨時間而增加,所以每次估算就需納入最新資料。這無法預測非常準確,但可以增加準確性。


2015年4月9日 星期四

大資料庫三問

熱門中的熱門議題之一就是大資料庫。
從Google、微軟、Facebook到各家公司都在想盡辦法從過去累積出來的巨量資料內尋找出他們想要的答案,作為決策依據。

有趣的是聽到、看到那麼多大資料庫的消息,連台灣知名的龍頭公司都說他們是用大資料庫解決公司問題。看完相關的新聞報導後,大資料庫用來做預警功用是結果,而使用的方法是用統計分析去分析資料,那麼我想提出第一個問題: