原文地址:http://blog.csdn.net/hguisu/article/details/9210385算法
大數據是一個含義普遍的術語,是指數據集,如此龐大而複雜的,他們須要專門設計的硬件和軟件工具進行處理。該數據集一般是萬億或EB的大小。這些數據集收集自各類各樣的來源:傳感器,氣候信息,公開的信息,如雜誌,報紙,文章。大數據產生的其餘例子包括購買交易記錄,網絡日誌,病歷,軍事監控,視頻和圖像檔案,及大型電子商務。
在大數據和大數據分析,他們對企業的影響有一個興趣高漲。大數據分析是研究大量的數據的過程當中尋找模式,相關性和其餘有用的信息,能夠幫助企業更好地適應變化,並作出更明智的決策。 數據庫
Hadoop 是一個可以對大量數據進行分佈式處理的軟件框架。可是 Hadoop 是以一種可靠、高效、可伸縮的方式進行處理的。Hadoop 是可靠的,由於它假設計算元素和存儲會失敗,所以它維護多個工做數據副本,確保可以針對失敗的節點從新分佈處理。Hadoop 是高效的,由於它以並行的方式工做,經過並行處理加快處理速度。Hadoop 仍是可伸縮的,可以處理 PB 級數據。此外,Hadoop 依賴於社區服務器,所以它的成本比較低,任何人均可以使用。apache
爲了幫助企業用戶尋找更爲有效、加快Hadoop數據查詢的方法,Apache軟件基金會近日發起了一項名爲「Drill」的開源項目。Apache Drill 實現了 Google's Dremel.編程
據Hadoop廠商MapR Technologies公司產品經理Tomer Shiran介紹,「Drill」已經做爲Apache孵化器項目來運做,將面向全球軟件工程師持續推廣。api
該項目將會建立出開源版本的谷歌Dremel Hadoop工具(谷歌使用該工具來爲Hadoop數據分析工具的互聯網應用提速)。而「Drill」將有助於Hadoop用戶實現更快查詢海量數據集的目的。安全
「Drill」項目其實也是從谷歌的Dremel項目中得到靈感:該項目幫助谷歌實現海量數據集的分析處理,包括分析抓取Web文檔、跟蹤安裝在Android Market上的應用程序數據、分析垃圾郵件、分析谷歌分佈式構建系統上的測試結果等等。服務器
經過開發「Drill」Apache開源項目,組織機構將有望創建Drill所屬的API接口和靈活強大的體系架構,從而幫助支持普遍的數據源、數據格式和查詢語言。網絡
RapidMiner是世界領先的數據挖掘解決方案,在一個很是大的程度上有着先進技術。它數據挖掘任務涉及範圍普遍,包括各類數據藝術,能簡化數據挖掘過程的設計和評價。架構
功能和特色
免費提供數據挖掘技術和庫
100%用Java代碼(可運行在操做系統)
數據挖掘過程簡單,強大和直觀
內部XML保證了標準化的格式來表示交換數據挖掘過程
能夠用簡單腳本語言自動進行大規模進程
多層次的數據視圖,確保有效和透明的數據
圖形用戶界面的互動原型
命令行(批處理模式)自動大規模應用
Java API(應用編程接口)
簡單的插件和推廣機制
強大的可視化引擎,許多尖端的高維數據的可視化建模
400多個數據挖掘運營商支持
耶魯大學已成功地應用在許多不一樣的應用領域,包括文本挖掘,多媒體挖掘,功能設計,數據流挖掘,集成開發的方法和分佈式數據挖掘。框架
Pentaho BI 平臺不一樣於傳統的BI 產品,它是一個以流程爲中心的,面向解決方案(Solution)的框架。其目的在於將一系列企業級BI產品、開源軟件、API等等組件集成起來,方便商務智能應用的開發。它的出現,使得一系列的面向商務智能的獨立產品如Jfree、Quartz等等,可以集成在一塊兒,構成一項項複雜的、完整的商務智能解決方案。 Pentaho BI 平臺,Pentaho Open BI 套件的核心架構和基礎,是以流程爲中心的,由於其中樞控制器是一個工做流引擎。工做流引擎使用流程定義來定義在BI 平臺上執行的商業智能流程。流程能夠很容易的被定製,也能夠添加新的流程。BI 平臺包含組件和報表,用以分析這些流程的性能。目前,Pentaho的主要組成元素包括報表生成、分析、數據挖掘和工做流管理等等。這些組件經過 J2EE、WebService、SOAP、HTTP、Java、JavaScript、Portals等技術集成到Pentaho平臺中來。 Pentaho的發行,主要以Pentaho SDK的形式進行。 Pentaho SDK共包含五個部分:Pentaho平臺、Pentaho示例數據庫、可獨立運行的Pentaho平臺、Pentaho解決方案示例和一個預先配製好的 Pentaho網絡服務器。其中Pentaho平臺是Pentaho平臺最主要的部分,囊括了Pentaho平臺源代碼的主體;Pentaho數據庫爲 Pentaho平臺的正常運行提供的數據服務,包括配置信息、Solution相關的信息等等,對於Pentaho平臺來講它不是必須的,經過配置是能夠用其它數據庫服務取代的;可獨立運行的Pentaho平臺是Pentaho平臺的獨立運行模式的示例,它演示瞭如何使Pentaho平臺在沒有應用服務器支持的狀況下獨立運行;Pentaho解決方案示例是一個Eclipse工程,用來演示如何爲Pentaho平臺開發相關的商業智能解決方案。 Pentaho BI 平臺構建於服務器,引擎和組件的基礎之上。這些提供了系統的J2EE 服務器,安全,portal,工做流,規則引擎,圖表,協做,內容管理,數據集成,分析和建模功能。這些組件的大部分是基於標準的,可以使用其餘產品替換之。