当前位置：文档之家› HBDW-PM-数据仓库基础

HBDW-PM-数据仓库基础

主讲人：黄侃

湖北电信数据仓库项目组

2006年12月

湖北电信经营分析与决策支持系统

数据仓库基础

议程

?何为数据仓库

?数据仓库特点

?数据仓库平台

?Teradata能做什么

从信息系统体系结构说起

“自然演化体系结构”：蜘蛛网

–数据缺乏可信性–不利于生产率的提高–从数据到信息转化

?数据无时基?数据算法上的差异?抽取的多层次?外部数据问题

?无起始公共数据源

?不可预测?数据定位烦琐?要写的程序很多。?每个程序必须是定制的。?报表的延续可用性和继承性差

?缺乏集成化在应用程序中没有存储足够的历史数据以满足D S S分析员的需求?自然演化的系统体系结构带来很多问题

：

新的体系结构－数据仓库产生

?两种基础数据的并存

>原始数据:公司每天操作运行所用的细节性数据

>衍生/导出数据：统计出来的或计算出来的满足公司管理者需要的数据

面向应用

详细的

为日常工作服务的可更新的

处理需求事先可知事务处理驱动

…面向主题

综合的或提炼的为管理决策服务的不可更新的

处理需求事先未知分析处理驱动

…

?原始数据与衍生/导出数据之间存在着本质区别

在适当的时间将正确的信息传递给适当的人，以作出正确的决策

Get the right information to the right people at the right time to make the right decisions

数据Data

决策

Decision

知识

Knowledge

信息

Information

什么是数据仓库

数据仓库的驱动力

业务问题:

如何留住最有价值的客户？

谁是最有价值的客户?

哪些客户有可能停止使用我公司的

产品或服务？

哪些客户有可能成为竟争对手的客

户?

议程

?何为数据仓库

?数据仓库特点

?数据仓库平台

?Teradata能做什么

一般系统和数据仓库的特征比对

面向主题与面向应用

OLTP 与DSS

简单查询与复杂查询

已知查询与未知查询

小结数据与详细数据

数据仓库的特点

97系统

面向应用

计费

结算系统10000号

数据仓库系统

面向主题

客户

收入

产品

DBMS 的负载完全不同

OLTP 交易系统

号码6620774200602话费320元

Find

Account #91098

Account Table

Add $100

End

有多少客户的帐单金额大于150并且其

大部分通话是在周未进行?

决策支持系统

Sales Table

Ops Table etc..

Search Sales Table Store Sales Table Result

Search Billing Table Store Billing Table Result Join

Stored Tables Aggregate Answer Set

End

数据库负载不同

DSS 查询系统OLTP 交易系统Yes Yes Yes Yes Yes

庞大的数据量查询大量的处理(连接/排序/聚合）

响应时间要求已知查询/未知查询

多表搜索No No No Yes No

简单查询经常独立地存取各个表

复杂查询需要考虑各个表之间的联系

简单复杂

查询采取的行动

收益增加上月有多少客户的电

话收费单金额超过30

美元？

向他们提供折扣优惠

以防被动

在过去的12个月中，有多

少客户的电话费每月超过

30美元，并且在5月到9月

之间的大部分电话是在周

一至周五下午3点至7点打

的？

向他们提供第二条电

话线供孩子们放学后

用

利润下降

谁?什么?什么时间?为什么?如何?

什么地方?

预定义查询与动态查询(Ad-Hoc)

预定义查询

动态查询QRS (Quick Reporting System)

快速响应系统

告诉我

你需要什么信息？

知识中心

在任何时间针对任何数据提出任何问题

不断变化的业务需求

IT 部门

他们怎么又改主意了!?!!?

业务部门

现在怎样才能战胜

竟争对手??

业务需求可能改变用户要求可能改变

对一个问题的回答可能引出另处一百个问题！

为了配合系统中出现的不可预测的各种负载，对数据仓库RDBMS 的有效管理将是一个长期的努力！因为用户查询的重点将不断改变！-Gartner Group

BI_数据仓库基础

BI_数据仓库基础 BI BOSS业务运营支撑系 BPM企业绩效管理 BPR业务流程重整 CRM客户关系管理 CUBE立方体 DM（Datamart）数据集市数据仓库的子集，它含有较少的主题域且历史时间更短数据量更少，一般只能为某个局部范围内的管理人员服务，因此也称之为部门级数据仓库。 DM（DataMine）数据挖掘 DSS决策支持系统 EDM企业数据模型 3 ERP Enterprise Resourse Planning企业资源规划。它是一个以管理会计为核心的信息系统，识别和规划企业资源，从而获取客户订单，完成加工和交付，最后得到客户付款。换言之，ERP将企业内部所有资源整合在一起，对八个采购、生产、成本、库存、分销、运输、财务、人力资源进行规划，从而达到最佳资源组合，取得最佳效益。 4 ETL 数据抽取（Extract）、转换（Transform）、清洗（Cleansing）、装载（Load）的过程。构建数据仓库的重要一环，用户从数据源抽取出所需的数据，经过数据清洗，最终按照预先定义好的数据仓库模型，将数据加载到数据仓库中去。 KDD数据库中知识发现 5 KPI 企业关键业绩指标(KPI：KeyProcessIndication)是通过对组织内部流程的输入端、输出端的关键参数进行设置、取样、计算、分析，衡量流程绩效的一种目标式量化管理指标，是把企业的战略目标分解为可操作的工作目标的工具，是企业绩效管理的基础。 LDM逻辑数据模型 6 MDD 多维数据库（Multi Dimesional Database,MDD）可以简单地理解为：将数据存放在一个n维数组中，而不是像关系数据库那样以记录的形式存放。因此它存在大量稀疏矩阵，人们可以通过多维视图来观察数据。多维数据库增加了一个时间维，与关系数据库相比，它的优势在于可以提高数据处理速度，加快反应时间，提高查询效率。 Metadata(元数据)，它是“关于数据的数据，其内容主要包括数据仓库的数据字典、数据的定义、数据的抽取规则、数据的转换规则、数据加载频率等信息。 MOLAP自行建立了多维数据库，来存放联机分析系统数据 7 ODS（四个特点） (Oprational Data Store)操作型数据存储，是建立在数据准备区和数据仓库之间的一个部件。用来满足企业集成的、综合的操作型处理需要，操作数据存储是个可选的部件。对于一些准实时的业务数据库当中的数据的暂时存储，支持一些同时关连到历史数据与实时数据分析的数据暂时存储区域。

数据挖掘与数据仓库知识点总结

1、数据仓库定义：数据仓库是一种新的数据处理体系结构，它与组织机构的操作数据库分别维护，允许将各种应用系统一起，为统一的历史数据分析提供坚实的平台，对信息处理提供支持。数据仓库是面向主题的、集成的、相对稳定的、反映历史变化的数据集合，为企业决策支持系统提供所需的集成信息。设计和构造步骤：1）选取待建模的商务处理；2）选取商务处理的粒变；3）选取用于每个事实表记录的维；4）选取事实表中每条记录的变量系统结构：（1）底层是仓库数据服务器，总是关系数据库系统。（2）中间层是OLAP服务器，有ROLAP 和MOLAP，它将对多维数据的操作映射为标准的关系操作（3）顶层是前端客户端，它包括查询和报表工具、分析工具和数据挖掘工具 2、数据仓库的多维数据模型：（1）星形模式：在此模型下，数据仓库包括一个大的包含大批数据并且不含冗余的中心表，一组小的附属表，维表围绕中心事实表显示的射线上。特征：星型模型四周的实体是维度实体，其作用是限制和过滤用户的查询结果，缩小访问围。每个维表都有自己的属性，维表和事实表通过关键字相关联。【例子：sales数据仓库的星形模式，此模式包含一个中心事实表sales，它包含四个维time, item, branch和location。（2）雪花型模式：它是星形模式的变种，其中某些维表是规化的，因而把数据进一步分解到附加的表中。特征：雪花模型通过最大限度地减少数据存储量和联合较小的维表来改善查询性能，增加了用户必须处理的表数量和某些查询的复杂性，但同时提高了处理的灵活性，可以回答更多的商业问题，特别适合系统的逐步建设要求。【例子同上，只不过把其中的某些维给扩展了。（3）事实星座形：复杂的应用可能需要多个事实表共享维表，这种模式可看作星形模式的汇集。特征：事实星座模型能对多个相关的主题建模。例子：有两个事实表sales和shipping，它们可以共享维表time, item和location。 3、OLAP：即联机分析处理，是在OLTP基础上发展起来的、以数据仓库基础上的、面向高层管理人员和专业分析人员、为企业决策支持服务。特点：1.实时性要求不是很高。2.数据量大。3.因为重点在于决策支持，所以查询一般是动态的，也就是说允许用户随机提出查询要求。 OLAP操作：上卷：通过沿一个维的概念分层向上攀登，或者通过维归约，对数据立方体进行类聚。下钻：是上卷的逆操作，它由不太详细的数据得到更详细的数据，下钻可以通过沿维的概念分层向下或引入附加的维来实现。切片：对给定方体的一个维进行进行选择，导致一个子立方体。切块：通过对两个或多个维执行选择，定义子立方体。转轴：是一种可视化操作，它转动数据的视角，提供数据的替代表示。 OLTP：即联机事务处理，是以传统数据库为基础、面向操作人员和低层管理人员、对基本数据进行查询和增、删、改等的日常事务处理。OLTP的特点有：a.实时性要求高；b.数据量不是很大。C.交易一般是确定的，是对确定性数据进行存取。d.并发性要求高且严格的要求事务的完整性，安全性。 OLTP和OLAP的区别：1）用户和系统的面向性:OLTP面向顾客，而OLAP面向市场；2）数据容：OLTP 系统管理当前数据，而OLAP管理历史的数据；3）数据库设计：OLTP系统采用实体-联系（ER)模型和面向应用的数据库设计，而OLAP系统通常采用星形和雪花模型；4）视图：OLTP系统主要关注一个企业或部门部的当前数据，而OLAP 系统主要关注汇总的统一的数据；5）访问模式：OLTP访问主要有短的原子事务组成，而OLAP系统的访问大部分是只读操作，尽管许多可能是复杂的查询。 7、PageRank算法原理：1）在初始阶段：构建Web图，每个页面初始设置相同的PageRank 值，通过迭代计算，会得到每个页面所获得的最终PageRank值。2）在一轮中更新页面 PageRank得分的计算方法：每个页面将其当前的PageRank值平均分配到本页面包含的出链上。每个页面将所有指向本页面的入链所传入的权值求和，即可得到新的PageRank得分。优点：是一个与查询无关的静态算法，所有网页的PageRank值通过离线计算获得；有效减少在线查询时的计算量，极大降低了查询响应时间。缺点：1）人们的查询具有主题特征，PageRank忽略了主题相关性，导致结果的相关性和主题性降低。2）旧的页面等级会比新页面高。因为即使是非常好的新页面也不会有很多上游，除非它是某个站点的子站点。

BI、数据仓库基础概念

商业智能技术培训 ——BI、数据仓库基础概念

目录 1 商业智能(Business Intelligence)简介 (3) 2 数据仓库概念及发展 (4) 2.1.1 什么是数据仓库 (4) 2.1.2 数据仓库的关键技术 (4) 3 在线分析处理（OLAP） (5) 4 数据挖掘（Data Mining） (6)

1商业智能(Business Intelligence)简介随着经济的发展，企业所面临的竞争日益激烈。同时，信息技术的发展也使企业获取信息的手段和渠道也在不断增加，企业所面对的信息浩如烟海。而任何好的决策都需要事实和真实的数据。企业决策的正确程度也取决于所使用的事实和数字的准确程度。另一方面，随着竞争的增加，决策需要在较短的时间内做出。因此，在特定的时间段内，能够尽可能多地获得相关信息就变得越来越关键。而为了使决策具有较好的正确度，却又需要更长的时间。因此，企业需要高效数据分析工具，以减少高速、精确分析大量数据所需时间。商业智能技术正是一种能够帮助企业迅速地完成信息采集、分析的先进技术。它以数据仓库（Data Warehousing）、在线分析处理（OLAP）、数据挖掘（Data Mining）3种技术的整合为基础，建立企业数据中心和业务分析模型，以提高企业获取经营分析信息的能力，从而提高企业经营和决策的质量与速度。一、数据仓库（Data Warehousing）数据仓库是面向主题的、集成的、稳定的、不同时间的数据集合，用以支持经营管理中的决策制定过程。目的是为了解决在信息技术发展中存在的拥有大量数据、然而有用信息贫乏的问题。它是集成各系统的历史数据而建立的面向主题的企业数据中心，其特点是面向主题、集成性—企业数据框架、历史性和稳定性。二、在线分析处理（OLAP） OLAP是一种高度交互式的过程，它能够将原始的数据转化成为真正能够为用户所理解的、真实反映数据维特性的信息，以便分析人员从多种角度对这些信息进行快速、一致、交互地访问和反复的分析从而获得有用信息、达到对数据更深入了解的目的。在线分析处理同时也是对存储在多维数据库（MDD）或关系型数据库（RDBMS）中的数据进行分析、处理的过程。这种分析可以是多维在线分析处理、关系型在线分析处理，也可以是混合在线分析处理。在线分析处理的特点是灵活、动态、快速的多维分析、可以进行随机查询、产生即席报表。三、数据挖掘（Data Mining）数据挖掘是通过数学模型从浩如瀚海的数据和文档中发现以前未知的、隐藏的、潜在的规律和可以理解的信息，以辅助决策的过程。也就是说从大量的、不完全的、有噪声的、模糊的、随机的数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。数据挖掘的特点是涉及数据库、统计分析和人工智能等多种技术，具有预测和验证功能并且能够进行特征和规律的描述。

大数据挖掘考精彩试题库

一、填空题 1.Web挖掘可分为、和3大类。 2.数据仓库需要统一数据源，包括统一、统一、统一和统一数据特征 4个方面。 3.数据分割通常按时间、、、以及组合方法进行。 4.噪声数据处理的方法主要有、和。 5.数值归约的常用方法有、、、和对数模型等。 6.评价关联规则的2个主要指标是和。 7.多维数据集通常采用或雪花型架构，以表为中心，连接多个表。 8.决策树是用作为结点，用作为分支的树结构。 9.关联可分为简单关联、和。 10.B P神经网络的作用函数通常为区间的。 11.数据挖掘的过程主要包括确定业务对象、、、及知识同化等几个步骤。 12.数据挖掘技术主要涉及、和3个技术领域。 13.数据挖掘的主要功能包括、、、、趋势分析、孤立点分析和偏差分析7个方面。 14.人工神经网络具有和等特点，其结构模型包括、和自组织网络 3种。 15.数据仓库数据的4个基本特征是、、非易失、随时间变化。 16.数据仓库的数据通常划分为、、和等几个级别。 17.数据预处理的主要容(方法)包括、、和数据归约等。 18.平滑分箱数据的方法主要有、和。 19.数据挖掘发现知识的类型主要有广义知识、、、和偏差型知识五种。 20.O LAP的数据组织方式主要有和两种。 21.常见的OLAP多维数据分析包括、、和旋转等操作。 22.传统的决策支持系统是以和驱动，而新决策支持系统则是以、建立在和技术之上。 23.O LAP的数据组织方式主要有和2种。 24.S QL Server2000的OLAP组件叫，OLAP操作窗口叫。 25.B P神经网络由、以及一或多个结点组成。 26.遗传算法包括、、3个基本算子。 27.聚类分析的数据通常可分为区间标度变量、、、、序数型以及混合类型等。 28.聚类分析中最常用的距离计算公式有、、等。 29.基于划分的聚类算法有和。 30.C lementine的工作流通常由、和等节点连接而成。

数据仓库系统的体系结构

体系结构数据源是数据仓库系统的基础，是整个系统的数据源泉。通常包括企业内部信息和外部信息。内部信息包括存放于RDBMS中的各种业务处理数据和各类文档数据。外部信息包括各类法律法规、市场信息和竞争对手的信息等等；数据的存储与管理是整个数据仓库系统的核心。数据仓库的真正关键是数据的存储和管理。数据仓库的组织管理方式决定了它有别于传统数据库，同时也决定了其对外部数据的表现形式。要决定采用什么产品和技术来建立数据仓库的核心，则需要从数据仓库的技术特点着手分析。针对现有各业务系统的数据，进行抽取、清理，并有效集成，按照主题进行组织。数据仓库按照数据的覆盖范围可以分为企业级数据仓库和部门级数据仓库（通常称为数据集市）。 OLAP(联机分析处理)服务器对分析需要的数据进行有效集成，按多维模型予以组织，以便进行多角度、多层次的分析，并发现趋势。其具体实现可以分为：ROLAP（关系型在线分析处理）、MOLAP （多维在线分析处理）和HOLAP（混合型线上分析处理）。ROLAP基本数据和聚合数据均存放在RDBMS之中；MOLAP基本数据和聚合数据均存放于多维数据库中；HOLAP基本数据存放于RDBMS之中，聚合数据存放于多维数据库中。数据仓库系统的体系结构数据仓库系统通常是对多个异构数据源的有效集成，集成后按照主题进行重组，包含历史数据。存放在数据仓库中的数据通常不再修改，用于做进一步的分析型数据处理。数据仓库系统的建立和开发是以企事业单位的现有业务系统和大量业务数据的积累为基础的。数据仓库不是一个静态的概念，只有把信息适时的交给需要这些信息的使用者，供他们做出改善业务经营的决策，信息才能发挥作用，信息才有

数据仓库技术及实施

数据库与信息管理电脑知识与技术１引言传统的数据库技术是以单一的数据资源，即数据库为中心，进行事务处理、批处理、决策分析等各种数据处理工作，数据处理可划分为两大类：操作型处理（ＯＬＴＰ）和分析型处理（统计分析）。操作型处理也叫事务处理，是指对数据库联机的日常操作，通常是对一个或一组纪录的查询和修改，主要为企业的特定应用服务的，注重响应时间，数据的安全性和完整性；分析型处理则用于管理人员的决策分析，经常要访问大量的历史数据。而传统数据库系统利于应用的日常事务处理工作，而难于实现对数据分析处理要求，更无法满足数据处理多样化的要求。因此，专门为业务的统计分析建立一个数据中心，它是一个联机的系统，专门为分析统计和决策支持应用服务的，通过它可以满足决策支持和联机分析应用所要求的一切。这个数据中心就叫做数据仓库。２数据仓库概念及发展２．１什么是数据仓库数据仓库就是面向主题的、集成的、不可更新的（稳定性）、随时间不断变化（不同时间）的数据集合，用以支持经营管理中的决策制定过程。数据仓库最根本的特点是物理地存放数据，而且这些数据并不是最新的、专有的，而是来源于其它数据库的。数据仓库的建立并不是要取代数据库，它要建立在一个较全面和完善的信息应用的基础上，用于支持高层决策分析，而事务处理数据库在企业的信息环境中承担的是日常操作性的任务。２．２相关基本概念２．２．１元数据元数据（ｍｅｔａｄａｔａ）：是“关于数据的数据”，相当于数据库系统中的数据字典，指明了数据仓库中信息的内容和位置，刻画了数据的抽取和转换规则，存储了与数据仓库主题有关的各种信息，而且整个数据仓库的运行都是基于元数据的，如修改跟踪数据、抽取调度数据、同步捕获历史数据等。２．２．２ＯＬＡＰ（联机分析处理Ｏｎ－ｌｉｎｅＡｎａｌｙｔｉｃａｌＰｒｏｃｅｓｓｉｎｇ）数据仓库用于存储和管理面向决策主题的数据，ＯＬＡＰ对数据仓库中的数据分析，并将其转换成辅助决策信息。ＯＬＡＰ的一个重要特点是多维数据分析，这与数据仓库的多维数据组织正好形成相互结合、相互补充的关系。ＯＬＡＰ技术中比较典型的应用是对多维数据的切片和切块、钻取、旋转等，它便于使用者从不同角度提取有关数据，其基本思想是：企业的决策者应能灵活地操纵企业的数据，以多维的形式从多方面和多角度来观察企业的状态、了解企业的变化。对ＯＬＡＰ进行分类，按照存储方式的不同，可将ＯＬＡＰ分成ＲＯＬＡＰ、ＭＯＬＡＰ和ＨＯＬＡＰ；ＲＯＬＡＰ没有大小限制；现有的关系数据库的技术可以沿用；可以通过ＳＱＬ实现详细数据与概要数据的储存；现有关系型数据库已经对ＯＬＡＰ做了很多优化，包括并行存储、并行查询、并行数据管理、基于成本的查询优化、位图索引、ＳＱｌ的ＯＬＡＰ扩展等大大提高了ＲＯＡＬＰ的速度；可以针对ＳＭＰ或ＭＰＰ的结构进行查询优化。一般比ＭＤＤ响应速度慢；只读、不支持有关预算的读写操作；ＳＱＬ无法完成部分计算，主要是无法完成多行的计算，无法完成维之间的计算。ＭＯＬＡＰ性能好、响应速度快；专为ＯＬＡＰ所设计；支持高性能的决策支持计算；复杂的跨维计算；多用户的读写操作；行级的计算。增加系统复杂度，增加系统培训与维护费用；受操作系统平台中文件大小的限制，难以达到ＴＢ级；需要进行预计算，可能导致数据爆炸；无法支持维的动态变化；缺乏数据模型和数据访问的标准。ＨＯＬＡＰ综合了ＲＯＬＡＰ和ＭＯＬＡＰ的优点。它将常用的数据存储为ＭＯＬＡＰ，不常用或临时的数据存储为ＲＯＬＡＰ，这样就兼顾了ＲＯＬＡＰ的伸缩性和ＭＯＬＡＰ的灵活、纯粹的特点。收稿日期：２００６－０３－２４作者简介：赵方（１９７９－），女，浙江杭州人，浙江树人大学助教，硕士在读，主要从事教学、科研工作，以数据库应用、信息管理为主要研究方向。数据仓库技术及实施赵方（浙江树人大学，浙江杭州３１００１５）摘要：介绍了数据仓库的基本概念，针对数据仓库建立对创建数据仓库的过程进行了分析，对实现数据抽取、数据仓库的存储和管理等进行分析和比较。关键词：数据仓库；联机分析处理；数据抽取；数据存储中图分类号：ＴＰ３１１文献标识码：Ａ文章编号：１００９－３０４４（２００６）１７－００３２－０２ＲｅｓｅａｒｃｈｏｆＤａｔａＷａｒｅｈｏｕｓｅＴｅｃｈｎｏｌｏｇｙＺＨＡＯＦａｎｇ（ＺｈｅｊｉａｎｇＳｈｕｒｅｎＵｎｉｖｅｒｓｉｔｙ，Ｈａｎｇｚｈｏｕ３１００１５，Ｃｈｉｎａ）Ａｂｓｔｒａｃｔ：Ｉｎｔｈｉｓｐａｐｅｒ，ｔｈｅｉｎｔｅｒｎａｌｃｈａｒａｃｔｅｒｉｓｔｉｃｓｏｆＤａｔａＷａｒｅｈｏｕｓｅａｒｅｉｎｔｒｏｄｕｃｅｄ．ＡｎａｌｙｚｅｄｔｈｅｐｒｏｃｅｄｕｒｅｏｆｉｎｔｅｇｒａｔｅｄＤａｔａＷａｒｅｈｏｕｓｅａｎｄｂｕｉｌｄｉｎｇｔｈｅｄａｔａｗａｒｅｈｏｕｓｅ，ＤａｔａＥｘｔｒａｃｔ，ＤａｔａＷａｒｅｈｏｕｓｅＳｔｏｒａｇｅａｎｄｈｏｗｔｏｍａｎａｇｅｔｈｅＤａｔａＷａｒｅｈｏｕｓｅ．Ｋｅｙｗｏｒｄｓ：ＤａｔａＷａｒｅｈｏｕｓｅ；ＯＬＡＰ（Ｏｎ－ｌｉｎｅＡｎａｌｙｔｉｃａｌＰｒｏｃｅｓｓｉｎｇ）；ＤａｔａＥｘｔｒａｃｔＴｒａｎｓｆｏｒｍＬｏａｄ；ＤａｔａＳｔｏｒａｇｅ３２

数据仓库基本架构

数据仓库的基本架构 xiaoyi发表于 2013-07-31 23:57 来源：网站数据分析数据仓库的目的是构建面向分析的集成化数据环境，为企业提供决策支持（Decision Support）。其实数据仓库本身并不“生产”任何数据，同时自身也不需要“消费”任何的数据，数据来源于外部，并且开放给外部应用，这也是为什么叫“仓库”，而不叫“工厂”的原因。因此数据仓库的基本架构主要包含的是数据流入流出的过程，可以分为三层——源数据、数据仓库、数据应用：从图中可以看出数据仓库的数据来源于不同的源数据，并提供多样的数据应用，数据自上而下流入数据仓库后向上层开放应用，而数据仓库只是中间集成化数据管理的一个平台。数据仓库从各数据源获取数据及在数据仓库内的数据转换和流动都可以认为是ETL（抽取Extra, 转化Transfer, 装载Load）的过程，ETL是数据仓库的流水线，也可以认为是数据仓库的血液，它维系着数据仓库中数据的新陈代谢，而数据仓库日常的管理和维护工作的大部分精力就是保持ETL的正常和稳定。下面主要简单介绍下数据仓库架构中的各个模块，当然这里所介绍的数据仓库主要是指网站数据仓库。数据仓库的数据来源

其实之前的一篇文章已经介绍过数据仓库各种源数据的类型——数据仓库的源数据类型，所以这里不再详细介绍。对于网站数据仓库而言，点击流日志是一块主要的数据来源，它是网站分析的基础数据；当然网站的数据库数据也并不可少，其记录这网站运营的数据及各种用户操作的结果，对于分析网站Outcome这类数据更加精准；其他是网站内外部可能产生的文档及其它各类对于公司决策有用的数据。数据仓库的数据存储源数据通过ETL的日常任务调度导出，并经过转换后以特性的形式存入数据仓库。其实这个过程一直有很大的争议，就是到底数据仓库需不需要储存细节数据，一方的观点是数据仓库面向分析，所以只要存储特定需求的多维分析模型；另一方的观点是数据仓库先要建立和维护细节数据，再根据需求聚合和处理细节数据生成特定的分析模型。我比较偏向后面一个观点：数据仓库并不需要储存所有的原始数据，但数据仓库需要储存细节数据，并且导入的数据必须经过整理和转换使其面向主题。简单地解释下： (1).为什么不需要所有原始数据？数据仓库面向分析处理，但是某些源数据对于分析而言没有价值或者其可能产生的价值远低于储存这些数据所需要的数据仓库的实现和性能上的成本。比如我们知道用户的省份、城市足够，至于用户究竟住哪里可能只是物流商关心的事，或者用户在博客的评论内容可能只是文本挖掘会有需要，但将这些冗长的评论文本存在数据仓库就得不偿失；

《数据仓库与数据挖掘》复习题

2014-2015-1《数据仓库与数据挖掘》期末考试题型一、单项选择题（每小题2分，共20分）二、填空题（每空1分，共20分）三、简答题(每题6分，共30分) 四、析题与计算题(共30分) 请同学们在考试时不要将复习资料带入考场！！！单选题 1. 某超市研究销售纪录数据后发现，买啤酒的人很大概率也会购买尿布，这种属于数据挖掘的哪类问题？(A) A. 关联规则发现 B. 聚类 C. 分类 D. 自然语言处理 2. 以下两种描述分别对应哪两种对分类算法的评价标准？(A) (a)警察抓小偷，描述警察抓的人中有多少个是小偷的标准。 (b)描述有多少比例的小偷给警察抓了的标准。 A. Precision, Recall B. Recall, Precision A. Precision, ROC D. Recall, ROC 3. 将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务？(C) A. 频繁模式挖掘 B. 分类和预测 C. 数据预处理 D. 数据流挖掘 4. 当不知道数据所带标签时，可以使用哪种技术促使带同类标签的数据与带其他标签的数据相分离？(B) A. 分类 B. 聚类 C. 关联分析 D. 隐马尔可夫链 5. 什么是KDD？(A) A. 数据挖掘与知识发现 B. 领域知识发现 C. 文档知识发现 D. 动态知识发现 6. 使用交互式的和可视化的技术，对数据进行探索属于数据挖掘的哪一类任务？（A） A. 探索性数据分析 B. 建模描述 C. 预测建模 D. 寻找模式和规则 7. 为数据的总体分布建模；把多维空间划分成组等问题属于数据挖掘的哪一类任务？(B) A. 探索性数据分析 B. 建模描述 C. 预测建模 D. 寻找模式和规则 8. 建立一个模型，通过这个模型根据已知的变量值来预测其他某个变量值属于数据挖掘的哪一类任务？(C) A. 根据内容检索 B. 建模描述 C. 预测建模 D. 寻找模式和规则 9. 用户有一种感兴趣的模式并且希望在数据集中找到相似的模式，属于数据挖掘哪一类任务？(A)

数据仓库与数据挖掘学习心得

数据仓库与数据挖掘学习心得通过数据仓库与数据挖掘的这门课的学习，掌握了数据仓库与数据挖掘的一些基础知识和基本概念，了解了数据仓库与数据库的区别。下面谈谈我对数据仓库与数据挖掘学习心得以及阅读相关方面的论文的学习体会。《浅谈数据仓库与数据挖掘》这篇论文主要是介绍数据仓库与数据挖掘的的一些基本概念。数据仓库是支持管理决策过程的、面向主题的、集成的、稳定的、不同时间的数据集合。主题是数据数据归类的标准，每个主题对应一个客观分析的领域，他可为辅助决策集成多个部门不同系统的大量数据。数据仓库包含了大量的历史数据，经集成后进入数据仓库的数据极少更新的。数据仓库内的数据时间一般为5年至10年，主要用于进行时间趋势分析。数据仓库的数据量很大。数据仓库的特点如下： 1、数据仓库是面向主题的； 2、数据仓库是集成的，数据仓库的数据有来自于分散的操作型数据，将所需数据从原来的数据中抽取出来，进行加工与集成，统一与综合之后才能进入数据仓库； 3、数据仓库是不可更新的，数据仓库主要是为决策分析提供数据，所涉及的操作主要是数据的查询； 4、数据仓库是随时间而变化的，传统的关系数据库系统比较适合处理格式化的数据，能够较好的满足商业商务处理的需求，它在商业领域取得了巨大的成功。

作为一个系统，数据仓库至少包括3个基本的功能部分：数据获取：数据存储和管理；信息访问。数据挖掘的定义：数据挖掘从技术上来说是从大量的、不完全的、有噪音的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在的有用的信息和知识的过程。数据开采技术的目标是从大量数据中，发现隐藏于其后的规律或数据间的的关系，从而服务于决策。数据挖掘的主要任务有广义知识；分类和预测；关联分析；聚类。《数据仓库与数据挖掘技术在金融信息化中的应用》论文主要通过介绍数据额仓库与数据挖掘的起源、定义以及特征的等方面的介绍引出其在金融信息化中的应用。在金融信息化的应用方面，金融机构利用信息技术从过去积累的、海量的、以不同形式存储的数据资料里提取隐藏着的许多重要信息，并对它们进行高层次的分析，发现和挖掘出这些数据间的整体特征描述及发展趋势预测，找出对决策有价值的信息，以防范银行的经营风险、实现银行科技管理及银行科学决策。现在银行信息化正在以业务为中心向客户为中心转变6银行信息化不仅是数据的集中整合，而且要在数据集中和整合的基础上向以客为中心的方向转变。银行信息化要适应竞争环境客户需求的变化，创造性地用信息技术对传统过程进行集成和优化，实现信息共享、资源整合综合利用，把银行的各项作用统一起来，优势互补统一调配各种资源，为银行的客户开发、服务、综理财、管理、风险防范创立坚实的基础，从而适应日益发展的数据技术需要，全面提高银行竞争力，为金融创新和提高市场反映能力

数据挖掘与数据仓库课程简介

数据挖掘与数据仓库课程简介英文名：Data Mining and Data Warehouse 开课单位：计算机学院课程编码：203086 学分学时：学分，学时32（含实验10）授课对象：计算机科学与技术专业方向选修课先修课程：数据库课程目的和主要内容：通过本课程的学习，学生应能理解数据库技术的发展为何导致需要数据挖掘，以及数据挖掘潜在应用的重要性；掌握数据仓库和多维数据结构，OLAP（联机分析处理）的实现以及数据仓库与数据挖掘的关系；熟悉数据挖掘之前的数据预处理技术；了解定义数据挖掘任务说明的数据挖掘原语；掌握数据挖掘技术的基本算法，为将来从事数据仓库的规划和实施以及数据挖掘技术的研究工作打下一定的基础。主要内容包括数据仓库和数据挖掘的基本知识；数据清理、数据集成和变换、数据归约以及离散化和概念分层等数据预处理技术；DMQL数据挖掘查询语言；用于挖掘特征化和比较知识的面向属性的概化技术、用于挖掘关联规则知识的基本Apriori算法和它的变形、用于挖掘分类和预测知识的判定树分类算法和贝叶斯分类算法以及基于划分的聚类分析算法等；了解先进的数据库系统中的数据挖掘方法，以及对数据挖掘和数据仓库的实际应用问题展开讨论。参考教材：《数据挖掘概念与技术》，机械工业出版社，JiaWei Han,Micheline Kamber著，范明等译参考和阅读书目：《Data Mining: Concepts and Techniques》Jiawei Han and Micheline Kamber, Morgan Kaufmann, 2000 《机器学习》，Tom Mitchell著，曾华军等译《SQLServer2000数据挖掘技术指南》，机械工业出版社，Claude Seidman著，刘艺等译数据挖掘与数据仓库教学大纲一、课程概况英文名：Data Mining and Data Warehouse 开课单位：计算机学院课程编码：203086 学分学时：学分，学时32（含实验10）授课对象：先修课程：数据库课程目的和主要内容：通过本课程的学习，学生应能理解数据库技术的发展为何导致需要数据挖掘，以及数据

数据仓库架构师笔试题

数据仓库架构师笔试题 1、请简述下什么缓慢变化维，以及通过设计怎样解决缓慢变化维的问题。参考答案：这道题是数据仓库的基础知识题，能答对答全的基本可确定对方有一定的数据仓库开发和设计经验。 1） 2、请简述下数据仓库一般有哪两种设计模式，以及这两种设计模式的优缺点。参考答案：这题属于简单的基础知识题。其解题思路如下： 1）能准确说出雪花模型和星型模型这两个模型的，算及格。 2）能描述出雪花模型和星形模型分别是怎样一种模型，比如星型模型是维度与事实表直接关联，不存在多层维度的结构，而雪花模型层了维度表保持三范式或准三范式设计外其它与星形模型一样的，最好能用图例画出来的，得90 分。 3）能够说出雪花模型和星形模型的优缺点的，其中星形模型减少了关联，用空间换时间，性能更优，雪花模型结构更清晰，维护更方便，但性能差一些。通常的数据仓库建设都是两者的混合模式存在。得满分。 3、请简述下自己做过的项目中用过那些实体，以及各实体间的关系，并将实体中的一些核心属性列出来。参考参考：这道题没有标准答案，根据各自项目的情况有不同答案，首先面试者必须将项目中的关键实体、实体属性，以及实体间的关系描述出来。另外可以通过对方的描述，了解对方在对所做项目的了解程度，在项目中承担的角色和作用，以及对方的语言沟通能力。

4、7、请简述下在实体关系是1对1，1对多，多对多的情况下，怎么去设计表来记录两个实体之间的关系，可举例说明。参考答案：本题算是一道相对简单的设计基础题，如果这题答不出来，基本确定没什么数据库设计经验，并且作为开发人员对数据库结构的了解也是很有限的。解题思路如下：1）1对1关系可以将其中一个表的主键带到另一个表中，以便于关联查询。 2）1对多关系只能将前者的主键带在后者的表中，不能反过来。比如学校和班级表，只能表学校的标识放在班级表中，而不能反过来。 3）多对多关系则必须在两者之间额外创建一张中间表（一般叫交叉表），这个答案才是最关键的答案，没答对这个，基本可以判定不及格。 5、请简述下数据库（以Oracle为例）有哪几种常见的Join方式，并简要描述各种Join 方式用在哪种场景下会比较适合？ 6、请简要描述下数据库（以Oracle为例）有哪几种常见的索引，并说明每种索引的优缺点。 7、假设现在有一个社保缴费清单表A（社保号，参保单位编号，缴费月份），缴费清单保存个人历史所有参数记录。请用一个SQL（可使用伪代码）统计出每个参保人(以社保号标识一个人)在每段工作经历（以缴纳社保为准）的最早缴社保月份、最近缴社保月份，

数据基础知识及数据处理

数据处理（从小数据到大数据）一、小数据 1、信息的度量在计算机中：最小数据单位：位（bit） Bit: 0 或1 （由电的状态产生：有电1，无电0）基本数据单位：字节（Byte, B） 1B=8bit 1KB=1024B 1MB=1024KB 1GB=1024MB 1TB=1024GB。 …… 2、不同数制的表示方法十进制(Decimal notation)，如120, (120) 10，120D 二进制(Binary notation) ，如(1010)2 , 1010B 八进制(Octal notation) ，如(175)8 , 175O 十六进制数(Hexdecimal notation) ，如(2BF)16 , 2BF03H

3、不同数制之间的转换方法（1）任意其他进制（二、八、十六）转换成十进制，可“利用按权展开式展开”。例如： 10110.101B =1×24＋0×23+1×22＋1×21＋0×20＋1×2-1＋0×2-2＋1×2-3 =22.625D 347.6O =3×82＋4×81＋7×80＋6×8-1 =231.75D

D5.6H =D×161＋5×160＋6×16-1 =213.375D （2）十进制转换成任意其他进制（二、八、十六），整数部分的转换可按“除基取余，倒序排列”的方法，小数部分的转换可按“乘基取整，顺序排列”的方法。（除倒取，乘正取）例，十进制数59转换为二进制数111011B

例:十进制数0.8125转换为二进制数0.1101B 同理：317 D= 100111101B = 475O = 13DH 0.4375D = 0.0111B = 0.34O = 0.7H （3）八进制数转换成二进制数，可按“逐位转换，一位拆三位”的方法。(8421法) 例如：3107.46O = 3 1 0 7 . 4 6 O =011 001 000 111 . 100 110 B =11001000111.10011B （4）十六进制数转换成二进制数，可按“逐位转换，一位拆四位”的方法。（8421法）

BI_数据仓库基础

1 BI Business Intelligence，即商业智能，商务智能综合企业所有沉淀下来的信息，用科学的分析方法，为企业领导提供科学决策信息的过程。 BOSS业务运营支撑系 BPM企业绩效管理 BPR业务流程重整 CRM客户关系管理 CUBE立方体 DM（Datamart）数据集市数据仓库的子集，它含有较少的主题域且历史时间更短数据量更少，一般只能为某个局部范围内的管理人员服务，因此也称之为部门级数据仓库。 DM（DataMine）数据挖掘 DSS决策支持系统 EDM企业数据模型 3 ERP Enterprise Resourse Planning企业资源规划。它是一个以管理会计为核心的信息系统，识别和规划企业资源，从而获取客户订单，完成加工和交付，最后得到客户付款。换言之，ERP将企业内部所有资源整合在一起，对八个采购、生产、成本、库存、分销、运输、财务、人力资源进行规划，从而达到最佳资源组合，取得最佳效益。 4 ETL 数据抽取（Extract）、转换（Transform）、清洗（Cleansing）、装载（Load）的过程。构建数据仓库的重要一环，用户从数据源抽取出所需的数据，经过数据清洗，最终按照预先定义好的数据仓库模型，将数据加载到数据仓库中去。 KDD数据库中知识发现 5 KPI 企业关键业绩指标(KPI：KeyProcessIndication)是通过对组织内部流程的输入端、输出端的关键参数进行设臵、取样、计算、分析，衡量流程绩效的一种目标式量化管理指标，是把企业的战略目标分解为可操作的工作目标的工具，是企业绩效管理的基础。 LDM逻辑数据模型 6 MDD 多维数据库（Multi Dimesional Database,MDD）可以简单地理解为：将数据存放在一个n维数组中，而不是像关系数据库那样以记录的形式存放。因此它存在大量稀疏矩阵，人们可以通过多维视图来观察数据。多维数据库增加了一个时间维，与关系数据库相比，它的优势在于可以提高数据处理速度，加快反应时间，提高查询效率。 Metadata(元数据)，它是“关于数据的数据，其内容主要包括数据仓库的数据字典、数据的定义、数据的抽取规则、数据的转换规则、数据加载频率等信息。 MOLAP自行建立了多维数据库，来存放联机分析系统数据 7 ODS（四个特点） (Oprational Data Store)操作型数据存储，是建立在数据准备区和数据仓库之间的一个部件。用来满足企业集成的、综合的操作型处理需要，操作数据存储是个可选的部件。对于一些准实时的业务数据库当中的数据的暂时存储，支持一些同时关连到历史数据与实时数据分

数据库系统基本知识讲解

三、数据库的概念与用途数据库的概念什么是数据库呢当人们从不同的角度来描述这一概念时就有不同的定义(当然是描述性的)。例如，称数据库是一个“记录保存系统”(该定义强调了数据库是若干记录的集合)。又如称数据库是“人们为解决特定的任务，以一定的组织方式存储在一起的相关的数据的集合”(该定义侧重于数据的组织)。更有甚者称数据库是“一个数据仓库”。当然，这种说法虽然形象，但并不严谨。严格地说，数据库是“按照数据结构来组织、存储和管理数据的仓库”。在经济管理的日常工作中，常常需要把某些相关的数据放进这样“仓库”，并根据管理的需要进行相应的处理。例如，企业或事业单位的人事部门常常要把本单位职工的基本情况(职工号、姓名、年龄、性别、籍贯、工资、简历等)存放在表中，这张表就可以看成是一个数据库。有了这个“数据仓库”我们就可以根据需要随时查询某职工的基本情况，也可以查询工资在某个范围内的职工人数等等。这些工作如果都能在计算机上自动进行，那我们的人事管理就可以达到极高的水平。此外，在财务管理、仓库管理、生产管理中也需要建立众多的这种“数据库”，使其可以利用计算机实现财务、仓库、生产的自动化管理。给数据库下了一个比较完整的定义：数据库是存储在一起的

相关数据的集合，这些数据是结构化的，无有害的或不必要的冗余，并为多种应用服务；数据的存储独立于使用它的程序；对数据库插入新数据，修改和检索原有数据均能按一种公用的和可控制的方式进行。当某个系统中存在结构上完全分开的若干个数据库时，则该系统包含一个“数据库集合”。数据库的优点人事基本档案使用数据库可以带来许多好处：如减少了数据的冗余度，从而大大地节省了数据的存储空间；实现数据资源的充分共享等

数据仓库ods基础学习.

根据Bill.Inmon的定义,“数据仓库是面向主题的、集成的、稳定的、随时间变化的,主要用于决策支持的数据库系统” ODS是一个面向主题的、集成的、可变的、当前的细节数据集合,用于支持企业对于即时性的、操作性的、集成的全体信息的需求。常常被作为数据仓库的过渡,也是数据仓库项目的可选项之一。在Kimball的<<数据仓库生命周期工具集The Data WareHouse Liftcycle Toolkit>>,他是这样定义的: 1. 是操作型系统中的集成,用于当前,历史以及其它细节查询(业务系统的一部分; 2. 为决策支持提供当前细节数据(数据仓库的一部分。因此操作数据存储(ODS是用于支持企业日常的全局应用的数据集合,ODS的数据具有面向主题、集成的、可变的和数据是当前的或是接近当前的4个基本特征。同样也可以看出ODS是介于DB 和DW 之间的一种数据存储技术,和原来面向应用的分散的DB相比,ODS中的数据组织方式和数据仓库(DW一样也是面向主题的和集成的,所以对进入ODS的数据也象进入数据仓库的数据一样进行集成处理。另外ODS只是存放当前或接近当前的数据,如果需要的话还可以对ODS中的数据进行增、删和更新等操作,虽然DW中的数据也是面向主题和集成的,但这些数据一般不进行修改,所以ODS 和DW的区别主要体现数据的可变性、当前性、稳定性、汇总度上。由于ODS仍然存储在普通的关系数据库中,出于性能、存储和备份恢复等数据库的角度以及对源数据库的性能影响角度,个人不建议ODS保存相当长周期的数据,同样ODS中的数据也尽量不做转换,而是原封不动地与业务数据库保持一致。即ODS只是业务数据库的一个备份或者映像,目的是为了使数据仓库的处理和决策支持要求与OLTP系统相隔离,减少决策支持要求对OLTP系统的影响。为什么需要有一个ODS系统呢?一般在带有ODS的系统体系结构中,ODS都具备如下几个作用:

数据仓库的基本架构

数据仓库的目的是构建面向分析的集成化数据环境，为企业提供决策支持（Decision Support）。其实数据仓库本身并不“生产”任何数据，同时自身也不需要“消费”任何的数据，数据来源于外部，并且开放给外部应用，这也是为什么叫“仓库”，而不叫“工厂”的原因。因此数据仓库的基本架构主要包含的是数据流入流出的过程，可以分为三层——源数据、数据仓库、数据应用：从图中可以看出数据仓库的数据来源于不同的源数据，并提供多样的数据应用，数据自上而下流入数据仓库后向上层开放应用，而数据仓库只是中间集成化数据管理的一个平台。数据仓库从各数据源获取数据及在数据仓库内的数据转换和流动都可以认为是ETL（抽取Extra, 转化Transfer, 装载Load）的过程，ETL是数据仓库的流水线，也可以认为是数据仓库的血液，它维系着数据仓库中数据的新陈代谢，而数据仓库日常的管理和维护工作的大部分精力就是保持ETL 的正常和稳定。下面主要简单介绍下数据仓库架构中的各个模块，当然这里所介绍的数据仓库主要是指网站数据仓库。数据仓库的数据来源其实之前的一篇文章已经介绍过数据仓库各种源数据的类型——数据仓库的源数据类型，所以这里不再详细介绍。对于网站数据仓库而言，点击流日志是一块主要的数据来源，它是网站分析的基础数据；当然网站的数据库数据也并不可少，其记录这网站运营的数据及各种用户操作的结果，对于分析网站Outcome这类数据更加精准；其他是网站内外部可能产生的文档及其它各类对于公司决策有用的数据。

数据仓库的数据存储源数据通过ETL的日常任务调度导出，并经过转换后以特性的形式存入数据仓库。其实这个过程一直有很大的争议，就是到底数据仓库需不需要储存细节数据，一方的观点是数据仓库面向分析，所以只要存储特定需求的多维分析模型；另一方的观点是数据仓库先要建立和维护细节数据，再根据需求聚合和处理细节数据生成特定的分析模型。我比较偏向后面一个观点：数据仓库并不需要储存所有的原始数据，但数据仓库需要储存细节数据，并且导入的数据必须经过整理和转换使其面向主题。简单地解释下： (1).为什么不需要所有原始数据？数据仓库面向分析处理，但是某些源数据对于分析而言没有价值或者其可能产生的价值远低于储存这些数据所需要的数据仓库的实现和性能上的成本。比如我们知道用户的省份、城市足够，至于用户究竟住哪里可能只是物流商关心的事，或者用户在博客的评论内容可能只是文本挖掘会有需要，但将这些冗长的评论文本存在数据仓库就得不偿失； (2).为什么要存细节数据？细节数据是必需的，数据仓库的分析需求会时刻变化，而有了细节数据就可以做到以不变应万变，但如果我们只存储根据某些需求搭建起来的数据模型，那么显然对于频繁变动的需求会手足无措； (3).为什么要面向主题？面向主题是数据仓库的第一特性，主要是指合理地组织数据以方面实现分析。对于源数据而言，其数据组织形式是多样的，像点击流的数据格式是未经优化的，前台数据库的数据是基于OLTP操作组织优化的，这些可能都不适合分析，而整理成面向主题的组织形式才是真正地利于分析的，比如将点击流日志整理成页面（Page）、访问（Visit或Session）、用户（Visitor）三个主题，这样可以明显提升分析的效率。数据仓库基于维护细节数据的基础上在对数据进行处理，使其真正地能够应用于分析。主要包括三个方面：数据的聚合这里的聚合数据指的是基于特定需求的简单聚合（基于多维数据的聚合体现在多维数据模型中），简单聚合可以是网站的总Pageviews、Visits、