首页
›
答案
›
标签
›
大数据导论
大数据导论
101
我国当前数据开放存在的主要问题包括:
102
关于我国政府开放数据的描述正确的是:
103
以下哪种技术对大数据技术的发展起了基础支撑作用?
104
大数据的特征可以用被总结为4V特征,以下哪个不属于大数据的4V特征
105
微软研究院所提出的科学研究的第四种范式是指:
106
在大数据时代,我们将有三个重大思维的转变,要相关,();要全体,不要抽样;要效率,允许不精确。
107
2015年9月,国务院印发《()》系统部署大数据发展工作,指出了其必要性。
108
以下是关于大数据价值的描述,请填空:大数据可以帮助发现规律,大数据可以帮助()现象,大数据可以帮助预测未来。
109
在舍恩伯格的《大数据时代:生活、工作与思维的大变革》一书中指出,大数据时代对社会的最大影响就是对人们思维方式的3种转变,以下哪一项不是该书中所指出的三种思维变革()?
110
以下哪种技术对大数据技术的发展起到了基础支撑作用()?
111
以下哪种项不属于大数据的特点()?
112
传统科学研究的三个范式是实验-理论分析-计算,在大数据时代,()科学发现成为科学研究的第四范式。
113
通常用4V特性来描述大数据的主要特点,即大数据具有体量大、()、速度快和价值高四大特点。
114
大数据的处理流程可以归纳为5个环节,它们分别是:数据采集、()、大数据存储与管理、大数据分析与挖掘和计算结果展示等环节。
115
我们通常听某同学讲:我在阿里云上租了一个服务器,那么这个服务器是属于云计算的那种应用场景()
116
在野外部署有许多传感器,用于实时采集空气质量数据,当数据传回数据中心后,在存储之前需要进行数据的预处理操作,那么如下哪些操作部署于数据预处理所采用的方法()。
117
数据仓库所存储的数据,通常具有一定特点,下列哪些不属于其特点的()
118
为了描述数据的统计学特征,我们常用的统计学指标有()
119
大数据的发展需要大规模物理资源、计算资源的支持,以及高效的调度管理,所以从某种程度上讲,云计算的发展促进了大数据的发展和应用。
120
对于一组数据(1,2,2,NAN,4),若采用众数法补全缺省值,则NAN该补为()
121
半结构化数据包括()
122
大数据的来源途径有许多,如下哪些属于大数据来源()
123
所谓数据的归一化处理,是指把数据变换到[0,1]区间,所以,对于数据1,2,3,4,归一化后得到的值为025,05,075,1
124
数据的平滑操作,其目的在于消除数据波动产生的噪声。
125
那些不是大数据的特点
126
大数据的容量不断增长,也就要求有更加复杂的数据管理方法,为此,如下哪项不是大数据存储面临的挑战()
127
假设有一个公司,分别在北京和上海都设置了一个存储中心,这两个中心分别主要服务于北方和南方的存储需求,那么这两个存储中心的布局是属于()分布式存储模式。
128
如下不是分布式文件系统的是()
129
有关大数据的处理可以分为多种模式,若我们想要对传感器网络实时采集的数据存储前做一定的预处理,那么选择哪种方法更合适()
130
Hadoop20中最基础的两个组件是()
131
HDFS存储的特点中,错误的是()
132
利用客户端进行HDFS的数据读取时,有关叙述正确的是()
133
HDFS的nameNode中,存储的有关核心数据包括()
134
目前被最广泛应用的数据库管理系统是()
135
关于Hbase的数据模型叙述中,正确的是()
136
HBase的访问方式有很多,如下的访问方式中,哪一种是支持直接命令行方式访问()
137
CAP理论的CAP分别代表()
138
有关HBase的叙述,正确的是()
139
有关数据仓库的描述,不符合的是()
140
有关Hive特性的描述,错误的是()
141
有关Hive命令行接口叙述,错误的是()
142
有关Hive存储模型的叙述,正确的是()
143
Hive中的元数据,以及所存储数据集都是存储在HDFS系统中。
144
已知有一组数据:64、65、67、70、71、75、76、77、78、80、81、85、90该组数据样本的方差为:
145
有以下一组数据:78、80、81、85、90、64、65、67、70、71、75、76、77该组数据样本的中位数为:
146
设x、y为向量(1)x=(1,1,2,2)(2)y=(2,2,2,3)求两个向量的Pearson相关系数:
147
两个随机变量X与Y之间正相关,则其相关系数大于0。
148
DBSCAN算法属于什么类型的聚类算法()
149
以下哪一项属于k-means算法的优点()
150
聚类分析属于有监督学习类型。
151
好的聚类方法需要产生高质量的聚类结果,所形成的簇要有高的内部相异性。
152
聚类质量Compactness(紧密性)指标以簇内误差的()作为度量标准
153
决策树算法ID3基于()作为属性选择的度量。
154
变量的不确定性越大,信息熵也就越大。
155
ID3算法在进行某个节点进行划分时,会偏向于取值较多的属性。
156
有下列一组符号数据,根据信息熵的定义,求出其信息熵为:()。(取小数点后3位)。
157
以下说法错误的是()A数据集中每个数据项作为单个图元素表示。
158
以下不属于数据可视化图形的是()
159
力导向图能表是节点之间多对多的关系,是属于()
160
数据可视化映射的视觉标记是指:()映射为点、线或形状;关系映射为连接和包含。
161
标签云(TagCloud)是属于()可视化中的一种。
162
以下不属于高维数据可视化类别的是()
163
以下哪种可视化工具是来自百度的开源工具?()
164
数据可视化是通过()手段,清晰有效地传达与沟通信息。实现对稀疏又复杂的数据集的深入洞察。
165
()图矩阵SPLOM展示数据集中各个维度的两两之间的关系
166
数据()表是Excel的交互式报表,可快速合并、计算和排序数据,它还可以设置为动态地改变版面布置。
167
()包含有智慧城市和智能交通等的大数据框架。
168
基于用户搜索行为、浏览行为、评论历史和个人资料等,进行针对性的产品生产、改进和营销,属于()
169
推荐系统是由()三部分组成。
170
新闻网一般采用基于用户的()算法(UserCF算法),给目标客户推荐其他有相同或相似兴趣爱好的人关注的新闻,推荐结果有一定的新颖性。
171
根据用户的历史行为推荐相似物品比如电影网、音乐网,更注重个性,通常采用基于()的协同过滤(ItemCF算法)。
‹
1
2
›