首页
›
答案
›
标签
›
数据挖掘与python实践
数据挖掘与python实践
101
在多层次关联规则分析中,如果将商品进行归类,每一商品类别的支持度会()其包含的每个商品的支持度,从而有利于发现一些有意义的频繁模式或关联规则。
102
在FP-growth构建频繁模式树中,每个()(除根结点外)代表一个单项,树中的每条()代表原数据中每一个条目的各个项。如果把条目内的项组合在一起看成一个字符串,则字符串前缀相同时共享相同的()。
103
购买了此商品后还会购买的商品,它们的地位是平等的,其中涉及了时间和顺序的概念,强调的是一个规则,也就是我们所说的关联规则。
104
如果一个项集是不频繁的, 则其所有的超集都是不频繁的。利用这一性质可以简化Apriori算法中的计算过程。
105
逐层发现算法Apriori发现频繁项集的过程是按照项集的长度由大到小逐级进行的。
106
利用项的概念层次信息,不仅可以发现涉及那些出现频率比较低的商品的频繁模式和关联规则,而且还可以发现概括性更强的规则。
107
在结构化数据中进行关联分析发现其中的频繁模式和关联规则。对于取值连续的属性,首先将其离散化,然后将每个取值区间作为一个值,继而转化为属性=值的形式。
108
若Y和Z是X的两个不同的k项子集,只有当confidence(X-Y→Y)≥minconf和confidence(X-Z→Z) ≥minconf都满足时,X-(Y∪Z) →(Y∪Z)一定成立。
109
具体来讲,若一个项集X的支持度大于用户给定的一个最小支持度阈值, 则X被称为频繁项集(或频繁模式)。
110
如果一个规则X→Y同时满足support(X→Y)≥minsup和confidence(X→Y)≥minconf, 则称该规则在数据库D中成立, 其中minsup和minconf分别是用户给定的最小支持度和最小置信度的阈值。
111
给定最小支持度阈值minsup,一个频繁项集的所有非空子集都是频繁的。
112
FP-growth算法无须生成候选项集的方法,可以避免产生大量候选项集。
113
Python在调用efficient-apriori包中的apriori函数训练挖掘关联规则时,设定最小支持度的参数是()。
114
Python在调用efficient-apriori包中的apriori函数训练挖掘关联规则时,设定最小置信度的参数是()。
115
给定一个频繁负项集X,我们可以从中发现隐含的负关联规则。负项集和负关联规则统称为() 。
116
如果一个规则和其祖先规则具有近似相同的置信度,则该规则称为()。为了减少发现的规则数目,可以将其从输出的结果中删除。
117
通过代码from sklearn import tree引入决策树模块,并通过代码clf = treeDecisionTreeClassifier()构造分类器对象后,训练时要调用的方法是()。
118
通过代码from sklearn import tree引入决策树模块,并通过代码clf = treeDecisionTreeClassifier()构造分类器对象,在训练后做预测时要调用的方法是()。
119
利用treeDecisionTreeClassifier()训练模型时调用fit()方法需要传递的第一个参数是()。
120
利用treeDecisionTreeClassifier()训练模型时调用fit()方法需要传递的第二个参数是()。
121
通过代码from sklearn import metrics引入评价指标模块后,面对真实标签true()label和模型预测标签predicted()label,混淆矩阵可通过调用()代码得到。
122
在Scikit-learn模块下,不同分类模型在训练时,调用的方法名称()。
123
在Scikit-learn模块下,不同分类模型在预测时,调用的方法名称()。
124
用于分类与回归应用的主要算法有()。
125
决策树中不包含一下哪种结点()。
126
以下哪种算法是分类算法()。
127
下列属于决策树中应该剪枝的情景是()。
128
朴素贝叶斯分类中得到条件概率的方法错误的是()。
129
假设某分类器在一个测试数据集上的分类结果的混淆矩阵如下所示,该分类器的准确率accuracy为()。 PredictedyesnoActualyes155no1020
130
假设某分类器在一个测试数据集上的分类结果的混淆矩阵如下所示,该分类器的错误率error rate为()。 PredictedyesnoActualyes155no1020
131
构造训练数据集和测试数据集的常用方法有()。
132
为了比较利用不同分类算法构建的分类模型的性能,可以利用图形进行比较,常用的图形包括()。
133
分类是总结已有类别对象的特点,并根据这些特点,进行未知类别对象的类别预测的过程。又可称为无监督学习。
134
Bayes法是一种在已知后验概率与类条件概率的情况下的模式分类方法,待分样本的分类结果取决于各类域中样本的全体。
135
分类模型的误差大致分为两种:训练误差(training error)和泛化误差(generalization error)。
136
在决策树中,随着树中结点数变得太大,即使模型的训练误差还在继续减低,但是检验误差开始增大,这是出现了模型拟合不足的问题。
137
决策树方法通常用于关联规则挖掘。
138
留一法是交叉验证法的特殊情况。
139
决策树的思想是自顶向下递归的构建过程,关键点是在于分裂属性和分裂条件的选择。
140
ID3 的分裂属性选择条件是选择信息增益最大的作为分裂属性。
141
朴素贝叶斯分类基于贝叶斯定理的一种分类方法。
142
k 近邻方法不需要事先学习分类模型,当需要预测的时候,根据预测样本的特性和已知训练数据集中的数据进行类别的判断。
143
K近邻方法的核心思想是对一个预测样本A,从训练数据集中找到与其最相似的k个样本,利用这个k个样本的类别来决策该样本A的类别。
144
为了评价一个分类模型的性能,我们通常根据分类模型判断一组已知类别的对象的类别,这些已知类别的对象构成的数据集称为()。
145
决策树中根结点的层次为()。
146
分类算法针对某个测试数据集的有效性通常通过()矩阵来反映。
147
假设某分类器在一个测试数据集上的分类结果的混淆矩阵如下所示,请计算该分类器的错误率,以类别yes为正例,计算分类器的查准率precision为() %。【保留到整数位 PredictedyesnoActualyes155no1020
148
假设某分类器在一个测试数据集上的分类结果的混淆矩阵如下所示,请计算该分类器的错误率,以类别yes为正例,计算分类器的查全率recall为()%。【保留到整数位 PredictedyesnoActualyes155no1020
149
通过代码from sklearn import linear()model引入线性模型模块,并通过代码reg = linear()modelLinearRegression()构造回归器对象后,在训练时要调用的方法是()。
150
通过代码from sklearn import linear()model引入线性模型模块,并通过代码reg = linear()modelLinearRegression()构造回归器对象,在训练后做预测时要调用的方法是()。
151
利用linear()modelLinearRegression()训练模型时调用fit()方法需要传递的第一个参数是()。
152
利用linear()modelLinearRegression()训练模型时调用fit()方法需要传递的第二个参数是()。
153
在利用linear()modelLinearRegression()构造的reg对象训练模型后,可以通过以下哪行代码查看回归模型系数()。
154
已知对一组观察值(xi,yi)作出散点图后确定具有线性相关关系,若对于y=bx+a,求得b=051,x=6175,y=3814,则线性回归方程为()。
155
对于指数曲线y=a*e^(bx),令u=ln y,c=ln a,经过非线性化回归分析之后,可以转化成的形式为()。
156
下面关于构建模型树的说法中,错误的是()。
157
决策树的叶子结点对应()。
158
回归树的叶子结点对应()。
159
模型树的叶子结点对应()。
160
在比较模型的拟合效果时,甲、乙、丙、丁四个模型的决定系数R^2的值分别约为096、085、080和07,则拟合效果好的模型是()。
161
多元回归建模后的检验包括()。
162
常用的非线性函数除了多项式函数之外,还包括()。
163
()采用自顶向下分而治之的思想,将训练集不断分割成子数据集来不断扩展树枝,当满足一定条件时停止树的生长。
164
预测性能的优劣需要一定的度量来衡量,常用的度量是()。
165
数值预测与分类都属于有监督学习,解决问题的过程相同,都是先通过训练数据集进行学习,以得到一个模型然后利用模型进行预测。
166
为了检验回归系数的显著性,可以使用F检验。
167
在模型树的剪枝过程中,两个叶子结点的期望误差通过加权求和结合在一起作为子树误差。
168
回归树和模型树都是通过自下而上、分而治之的思想,将训练集不断分割成子数据集来不断扩展树枝,当满足一定条件时停止树的生长。
169
在模型树的构建过程中,应选择使SDR值最小的属性。
170
一元线性回归的步骤:构建包含因变量和自变量的训练集;通过散点图确认因变量和自变量之前的近似线性关系;计算系数和构建模型;模型检验;利用模型进行预测。
171
多元回归是对一个自变量和多个因变量之间的回归分析。
172
回归系数的检验可以采用t检验。
173
模型树构建之后,为了避免过度拟合,需要对模型树进行剪枝。
174
K近邻数值预测是利用一个样本的K个最相似的邻居的目标属性的取值来进行预测。
175
模型树构建之后,为了避免过度拟合,需要对模型树进行()。
176
在模型树的构建过程中,分裂属性的选择以分裂后的各个子数据集中目标属性取值的标准差为依据,将标准差作为一种误差度量,将分裂前后标准差的减少量作为误差的期望减少,称为()(填写英文简称)。
‹
1
2
›