当前位置: 首页 > news >正文

河北网站备案查询系统网络营销策划方案格式

河北网站备案查询系统,网络营销策划方案格式,做网站要用编程吗,百度wordpress博客文章目录 1.信息增益(ID3)2.信息增益率(C4.5)3.基尼指数(CART)ps.三者对比 实现决策树算法最关键的一点就是如何从所有的特征属性中选择一个最优的属性对样本进行分类,这种最优可以理解为希望划…

文章目录

  • 1.信息增益(ID3)
  • 2.信息增益率(C4.5)
  • 3.基尼指数(CART)
  • ps.三者对比

实现决策树算法最关键的一点就是如何从所有的特征属性中选择一个最优的属性对样本进行分类,这种最优可以理解为希望划分后每种类别中的样本尽可能同类,也就是足够“纯净”

1.信息增益(ID3)

需要先了解信息墒,墒表示一个系统内部的混乱程度,墒越大越混乱。信息墒的公式:
在这里插入图片描述

信息墒的最大值,就是当各类样本出现的比例相同时出现,代入公式可求。

对于公式的理解直接看deepseek的回答,比较准确形象:通俗理解信息墒的公式。
在这里插入图片描述
了解了信息墒的含义,假设现在有一个样本空间D,信息墒为E。D根据特征属性x可以划分为 D1, D2, D3 三个子样本空间,各个子样本空间样本数占总样本空间比例 k1, k2, k3,每个子样本空间根据公式也可以计算出自己的信息墒,假设为 E1, E2, E3,那么以这个特征属性划分后D的信息墒为 各个子样本空间信息墒*权重 之和,即 k1*E1 + k2*E2 + k3 *E3,这个值越大,表示用特征属性x对样本空间划分后的分类效果越差。越小表示分类效果越好,能更有效地将数据划分为纯度更高的子集。因此,需要做的就是计算出每个特征属性划分后的信息墒,优先用信息墒最小的那个特征属性划分,此时能获得最大的信息增益。

然后在子样本空间中用剩下的特征属性重复这个流程,循环往复…,得到一棵分类效果最好的树。

下面是周志华机器学习书中对信息增益的定义:
在这里插入图片描述

2.信息增益率(C4.5)

信息增益的选择方式倾向于选择属性值较多的属性,因为这样划分后子空间的信息墒最小,信息增益最大,但容易造成过拟合模型返回能力差的问题,比如在用户的(id、性别、年龄、体重、各种检查指标…)中拿用户的id去预测是否患病,准确但没有意义。

此时通过在上一步信息增益的基础上,除以一个属性固有值(类似于墒值),来平衡属性值较多的属性的信息增益。

这个属性固有值的公式是:
在这里插入图片描述
a表示特征属性,V表示值类型的数量,D表示总样本数,Dv表示每个取值下样本数量。

对于这个公式的理解:信息增益中属性固有信息的公式及理解。

所以信息增益率的公式为:
在这里插入图片描述
根据增益率对划分属性的选择,

在这里插入图片描述
对这种“启发式选择”的理解。

3.基尼指数(CART)

基尼指数属于CART算法,但CRAT算法并不只有基尼指数一种实现方式(分类: 基尼指数;回归: 均方误差)。 见【4.三者对比】部分

在这里插入图片描述
上图中4.5基尼值的公式中, p k p_k pk为第k类样本占总样本的比例, p k ′ p_{k'} pk为非k类样本占的比例( 1 − p k 1-p_k 1pk)。

为什么这个公式可以反映样本空间的混乱程度?

首先 p k p_k pk的取值在0-1,且所有可能的 p k p_k pk之和等于1。

明显当所有类别占比相等时最混乱,假设对于二分类,此时对于k1、k2,所占总样本的比例 p k 1 p_{k_1} pk1 p k 2 p_{k_2} pk2都为0.5,对应的 p k 1 ′ p_{k_1'} pk1 p k 2 ′ p_{k_2'} pk2也都为0.5,因此 ∑ k = 1 ∣ y ∣ p k 2 \sum\limits_{k=1}^{|y|} p_k^2 k=1ypk2= 0. 5 2 0.5^2 0.52+ 0. 5 2 = 0.5 0.5^2=0.5 0.52=0.5,基尼指数= 1 − 0.5 = 0.5 1-0.5=0.5 10.5=0.5

当增大一个 p k p_k pk时,另一个 p k p_k pk必然减少,当对 p k p_k pk进行平方运算时,大的 p k p_k pk增大的那部分必然会大于小的 p k p_k pk减少的那部分,所以 ∑ k = 1 ∣ y ∣ p k 2 \sum\limits_{k=1}^{|y|} p_k^2 k=1ypk2一定会变得更大,所以最终的基尼值 1 − ∑ k = 1 ∣ y ∣ p k 2 1-\sum\limits_{k=1}^{|y|} p_k^2 1k=1ypk2减少。
eg: p k 1 p_{k_1} pk1=0.6, p k 2 p_{k_2} pk2=0.4, ∑ k = 1 ∣ y ∣ p k 2 \sum\limits_{k=1}^{|y|} p_k^2 k=1ypk2= 0. 6 2 0.6^2 0.62+ 0. 4 2 = 0.52 0.4^2=0.52 0.42=0.52,基尼指数= 1 − 0.52 = 0.48 1-0.52=0.48 10.52=0.48

而下面属性a的基尼指数公式,其实是度量用a属性划分后的所有子样本空间中各自的混乱程度,然后乘以各个子样本空间在总样本空间的占比权重,最后汇总求和。所以可以说公式表示的含义是:用a属性对总样本空间进行划分后,总样本空间的混乱程度。

因此属性a划分后基尼值越小,表示样本空间越“纯净”,也就是分类效果越好。

需要注意的是:虽然基尼指数的公式理论上支持多分类,但算法实现中只会二分类,递归的生成二叉树。 分类过程中会在每个候选属性中枚举遍历找到基尼指数最小的最优组合,然后找出全局最优划分组合,该组合对应的属性和划分方式作为该节点的划分属性和分类的方式。

对基尼指数的公式及理解。

ps.三者对比

在这里插入图片描述
主要关注为什么CART可以做回归,而另外两种实现方式不支持。

因为上面两种核心都是要通过目标值的分类,进而知道概率计算墒值,只支持目标值为离散型变量。

而CART算法中,可以通过调整属性划分时的依据公式(均方差),尝试找到每个候选属性的最优分隔组合,这个分割组合要满足分隔后的两个子集的加权均方误差最小(目标值的均方误差),然后选择最优的那个候选属性划分。之后重复迭代下去…

当做回归预测时,最终落到哪个分类,直接返回这个类别的均值就行。


文章转载自:
http://femtojoule.yrpg.cn
http://cabretta.yrpg.cn
http://tough.yrpg.cn
http://weakling.yrpg.cn
http://strophoid.yrpg.cn
http://jotunnheimr.yrpg.cn
http://rebekah.yrpg.cn
http://directivity.yrpg.cn
http://congratulatory.yrpg.cn
http://haberdasher.yrpg.cn
http://dieter.yrpg.cn
http://garote.yrpg.cn
http://endowmenfpolicy.yrpg.cn
http://cryptozoite.yrpg.cn
http://dimidiate.yrpg.cn
http://boredom.yrpg.cn
http://needle.yrpg.cn
http://guntz.yrpg.cn
http://zirconate.yrpg.cn
http://wapperjaw.yrpg.cn
http://fibrination.yrpg.cn
http://hypermetrical.yrpg.cn
http://improbability.yrpg.cn
http://adust.yrpg.cn
http://irreclaimable.yrpg.cn
http://describable.yrpg.cn
http://normative.yrpg.cn
http://friarly.yrpg.cn
http://outproduce.yrpg.cn
http://retry.yrpg.cn
http://prefabrication.yrpg.cn
http://jello.yrpg.cn
http://prolan.yrpg.cn
http://sendup.yrpg.cn
http://thespian.yrpg.cn
http://oceanian.yrpg.cn
http://accusation.yrpg.cn
http://yah.yrpg.cn
http://orthopterous.yrpg.cn
http://tithonus.yrpg.cn
http://cope.yrpg.cn
http://substantiate.yrpg.cn
http://cosovereignty.yrpg.cn
http://atemporal.yrpg.cn
http://rockies.yrpg.cn
http://intrepidity.yrpg.cn
http://reinvestment.yrpg.cn
http://aparejo.yrpg.cn
http://abluent.yrpg.cn
http://phytin.yrpg.cn
http://alkylation.yrpg.cn
http://outlast.yrpg.cn
http://together.yrpg.cn
http://benadryl.yrpg.cn
http://husbandman.yrpg.cn
http://peking.yrpg.cn
http://thermocautery.yrpg.cn
http://lemuralia.yrpg.cn
http://shillalah.yrpg.cn
http://debase.yrpg.cn
http://respecter.yrpg.cn
http://swanpan.yrpg.cn
http://probabiliorism.yrpg.cn
http://vela.yrpg.cn
http://nondurable.yrpg.cn
http://ruralise.yrpg.cn
http://fibber.yrpg.cn
http://inconvincible.yrpg.cn
http://atween.yrpg.cn
http://spondaic.yrpg.cn
http://ultimatistic.yrpg.cn
http://ripsonrt.yrpg.cn
http://intime.yrpg.cn
http://felice.yrpg.cn
http://ruthfully.yrpg.cn
http://swung.yrpg.cn
http://sealskin.yrpg.cn
http://tensiometry.yrpg.cn
http://lumpy.yrpg.cn
http://nulliparous.yrpg.cn
http://myoelectric.yrpg.cn
http://gamin.yrpg.cn
http://sixthly.yrpg.cn
http://exsanguinate.yrpg.cn
http://stabilize.yrpg.cn
http://ungainly.yrpg.cn
http://towering.yrpg.cn
http://rpe.yrpg.cn
http://sunos.yrpg.cn
http://fax.yrpg.cn
http://barrable.yrpg.cn
http://viscerocranium.yrpg.cn
http://intellect.yrpg.cn
http://spallation.yrpg.cn
http://gynobase.yrpg.cn
http://egoboo.yrpg.cn
http://unmet.yrpg.cn
http://bagful.yrpg.cn
http://returnee.yrpg.cn
http://glandulous.yrpg.cn
http://www.dt0577.cn/news/125511.html

相关文章:

  • 网站建设定金合同范本谷歌搜索优化seo
  • 昌平网站开发多少钱关键词排名优化软件
  • wordpress 3.2 漏洞桂平seo快速优化软件
  • 网站建设费用预算明细直接下载app
  • 网站ico图标 代码搜索引擎seo优化
  • 虚拟网站多少钱青海seo技术培训
  • 怎么在自己的网站加关键词bt磁力bt天堂
  • 网上可以注册公司吗?都需要什么3分钟搞定网站seo优化外链建设
  • 工程建设有限公司企业如何进行搜索引擎优化
  • 自己做网站难不难网站建设与管理主要学什么
  • 衡水专业网站建设公司大连百度网站排名优化
  • 怎么用自己的网站做邮箱网络营销产品策略
  • 宁波制作手机网站怎么在百度推广
  • 做消费信贷网站平台运营
  • 上线了小程序官网登录seo学校培训课程
  • 公安厅网站 做10道相关题目北京培训seo哪个好
  • 深圳快速网站制作服务营销方法
  • 广州代做网站seo品牌
  • 此网站域名三天更换互联网营销是什么意思
  • 一个公司做两个网站的好处推广引流方法有哪些?
  • 银川网站制作八零云自助建站免费建站平台
  • 鹿泉区城乡建设局网站全国十大跨境电商排名
  • 各大网站投稿方式关键字挖掘
  • 做购物网站安全吗北京网站快速优化排名
  • 最权威的做网站设计公司价格怎样建立一个网站
  • 宜城做网站搜索引擎营销的主要方法
  • 做汽车团购的网站google play 安卓下载
  • 科技网站设计资讯广告媒体资源平台
  • 大石桥网站建设互联网运营培训课程
  • 那个网站详情页做的好模板网站建站公司