标签:数据挖掘

Python

生成对抗网络(GAN)之MNIST数据生成

16

xsmile 发布于 2017-07-26

本文原作者天雨粟,原文载于作者的知乎专栏——机器不学习,一起大数据网经授权发布。 前言 GAN从2014年诞生以来发展的是相当火热,比较著名的GAN的应用有Pix2Pix、CycleGAN等。本篇文章主要是让初学者通过代码了解GAN的结构和运作机制,对理论细节不做过多介绍。我们还...

阅读(24)评论(0)赞 (0)

数据挖掘

SMOTE

3

xsmile 发布于 2017-07-18

from http://blog.sina.com.cn/s/blog_7103b28a0102wpqm.html 这是应对非均衡训练数据集的一种方法。 针对非均衡训练数据,可以采用的方法包括:1)对多数类进行欠采样,去除一些样本使样本数目接近;2)对少数类进行过采样,增加一些样...

阅读(138)评论(0)赞 (1)

数据挖掘

随机森林进行特征重要性度量的详细说明

xsmile 发布于 2017-07-17

来自 宋兵乙的博客 特征选择方法中,有一种方法是利用随机森林,进行特征的重要性度量,选择重要性较高的特征。下面对如何计算重要性进行说明。 1 特征重要性​度量 计算某个特征X的重要性时,具体步骤如下: 1)对每一颗决策树,选择相应的袋外数据(out of bag,OOB)​计算袋...

阅读(182)评论(0)赞 (2)

数据挖掘

Adaboost 算法

22

xsmile 发布于 2017-07-05

from http://blog.csdn.net/aliceyangxi1987/article/details/72969566 本文结构: 什么是集成学习? 为什么集成的效果就会好于单个学习器? 如何生成个体学习器? 什么是 Boosting? Adaboost 算法? 什...

阅读(347)评论(0)赞 (3)

数据挖掘

Kaggle 神器 xgboost

2

xsmile 发布于 2017-07-05

from http://blog.csdn.net/aliceyangxi1987/article/details/72969146 在 Kaggle 的很多比赛中,我们可以看到很多 winner 喜欢用 xgboost,而且获得非常好的表现,今天就来看看 xgboost 到底是...

阅读(465)评论(0)赞 (1)

Python

Sklearn 快速入门

2

xsmile 发布于 2017-06-20

from http://blog.csdn.net/aliceyangxi1987/article/details/71079505 学习资料:大家可以去莫烦的学习网站学到更多的知识。 本文结构: Sklearn 简介 选择模型流程 应用模型 Sklearn 简介 Scikit ...

阅读(579)评论(0)赞 (2)

数据挖掘

交叉验证(Cross Validation)原理小结

xsmile 发布于 2017-06-15

作者 刘建平Pinard 原文 http://www.cnblogs.com/pinard/p/5992719.html 交叉验证是在机器学习建立模型和验证模型参数时常用的办法。交叉验证,顾名思义,就是重复的使用数据,把得到的样本数据进行切分,组合为不同的训练集和测试集,用训练集...

阅读(497)评论(0)赞 (0)

数据挖掘

k-近邻算法

5

xsmile 发布于 2017-06-14

作者:王哲 from http://www.cnblogs.com/qwertWZ/p/4582096.html 转载请在显著位置注明作者及出处 目录 1. k-近邻算法概述 2. 示例:使用k-近邻算法改进约会网站的配对效果 3. 示例:手写识别系统 4. 小结 系列文章:《机...

阅读(348)评论(1)赞 (0)

数据挖掘

决策树

2

xsmile 发布于 2017-06-14

作者:王哲 from http://www.cnblogs.com/qwertWZ/p/4960755.html 转载请在显著位置注明作者及出处 目录 1. 决策树的构造 2. 测试和存储分类器 3. 示例:使用决策树预测隐形眼镜类型 系列文章:《机器学习实战》学习笔记 决策树 ...

阅读(420)评论(0)赞 (1)

数据挖掘

《机器学习系统设计》第11章 降维 学习笔记

20

xsmile 发布于 2017-06-10

from http://www.cnblogs.com/zzhzhao/p/5370894.html   针对书上的内容和网络上的资料记录下来的笔记,大家一起学习交流。 一.为什么需要降维 (一) 多余的特征会影响或误导学习器 (二) 更多特征意味着更多参数需要调整,过拟合风险也...

阅读(544)评论(0)赞 (2)

数据挖掘

关联规则评价

2

xsmile 发布于 2017-06-08

      前面我们讨论的关联规则都是用支持度和自信度来评价的,如果一个规则的自信度高,我们就说它是一条强规则,但是自信度和支持度有时候并不能度量规则的实际意义和业务关注的兴趣点。 一个误导我们的强规则 看这样一个例子,我们分析一个购物篮数据中购买游戏光碟和购买影片光碟之间的关联...

阅读(465)评论(0)赞 (1)

数据挖掘

数据挖掘之KNN分类

3

xsmile 发布于 2017-06-08

from http://www.cnblogs.com/fengfenggirl/archive/2013/05/27/knn.html 分类算法有很多,贝叶斯、决策树、支持向量积、KNN等,神经网络也可以用于分类。这篇文章主要介绍一下KNN分类算法。 1、介绍 KNN是k ne...

阅读(419)评论(0)赞 (0)

数据挖掘

异常检测算法–Isolation Forest

5

xsmile 发布于 2017-06-08

  南大周志华老师在2010年提出一个异常检测算法Isolation Forest,在工业界很实用,算法效果好,时间效率高,能有效处理高维数据和海量数据,这里对这个算法进行简要总结。 iTree 提到森林,自然少不了树,毕竟森林都是由树构成的,看Isolation Forest(...

阅读(853)评论(0)赞 (0)

数据挖掘

征信业必将大有可为?从拒绝推断说起

6

xsmile 发布于 2017-05-24

作者:KPMG专业数据挖掘团队 从“拒绝推断”说起 如果你读过我们先前发布的《解读芝麻信用与FICO评分的差异》,一定已经对“信用评分”的工作方式有所了解啦。除了打开支付宝就可以看见的芝麻信用评分之外,目前,较为权威的第三方信用评分机构包括FICO,Vantage,Experia...

阅读(735)评论(0)赞 (0)

R

信用卡评分模型(R语言)

18

xsmile 发布于 2017-05-09

from http://blog.csdn.net/csqazwsxedc/article/details/51225156 信用卡评分 2016年1月10日 一、数据准备 1、 问题的准备 •            目标:要完成一个评分卡,通过预测某人在未来两年内将会经历财务危...

阅读(1947)评论(0)赞 (9)