数据挖掘

Sklearn 快速入门

2

xsmile 发布于 2017-06-20

from http://blog.csdn.net/aliceyangxi1987/article/details/71079505 学习资料:大家可以去莫烦的学习网站学到更多的知识。 本文结构: Sklearn 简介 选择模型流程 应用模型 Sklearn 简介 Scikit ...

阅读(202)评论(0)赞 (1)

交叉验证(Cross Validation)原理小结

xsmile 发布于 2017-06-15

作者 刘建平Pinard 原文 http://www.cnblogs.com/pinard/p/5992719.html 交叉验证是在机器学习建立模型和验证模型参数时常用的办法。交叉验证,顾名思义,就是重复的使用数据,把得到的样本数据进行切分,组合为不同的训练集和测试集,用训练集...

阅读(261)评论(0)赞 (0)

k-近邻算法

5

xsmile 发布于 2017-06-14

作者:王哲 from http://www.cnblogs.com/qwertWZ/p/4582096.html 转载请在显著位置注明作者及出处 目录 1. k-近邻算法概述 2. 示例:使用k-近邻算法改进约会网站的配对效果 3. 示例:手写识别系统 4. 小结 系列文章:《机...

阅读(136)评论(1)赞 (0)

决策树

2

xsmile 发布于 2017-06-14

作者:王哲 from http://www.cnblogs.com/qwertWZ/p/4960755.html 转载请在显著位置注明作者及出处 目录 1. 决策树的构造 2. 测试和存储分类器 3. 示例:使用决策树预测隐形眼镜类型 系列文章:《机器学习实战》学习笔记 决策树 ...

阅读(166)评论(0)赞 (1)

《机器学习系统设计》第11章 降维 学习笔记

20

xsmile 发布于 2017-06-10

from http://www.cnblogs.com/zzhzhao/p/5370894.html   针对书上的内容和网络上的资料记录下来的笔记,大家一起学习交流。 一.为什么需要降维 (一) 多余的特征会影响或误导学习器 (二) 更多特征意味着更多参数需要调整,过拟合风险也...

阅读(280)评论(0)赞 (0)

关联规则评价

2

xsmile 发布于 2017-06-08

      前面我们讨论的关联规则都是用支持度和自信度来评价的,如果一个规则的自信度高,我们就说它是一条强规则,但是自信度和支持度有时候并不能度量规则的实际意义和业务关注的兴趣点。 一个误导我们的强规则 看这样一个例子,我们分析一个购物篮数据中购买游戏光碟和购买影片光碟之间的关联...

阅读(233)评论(0)赞 (1)

数据挖掘之KNN分类

3

xsmile 发布于 2017-06-08

from http://www.cnblogs.com/fengfenggirl/archive/2013/05/27/knn.html 分类算法有很多,贝叶斯、决策树、支持向量积、KNN等,神经网络也可以用于分类。这篇文章主要介绍一下KNN分类算法。 1、介绍 KNN是k ne...

阅读(239)评论(0)赞 (0)

异常检测算法–Isolation Forest

5

xsmile 发布于 2017-06-08

  南大周志华老师在2010年提出一个异常检测算法Isolation Forest,在工业界很实用,算法效果好,时间效率高,能有效处理高维数据和海量数据,这里对这个算法进行简要总结。 iTree 提到森林,自然少不了树,毕竟森林都是由树构成的,看Isolation Forest(...

阅读(576)评论(0)赞 (0)

征信业必将大有可为?从拒绝推断说起

6

xsmile 发布于 2017-05-24

作者:KPMG专业数据挖掘团队 从“拒绝推断”说起 如果你读过我们先前发布的《解读芝麻信用与FICO评分的差异》,一定已经对“信用评分”的工作方式有所了解啦。除了打开支付宝就可以看见的芝麻信用评分之外,目前,较为权威的第三方信用评分机构包括FICO,Vantage,Experia...

阅读(606)评论(0)赞 (0)

R语言之Apriori算法应用

3

xsmile 发布于 2017-05-14

from http://www.cnblogs.com/dm-cc/p/5737147.html 一. 概念 关联分析用于发现隐藏在大型数据集中的有意义的联系。所发现的联系可以用关联规则(association rule)或频繁项集的形式表示。 项集:在关联分析中,包含0个或多个...

阅读(527)评论(0)赞 (5)

信用卡评分模型(R语言)

18

xsmile 发布于 2017-05-09

from http://blog.csdn.net/csqazwsxedc/article/details/51225156 信用卡评分 2016年1月10日 一、数据准备 1、 问题的准备 •            目标:要完成一个评分卡,通过预测某人在未来两年内将会经历财务危...

阅读(1401)评论(0)赞 (9)

使用sklearn做单机特征工程

8

xsmile 发布于 2017-04-19

from http://www.cnblogs.com/jasonfreak/p/5448385.html 目录 1 特征工程是什么? 2 数据预处理 2.1 无量纲化 2.1.1 标准化 2.1.2 区间缩放法 2.1.3 标准化与归一化的区别 2.2 对定量特征二值化 2.3...

阅读(663)评论(0)赞 (2)

神经网络编程入门

27

xsmile 发布于 2017-03-26

  本文主要内容包括: (1) 介绍神经网络基本原理,(2) AForge.NET实现前向神经网络的方法,(3) Matlab实现前向神经网络的方法 。 第0节、引例  本文以Fisher的Iris数据集作为神经网络程序的测试数据集。Iris数据集可以在http://en.wik...

阅读(812)评论(0)赞 (1)

机器学习中的相似性度量

24

xsmile 发布于 2017-03-26

from http://www.cnblogs.com/heaad/archive/2011/03/08/1977733.html 在做分类时常常需要估算不同样本之间的相似性度量(Similarity Measurement),这时通常采用的方法就是计算样本间的“距离”(Dist...

阅读(1033)评论(0)赞 (0)

文本分类与SVM

9

xsmile 发布于 2017-03-16

from http://blog.csdn.net/zhzhl202/article/details/8197109 之前做过一些文本挖掘的项目,比如网页分类、微博情感分析、用户评论挖掘,也曾经将libsvm进行包装,写了一个文本分类的开软软件Tmsvm。所以这里将之前做过一些关...

阅读(857)评论(0)赞 (1)