一起大数据-一起大数据网由数据爱好者发起并维护,专注数据分析、挖掘、大数据相关领域的技术分享、交流。不定期组织爱好者聚会,期待通过跨行业的交流和碰撞,更好的推进各领域数据的价值落地。

一起大数据

最新发布

R

R语言 | 关联规则

from https://blog.csdn.net/gjwang1983/article/details/45015203 1.概念 1.1 引论 关联规则(AssociationRules)是无监督的机器学习方法,用于知识发现,而非预测...

数据挖掘

随机森林和GBDT的区别

  一,随机森林 随机森林是一个用随机方式建立的,包含多个决策树的集成分类器。其输出的类别由各个树投票而定(如果是回归树则取平均)。假设样本总数为n,每个样本的特征数为a,则随机森林的生成过程如下: 从原始样本中采用有放回抽样的方...

数据挖掘

教你如何最快入门用户画像

转自 http://www.cnblogs.com/ModifyRong/p/7800318.html 大家可能经常会听到用户画像这个词,但是具体在做的时候又会觉得无从下手,或者认为只是常规的标签统计,这往往是一个误区。本人在某互联网企业从...

数据挖掘

SCIKIT-LEARN与GBDT使用案例

安装 SCIKIT-LEARN是一个基于python/numpy/scipy的机器学习库 windows下最简单的安装方式是使用winpython进行安装 WinPython地址 GBDT使用 这段代码展示了一个简单的GBDT调用过程 数据...

数据挖掘

kaggle 欺诈信用卡预测——Smote+LR

from:https://zhuanlan.zhihu.com/p/30461746 本项目需解决的问题 本项目通过利用信用卡的历史交易数据,进行机器学习,构建信用卡反欺诈预测模型,提前发现客户信用卡被盗刷的事件。 建模思路 项目背景 数据...

数据挖掘

协同过滤推荐算法的原理及实现

原文地址:http://blog.csdn.net/huagong_adu/article/details/7362908 一、协同过滤算法的原理及实现 二、基于物品的协同过滤算法详解 一、协同过滤算法的原理及实现 协同过滤推荐算法是诞生最...

数据挖掘

余弦计算相似度度量

from https://blog.csdn.net/u012160689/article/details/15341303 余弦计算相似度度量 相似度度量(Similarity),即计算个体间的相似程度,相似度度量的值越小,说明个体间相似...

数据挖掘

机器学习之降维

from https://blog.csdn.net/tdj8866/article/details/78539024 本周关于降维的学习主要分为五类:PCA、LDA、LLE、tSNE、ISOMAP 来进行学习 首先自己的任务是:tSNE的...

数据挖掘

【机器学习笔记】自组织映射网络(SOM)

作者:@渉风 本文为作者原创,转载请注明出处:http://www.cnblogs.com/surfzjy/p/7944454.html 什么是自组织映射? 一个特别有趣的无监督系统是基于竞争性学习,其中输出神经元之间竞争激活,结果是在任意...

数据挖掘

Windows7 下安装 tersorflow

from http://www.cnblogs.com/lovephysics/p/7220938.html 最近看起深度学习的一些知识,想要学习一个框架。在网上看了别人对这些框架的评比后,决定学习 tersorflow。之前一直以为 te...

数据挖掘

机器学习中防止过拟合方法

from https://www.cnblogs.com/lovephysics/p/7220703.html 过拟合 在进行数据挖掘或者机器学习模型建立的时候,因为在统计学习中,假设数据满足独立同分布,即当前已产生的数据可以对未来的数据进...

数据挖掘

深度学习防止过拟合的方法

from http://blog.csdn.net/taoyanqi8932/article/details/71101699 过拟合即在训练误差很小,而泛化误差很大,因为模型可能过于的复杂,使其”记住”了训练样本,然而其泛化误差却很高,在...

动态

一起大数据志愿者召集帖

目的: 1.维护自媒体平台,服务数据圈子(文章和职位分享); 2.不定期小聚会结交行业内朋友(志愿者组织,平台宣传、费用AA); 基本要求: 关注一起大数据微博 https://weibo.com/17bigdata 关注数据思维微信公众号...