基于此,闲话少叙,下面让我们开始吧
简而言之,机器学习项目有三个主要部分:第一部分是数据理解、数据收集和清理,第二部分是模型的实现,第三部分是进行模型优化。一般而言,数据理解、收集和清理需要花费整个项目60-70%的时间。为此,我们需要该领域专家。
机器学习是现在,也是未来。所有的技术人员、数据科学家和金融专家可以从中受益,同时,如果上述这些人员在之后的日子不对该项技术有所涉猎的话,很可能会被时代所淘汰。
2.选择合适的编程语言。需要熟练掌握Python,请点击阅读:
从零开始学python
现实中,不管是工业界,亦或是学业界,都有大量的机器学习算法可供使用。上述文章中将分析典型的机器学习算法各自的优缺点,及针对的具体问题。 到目前为止,你可能已经理解了你需要解决的项目问题是有监督问题还是无监督问题。 然而,机器学习不像经典的程序设计一样(给定一个输入,其输出是固定), 机器学习总有可能找到另外一个正确的答案。比如,预测问题中通常有多个正确的答案。 2.如果这是一个有监督的机器学习问题,那么请确保你了解该项目是回归还是分类问题。想弄清楚这点可以阅读下面这篇文章: 有监督的机器学习:回归与分类 预测、建模和推导时间序列在许多领域越来越受欢迎。时间序列一般用于预测未来。 4.找出一种预先测量算法性能的方法。如何确定评测指标可以参考下面这篇文章: 每个数据科学家必须知道的数学度量方法 预测是计量经济学和数据科学中的一个重要概念,它也广泛用于人工智能中。 6.调查是否需要使用ARIMA模型。详细内容请参考下面这篇文章: 了解差分整合移动平均自回归模型——ARIMA 上述文章解释了聚类在无监督机器学习中的工作原理。 8.探索神经网络和深度学习,看看它是否适用于你的问题。详细内容请参考下面这篇文章: 了解神经网络:从激活函数到反向传播 有时我们会建立一个机器学习模型,用我们的训练数据训练它,当我们训练好后进行预测时,效果并不是很理想,有部分原因是数据集存在脏数据或不够全面,因此需要对数据进行进一步的处理,比如数据清洗、增强等。 干净的数据=良好的结果。 10.减少特征尺寸空间。详细内容请参考下面这篇文章: