数据科学从一开始就是一个交叉学科,要求从业者在计算机、数学领域具备一定的技能,同时还要具备在同人与生意打交道的经验。有些人会在多年的工作生活中慢慢累积相关的经验,但是如果那儿有一个捷径存在呢?
现在我决定同大家分享我在数据科学这条路上帮我打基础的7大资源。选取的这些资源即兼顾了趣味儿性的同时也兼顾了包含在内的Master List of Logical Fallacies 逻辑谬论列表
utminers.utep.edu/omwilliamson/emgl1311utminers.utep.edu
如果在刚开始学习这些内容时把你自己所在一个笼子里几周,出来后你会对很多你听到的、你见到的事情产生质疑。不要忘了目标:数据科学!
Dilbert列举了许多常见谬误
GRE Just Math | Manhattan Prep
Manhattan Prep GRE Set of 8 Strategy Guides, 4th Edition : Manhattan Prep : 9781937707910
A Virtual Crash Course in Design Thinking
在很多情况下,理解更有经验的人的观点是非常有用的,同时这也是一种捷径。你可以和来自世界各个角落的人分享观点,参加黑客马拉松和各种聚会,世界上的大多数城市都会有诸如此类的活动。核心是交流,学习和分享。完全没有理由孤立自己。
"正统"经济学和"异端"经济学
如果你正在处理消费者数据,这些资源将会特别有用。但是如果你正在处理数据中心监控数据,药品数据,金融监控,工厂传感器上的生物医学数据,这些资源基本用不上。记住,这篇文章是基于我自身的经验,但是这里的要点是获取某一专业领域的知识。
我用简单的方式介绍一下两者的不同:正统经济学着重用一串的主流模型解释过去,现在和未来。然而"异端"经济学加入了很多的社会中的个人情况,经常在均衡中带入一些主观性。
拿巴西汽车价格举例。虽然巴西仍然在与高物价,荒谬的税收,仅仅只有12%的地方铺有公路等情况做着斗争,但是汽车制造商仍然有很高的利润率。除此之外,当人们在买车的时候,人们更倾向购买高档次的汽车,有时不惜以过高的利率分72期进行偿还。这又很多客观的和主观的原因在里面。相比于公共交通的质量,有一辆好车既是地位的象征,同时在繁忙的交通中人们有一辆车感觉会更好......这些变量可以用"正统"经济学进行评估,但是当每一个人都有自己的价值感知时,这些变量就不能直接进行评估了。这个挑战是在购买者和利润率都最大化时定义产品和价格。所以理解文化价值和宏观经济因素对感知的影响之间的对抗是重要的,这将对你进行分析更加有利。而且,理解个人行为是个性化的关键,同时这也是数据科学中的一个重要主题。顺便说一句,根据以上的例子,利率同样来自主观的因素,比如借款人和贷款人的时间偏好。
理解经济学是处理国际业务的关键。明知道宏观经济动态并不能够彻底地被GDP或者(贸易)顺差这样的主流指标解决,将迫使你自然而然地陷入可选择但强制的辩解中。
出于我个人对金融危机的好奇,我大约在2008年的时候启动了这些课题,但是我直到2012年的时候才发布了以下这些资源:
Winning At Innovation: The A-to-F Model
Demand: Creating What People Love Before They Know They Want It
这些是怎么结合起来的呢?
现在,假设你是在一家负责CRM(客户关系管理)和订阅主要宠物产品供应商的内容管理的机构工作。
以你对商业和人群不断变化的理解,你写了一个包含能够对潜在客户分类,并能识别“呼叫中心背景噪音有多大“与发表在企业APP上的“不断增长的有关丑陋的狗狗内容”的综合因素有关的根本原因的代码。
你还了解到"客户中心的响度"与“狗狗的丑陋”不是独立思考的客户流失的主要原因。你把这些你用python的Season库并且你允许它使用这些数据并用数据可视化工具活动起来建立起来的图表呈递给你的首席战略官。你已经成功地向组织的主要领导解释了结论是如何形成的,就像指挥管弦乐队的大师,但是你用对数学和统计建模的扎实理解的能力替代了指挥棒。你很自信,你的论点很有道理,这导致了领导层的认可,因为你现在正在创造一个欣欣向荣的环境来讨论真正的问题,而不是谬误。CRM将解决客户容易流失的客户案例,内容经理现在将开始发布有关llamas的更多信息,这将增加节假日的附加销售,因为您的大多数客户都居住在秘鲁一个旅游频繁的城市。
最后,您还使用在GPU上运行的密集神经网络的TensorFlow来训练这种流失预测算法,来处理数十亿条记录和特性。它的部署方式是,即时评估应用程序、网站、实体商店和呼叫中心内客户的所有交互,使系统能够了解模式,并在检测到高流失可能性时通知您。