位置:科技大田大数据产业专题>>资讯>>市场>>内容阅读
想开餐馆?也许你可以找大数据和机器学习帮忙
原标题:想开餐馆?也许你可以找大数据和机器学习帮忙

假设你正在南加州攻读(计量)经济学博士,不仅早早完成了博士论文,而且学有余力,想在业余时间开家餐馆挣点奶粉钱,你会考虑哪些问题?

也许你会想:餐馆开在哪里最好?是人流如潮的旧金山湾区还是七扭八拐的圣何塞小街?如果你已经选好了位置,那么做哪类生意?是遵循潮流开家辛辣火爆的烧烤店还是做家精致小众又昂贵的明星同款桐寿司?如果开烧烤店,你得与附近的Pig BBQ保持多远的距离以保证自己的生意不会被他家抢走?

图1: Pig BBQ, 530 Newhall Dr, San Jose Tel:(408) 289-1510)

图2: 王源热搜同款消费水平

想回答这些问题,你得知道消费者怎么想。此刻,身为经济学博士(候选人)又学过机器学习的你可能会想到,用离散选择模型不就可以拟合消费者行为,从而对消费者的偏好和选择进行预测,进而解决和自己一样的准餐馆老板的苦恼吗?

但这些涉及产品设计、区位选择的问题,因为现实世界的纷杂而难以用简单的离散模型回答。食客们的品味和对距离的敏感程度各有不同:在北京,有人愿意为美食从海淀远征三里屯,有人只想趿拉着拖鞋吃楼下的小面馆,餐馆的众多特征又影响着食客的选择;此外,在北京的你或许喜欢豆汁,但在上海的平行世界的你还会喜欢吗?

在大数据和机器学习时代,以上都不是问题。斯坦福大学技术经济学教授Susan Athey和她的合作者在最近发表的文章中,搭建了一个“路途时间因子分解”模型(Travel-Time Factorization Model, TTFM),利用数据公司收集的大量南加州消费者的面板数据,很好地阐明了消费者对餐馆和就餐路途时间的异质性需求问题。

1

模型概况

TTFM利用标准的离散选择模型来模拟每个消费者对于餐馆的选择行为。该模型与传统的离散选择模型不同,包含的潜变量个数很多,比如与餐馆自身属性相关的潜变量个数达到80个,与距离相关的潜变量个数也有16个:TTFM既包含了每个消费者对于餐馆特性的潜在异质性偏好、每家餐馆的潜在特性,也包含了消费者随餐馆而变的、对于就餐距离的异质性偏好,另外,模型中还加入了时间变动效应,以期捕捉季节和假期对于消费者行为的影响。最后,TTFM是一个分级模型(hierarchical model),可观察的餐馆属性会影响餐馆的潜变量的分布。

2

实证模型与估计

模型详解

作者使用了一个面板的离散选择模型来模拟决定在外用午餐的消费者对餐馆的选择行为。文章中作者将其称为TTFM(Travel-Time Factorization Model,路途时间因子分解模型)。模型的构造如下,下标u代表消费者,i代表餐馆,t代表消费者是第几次用餐。

其中,Uuit代表消费者u第t次去餐馆i用餐所的获得的效用。λi是餐馆i的固定效应,其经济学含义是餐馆的受欢迎程度,该项越大,消费者从餐馆i获得的效用越高,去那里就餐的可能性越大。θu是一个k1单位长的列向量,代表消费者u(对餐馆)的偏好,αi表示餐馆i与自身属性(如类型、评级、消费水平等)相关的潜变量,其长度也为k1(表明餐馆i与自身属性相关的潜变量个数为k1)。dui被定义为消费者u上午的位置与餐馆i之间的距离,γu是一个k2单位长的列向量,代表消费者u对就餐距离的敏感程度,βi代表餐馆i与距离相关的潜变量,后两者的内积表示消费者u对餐馆i的距离敏感度。μi代表餐馆i随时间而变的潜变量,wut代表消费者u的第t次用餐发生的那个星期,两者内积代表时间变动效应。

εuit是误差项,作者假设误差项服从Gumbel分布。Gumbel分布又称为第一类Fisher-Tippett极值分布,其概率密度函数和累积分布函数如下:

这使得这个面板RUM又可以被称为软盒模型(softbox model,类似于probit model和logit model的叫法),经过与logit模型相似的数学推导可以证明,消费者u在第t次就餐时选择餐馆i的概率与exp(Uuit-εuit)成正比。

TTFM与课上学习的RUM不同,是一个分级模型:餐馆的αi和βi两类潜变量并非直接由可观察的属性xi组成,因此可观察的属性不会直接影响效用大小,而是影响αi和βi分布的均值。具体来讲,模型中加入的分级的高斯先验分布有如下形式:

其中,Hα和Hβ是所谓的“潜矩阵”(latent matrix),即不同的可观察属性对潜变量的影响的权重矩阵,此处,作者设定餐厅的可观察属性包括消费水平、评级和类型。为计算简便起见,作者假设各有四分之一的潜变量分别只受餐馆i的类型、评级和消费水平影响,剩余四分之一的潜变量则独立于可观察的变量,这样权重矩阵中就会出现一些为零的分块。文中没有详细描述权重矩阵的计算过程,只是笼统地说权重矩阵是从数据中“学习”得来的,我们推测是在做cross-validation时同时调试了k­1、k2、Hα和Hβ等参数。另外,作者还为每个变量设置了先验方差。其中σ­α2=σ­β2=1. 由于潜矩阵中包含了所有餐馆的潜变量的信息,使用分级模型允许餐馆之间共享统计强度,因此可以使得对较少被光顾(样本量较小)的餐馆的潜变量的推断变得更为准确。

从以上设定可见,在TTFM中,要进行回归系数的估计,必须确定潜变量的后验(条件)分布函数。但是由于在大多数贝叶斯模型中,无法获得可观察变量的边际分布,导致无法在封闭型中获得潜变量的准确条件后验分布(回想一下贝叶斯公式),因此接下来的任务就是对潜变量的后验分布做估计。文中采用了变分推断(variational inference)的方法。

变分推断的基本思想是通过最优化获得一个更简单、更易于处理的分布来估计原条件后验分布。具体做法是先确立一族潜变量的估计分布Q,然后在这一族分布里选择一个和原条件后验分布在KL散度(Kullback-Leibler divergence)的意义上最近似的分布,最后用这一分布来估计原分布。用数学语言表达如下:

但是由于KL散度的定义中含有不可得的可观察变量的边际分布,因此考虑这个最小化问题的对偶问题,即最大化evidence lower bound (ELBO)。由于p(x)关于q(z)是一个常数,因此ELBO是可以计算的。

更具体地说,文中采用的是平均场变分推断(mean-field variational inference),即假设TTFM中不同餐馆的潜变量之间相互独立,并使用高斯变分因子(Gaussian variational factor)控制这些潜变量(注意到先验分布假设的就是高斯分布的形式)。因此,在做最优化时,需要选取这些高斯分布的均值和方差来最大化ELBO。最优化采用的具体方法是梯度随机最优化(gradient-based stochastic optimization),优化细节此处不再赘述,感兴趣的可以参考Bottou, Curtis and Nocedal(2016)。

获得了潜变量的(估计的)后验分布之后,就可以对TTFM的系数进行估计,并利用软盒模型的结论计算消费者u去餐馆i用餐的概率大小。

文章还用TTFM和多项logit模型(MNL)的预测结果做了对比。

相比于TTFM模型,MNL更为简单:截距项λi对所有餐馆为相同的常数,αi直接设定为餐馆的可以观察的属性, θu对所有消费者为常数,距离敏感度对所有消费者和餐馆为常数,以β表示,忽略时间效应。读者将在后续章节中看到,TTFM的预测准确度远超MNL。这是因为TTFM中含有更多消费者和餐馆的异质性信息。

数据

原始数据来自一家名叫SafeGraph的公司,这家公司收集同意分享定位的手机用户的匿名位置信息。样本集由一大串来自于消费者手机的脉冲信号组成,每个观测点包括脉冲发射的日期、时间、经纬度和精度,还包括一个设备识别器,可以将脉冲和发出它的手机以及背后的消费者对应起来。因此样本中蕴含了大量消费者在某个时刻所在的位置信息。取样时间为2017年一月至十月,采样地点包括从旧金山南到圣何塞南的走廊地带中的41座城市。

有趣的问题是如何通过这些脉冲数据确定消费者上午所在的位置和中午用餐的餐馆。作者将前者定义为消费者在工作日上午9:00至11:15最常出现的位置,即同一台设备发出的脉冲出现次数最多的位置;后者的确定则比较复杂:在上午11:30至下午1:30之间,如果发现同一台设备在某个可以确定为餐馆的位置发出了至少两次间隔三分钟以上的脉冲,则可以确定该消费者在该餐馆用午餐。餐馆的位置通过类似于国内“大众点评”的Yelp网(

最后,为了确保用于计算的消费者和餐馆有足够的样本量(消费者去过足够数量的餐馆用餐,餐馆接待了足够数量的消费者),作者对原始数据集进行了一系列筛选,最后得到的数据集包含9,188位消费者在4,924家餐馆的106,889次用餐。具体的筛选标准和过程此处不再赘述,有兴趣的读者可以参见原文附录A2。经过筛选最终得到的用于计算的数据集汇总见下表。

模型拟合度

利用机器学习的思路,作者将数据分为Training,Validation以及Testing三部分,分别占据70.6%、5.0%、以及24.4%的权重。Training部分用于习得模型;validation数据用于调整模型中的参数(例如前文中提及的k1、k2,即潜变量向量的长度,或者说潜变量向量包含具体潜变量的个数);testing data用于模型的比较和选择。经过这一套流程,文章最终选定的k1、k2分比为80、16。

作者意在建立模型以尽可能模拟出消费者的选择行为,进而对消费者行为进行预测,从而解答“餐厅老板们的苦恼”。测试数据表明,TTFM模型的预测能力优于其简化版本,即前文提及的标准的多项选择模型MNL。如下表所示,precision@5 表示测试数据中,一个消费者实际选择的餐厅落入模型预测的最可能被选择的前五名餐厅里的次数占该消费者选择总次数的比例(与Test error rate的概念类似),TFM和MNL的这一比例分别是35.5%和11%。

如下图所示,根据消费者出现频率的十分位数进行分组,作者发现,在测试数据中,对于高频出现的消费者和餐厅(这些组别的数据量以及所提供的信息更加丰富),TTFM的预测结果相对于低频组有了显著改善;而MNL模型则没有显著提升。

相对于MNL模型,TTFM的模型设定中容纳了更多的异质性,这使得TTFM模型得以从大数据里习得消费者的个人偏好,因而可以做出更准确的预测。

下图进一步展示出了TTFM模型在显示个性化偏好方面的优越性。图2中,横轴表示消费者与餐厅的距离,而纵轴则表示消费者在该餐厅就餐的概率。此时,TTFM和MNL模型对实际情况的拟合都很优秀。但在图3中,作者将餐厅以被消费者光顾的频率分组,由此来近似消费者所面临的“不同的餐厅”,作为横轴;纵轴则表示消费者对“不同餐厅“的光顾频率。此时,TTFM模型对实际情况的拟合明显优于MNL模型,也就是说,TTFM比MNL模型能更好地捕捉到消费者的特定选择。

估计结果

下表展示了TTFM模型中,消费者对餐厅距离敏感度的估计参数弹性的分布。该弹性在所有消费者和餐厅中的平均值为-1.41,这意味着,距离确实显著影响了消费者对餐厅的选择。这也与上文描述性统计中,60%消费者的午餐场所选择都在其所在位置的两英里范围以内这一事实相吻合。

但这种弹性在消费者间的异质性也很突出。TTFM模型估计弹性的整体标准差达到了0.68,以消费者信息划分、餐厅信息划分的平均组间标准差则分别达到0.30、0.60,与MNL模型均低于0.01的量级形成明显对比。弹性分布图则更直观地展示了这一结论。

这一结论也与我们的简单直觉相吻合。想象你在二教上课,中午12点烈日当空,浑身发软饥肠辘辘,尽管勺园有你心爱的沙茶牛肉面,但一步之遥的农园总是看起来更”性感”一些;但对于写下这段话的我来说,勺园的荒凉遥远不值一提,跋山涉水只为沙茶。

作者进一步展示了距离敏感度弹性在不同餐厅类型和不同城市之间的分布。以价格范围对餐厅进行划分,文章发现,对于消费水平在10美元以下(price range:1)表示的餐厅,距离敏感度弹性为-1.45;对于消费水平在11美元到30美元之间的餐厅(price range:2),距离敏感度弹性为-1.37。这意味着,当我们想“吃顿好的”时,多走几步路也是可接受的。

分餐厅类型来看,方便快捷、口味大众化的墨西哥餐厅、pizza餐厅的弹性均为-1.50,三明治、热狗餐厅的弹性为-1.43、-1.40;而相对更小众的中餐、日料则分别为-1.35、-1.2,引诱人们为食物而奔走。

分城市来看,拥有更多集中商业区(工作场所紧邻零售卖场和商店)的城市如San Jos ́e、Sunnyvale、Mountain View(三者是硅谷的主要组成部分)的居民,比生活场景更分散的城市居民(如Daly City, Burlingame, San Bruno)对距离更敏感:消费者的收入、职业、时间价值和所处状态(比如正疲于工作或是赋闲在家)会影响其对于就餐具距离的敏感度。

3

预测

餐馆的营业和停业对于市场份额的影响

Athey 利用TTFM模型预测了餐馆停业和营业两个状态下,市场份额的变化,并将TTFM模型的预测结果和实际情况进行了比对。着眼于221次开业和190次停业状态,作者并对其状态变化前后的500次顾客光顾进行了分析。

分析市场份额再分配的一个问题是,对于任何营业或停业的目标餐厅,由于邻近餐馆的开放状态发生变化,预计竞争餐厅的市场份额会有一些基线水平的变化。

作者在初始测试中通过以下方式解决了这个问题,保持了竞争环境。对于每个改变状态的目标餐厅,文章首先构建“营业”和“停业”两个状态之间的每个其他餐厅的市场份额的预测差异(无论哪个先发生),然后减去目标餐厅在两个时段都停业时发生的份额变化。最后,他们将不同组中餐馆的变化相加,这些组由这些餐厅与目标餐厅的距离决定。结论如表5所示:50%的市场份额的影响局限在目标餐厅的2英里范围之内。

和实际数据的比对显示,TTFM的拟合结果很高。

餐馆类型的最佳选择

文章还分析了针对某特定地点的餐厅类型的最佳选择,利用的是停业或营业的餐馆在它们状态改变前后的需求变化。

为了更好地模拟餐厅状态改变的情况,作者们构建了一个反事实(counterfactual)来完成需求上的比较:首先,对于每个目标餐馆,他们选取了一组200个替代餐厅,其中100个来自与目标餐厅相同的类别,100个来自不同类别。然后,将目标餐厅的估计市场份额与该组替代品的平均需求进行比较。

在表6中,可以看到开设餐厅和关闭餐厅在平均上预测需求都高于任何一组替代品。作为进一步的比较,本文根据是否与开设或关闭的餐厅属于同一类别,将这组替代品分成几组。发现与目标相同类别的替代餐馆平均表现优于不同类别的替代餐馆。

具体的计算方法如下:

如果餐厅i’ 位于目前由餐厅i占据的位置,预计会有多少次访问。 这里有一个核心假设:i’ 的所有特征,无论是观察到的还是潜在的都保持不变,除了在计算i'的每个消费者的效用时,会使用i的位置。

对每个开设或停业的餐馆重复此计算。Isame是从与i相同的类别随机选择的100家餐馆,而Idiff是从与i不在同一类别的餐馆中随机选择的100家餐馆。 在表6中,作者比较了打开或关闭地点的预测需求,Demandi; i,以及Isame和Idiff中i'的平均反事实预测,即:

理想的地点和理想的餐厅类型

作者考虑了餐厅特征和位置之间的匹配。在每个网格中,作者随机选择一个餐厅位置,并使用TTFM模型来预测如果在其位置放置不同的餐厅,总需求量将是多少。随后选择这套替代餐馆,包括样本中每个主要类别的一家餐厅。

在下图中,作者检查了哪些地点被预测为每个餐馆类别提供午餐市场的最大需求。例如,我们可以看到越南餐馆预计在地图东南部的密集区域中需求最高。对菲律宾餐厅的需求相对较为分散,而对三明治的需求则以需求相对较小但密集为特征。

在图A10中,文章根据价格范围和菜肴类型将餐馆类别分组为粗略组,并在每个组内检查哪个类别在每个位置的总需求最高。作者发现了相当大的空间异质性,其中餐厅类别预计在每个位置表现最佳。

4

结论与意义

在数据利用方面,作者在本文里使用了新颖的移动位置数据。在实证层面,前文所述的TTFM模型允许消费者在餐厅特征和移动时间的偏好上存在异质性,且该偏好又随餐厅而变,进而使得模型得以容纳大量信息。这使得该模型相较于传统的多项选择模型优越性明显。在使用难易度上,通过结合贝叶斯模型和变分推断的最新进展,TTFM模型的估计也比较容易处理。在应用上,该模型可以对餐厅开业和停业所造成的市场份额的影响进行反事实分析,并评估餐厅特征的选择如何影响市场份额。

本文是结构模型和大数据时代海量信息结合的典例。在未来,越发丰富的数据和更能容纳、攫取数据信息又不失一般性的模型将更好地对微观主体行为和我们极富异质性的现实生活进行模拟,从而有助于解决企业在产品和战略选择上的诸多不确定性。

参考资料:

Athey, Susan, David M. Blei, Robert Donnelly, Francisco Ruiz and Tobias Schmidt. 2018. “Estimating Heterogeneous Consumer Preferences for Restaurants and Travel Time Using Mobile Location Data.” Unpublished. Papers 1801.07826, arX.(点击“阅读原文”以获取原文索引及链接)

Blei, David M., Alp Kucukelbir, and Jon D. McAuli_e. 2017. Variational Inference: A Review for Statisticians." Journal of the American Statistical Association, 112(518): 859-877.

Wolfram MathWorld, “Gumbel Distribution” item返回搜狐,查看更多

责任编辑:

声明:该文观点仅代表作者本人,搜狐号系信息发布平台,搜狐仅提供信息存储空间服务。 圣何塞小街 ttfm k1 dui k2
免责声明:本网站部 分文章和信息来源于互联网,本网转载出于传递更多信息和学习之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请立即联系管理 员,我们会予以更改或删除相关文章,保证您的权利。对使用本网站信息和服务所引起的后果,本网站不作任何承诺。
Copyright 版权所有 Copyright 2013-2014 福建省云创集成科技服务有限公司
All Rights Reserved. 运营维护:三明市明网网络信息技术有限公司 业务咨询:0598-8233595 0598-5831286 技术咨询:0598-8915168