基于公平的博弈学习模型及其实验研究

第28卷第5期(总第197期)      系 统 工 程2010年5月            SystemsEngineering文章编号:1001-4098(2010)05-0048-06

Vol.28,No.5May,2010

基于公平的博弈学习模型及其实验研究

饶育蕾1,何清泉1,2

(1.中南大学商学院,湖南长沙 410083;2.湖南农业大学理学院,湖南长沙 410128)

摘 要:在“经验权重魅力值学习模型”(EWA)中引入公平因素而构建公平博弈学习模型,模型用公平思考引起的心理效用来代替策略物质效应,以此来修正决策参与者的策略收益,改变策略魅力值,进而研究动态博弈过程中博弈均衡的移动;通过对公平博弈学习模型和EWA学习模型的最后通牒博弈决策模拟比较,结果发现公平博弈学习模型能更快地收敛于均衡策略;我们继而设计并进行了冰淇淋蛋糕分配实验,实验证明了参与者在实验过程中存在公平思考及学习等行为;最后用实验数据检验公平博弈学习模型与EWA学习模型,结果显示:两个模型都可以收敛于均衡策略,但公平博弈学习模型具有更快的收敛速度和对参与者决策行为更好的预测能力,实验结果表明人类的公平思考行为影响着决策行为。关键词:实验经济学;公平;博弈;学习模型中图分类号:F224   文献标识码:A

1 引言

传统的经济理论和经济模型是建立在理性人假设基础上的,根据这一假设,经济活动参与者只注重自身的利益,但许多著名的经济学家如Simon、Arrow等认为:现实中人们不是完全理性,而是有限理性的[1-2]。有限理性的提出引起不同领域(企业组织理论、金融理论、决策理论等)学者的关注,其中主要是对理性假设的批评,如:一些实验经济学家证实了在许多不同的博弈实验中,博弈参与者表现出与标准博弈理论预测相违背的利他、策略学习、公平思考等行为[3-5],因此解释这些现象成为当时实验经济学和其他相关经济理论的主要焦点,公平理论和学习模型就是解释这些异常行为的主要理论方法。

学习模型放松了经济人完全理性的假设,但将效用等同于货币收益,主要包含三种:信念学习[6-8]、加强型学习[9-10]、EWA学习[11-13]。Crawford[7]认为参与者通过对自己或其他博弈者过去博弈行动的观察,来形成其他博弈者会如何行动的信念,并根据这个信念来选择自己的策略以最大化自己的收益。一些参与者则会受自己或他人过去策略的影响,在未来博弈行动中加强采用成功的策略,减少失败策略的采用,此种行为称为加强型学习。

Camerer和Ho将信念学习和加强型学习融合在一起形成“EWA学习模型”(Experience-weightedattractionlearningmodel)[11]。

Rabin(1993)认为博弈参与者的效用不仅依赖于其货币收益,也依赖于参与者的心理效用,当感觉他人对自己怀有善意时,就用善意回报他人;如果觉得他人对自己不友好,则会采取报复行为,即使为这种报复行为付出代价也在所不惜[14]。为此,Rabin构建公平博弈模型来表示,并用“友好函数”表示其他参与者的善意程度。在该模型中,当物质利益比较小,而心理收益相对重要时则可能出现多重均衡,若同时存在一个“善意”均衡和一个“恶意”均衡,模型无法预测到底会出现哪一种均衡。

博弈过程中参与者不仅表现出学习行为,也存在公平思考,由于学习模型没有考虑参与者的公平思考,该模型推断的参与者学习过程比较慢,不能使决策很快地达到均衡。本文试图将公平因素引入到学习模型中,形成公平博弈学习模型,以加强对均衡结果预测的准确性,改进学习模型中的参与者学习较慢,学习效果不好等问题。

2 公平博弈学习模型的构建

在EWA学习模型中,每个策略都被赋予一个“魅力

收稿日期:2010-02-12;修订日期:2010-03-28

基金项目:教育部人文社会科学研究后期资助重点项目(06JHQZ0010);国家自然科学基金资助项目(70872111);湖南省教育厅基金资助项目(08c398)

(,,,:,,),,,

基于公平的博弈学习模型及其实验研究相关文档

最新文档

返回顶部