数学博弈论经典故事

时间：2022-03-21 05:02:34 阅读：最新文章文档下载

说明：文章内容仅供预览，部分内容可能不全。下载后的文档，内容与下面显示的完全一致。下载之前请确认下面内容是否您想要的，是否完整无缺。

数学博弈论经典故事

经典的囚徒困境

1950年，由就职于兰德公司的梅里尔·弗拉德(MerrillFlood)和梅尔文·德雷希尔(MelvinDresher)拟定出相关困境的理论，后来由顾问阿尔伯特·塔克(AlbertTucker)以囚徒方式阐述，并命名为“囚徒困境”。经典的囚徒困境如下：警方逮捕甲、乙两名嫌疑犯，但没有足够证据指控二人入罪。于是警方分开囚禁嫌疑犯，分别和二人见面，并向双方提供以下相同的选择：

若一人认罪并作证检举对方(相关术语称“背叛”对方)，而对方保持沉默，此人将即时获释，沉默者将判监10年。若二人都保持沉默(相关术语称互相“合作”)，则二人同样判监半年。若二人都互相检举(互相“背叛”)，则二人同样判监2年。

用表格概述如下：甲沉默(合作) 乙沉默(合作)

二人同服刑半年甲认罪(背叛)甲即时获释;乙服刑10年乙认罪(背叛)甲服刑10年;乙即时获释二人同服刑2年

如同博弈论的其他例证，囚徒困境假定每个参与者(即“囚徒”)都是利己的，即都寻求最大自身利益，而不关心另一参与者的利益。参与者某一策略所得利益，如果在任何情况下都比其他策略要低的话，此策略称为“严格劣势”，理性的参与者绝不会选择。另外，没有任何其他力量干预个人决策，参与者可完全按照自己意愿选择策略。

囚徒到底应该选择哪一项策略，才能将自己个人的刑期缩至最短?两名囚徒

由于隔绝监禁，并不知道对方选择;而即使他们能交谈，还是未必能够尽信对方不会反口。就个人的理性选择而言，检举背叛对方所得刑期，总比沉默要来得低。试设想困境中两名理性囚徒会如何作出选择：

若对方沉默、背叛会让我获释，所以会选择背叛。若对方背叛指控我，我也要指控对方才能得到较低的刑期，所以也是会选择背叛。

二人面对的情况一样，所以二人的理性思考都会得出相同的结论——选择背叛。背叛是两种策略之中的支配性策略。因此，这场博弈中唯一可能达到的纳什均衡，就是双方参与者都背叛对方，结果二人同样服刑2年。

这场博弈的纳什均衡，显然不是顾及团体利益的帕累托最优解决方案。以全体利益而言，如果两个参与者都合作保持沉默，两人都只会被判刑半年，总体利益更高，结果也比两人背叛对方、判刑2年的情况较佳。但根据以上假设，二人均为理性的个人，且只追求自己个人利益。均衡状况会是两个囚徒都选择背叛，结果二人判决均比合作为高，总体利益较合作为低。这就是“困境”所在。例子漂亮地证明了：非零和博弈中，帕累托最优和纳什均衡是相冲突的。由囚徒困境可以写出类似的员工困境：

一名经理，数名员工;前提，经理比较苛刻;

如果所有员工都听从经理吩咐，则奖金等待遇一样，不过所有人都超负荷工作，如果某人不听从吩咐，其他人听从吩咐，则此人下岗。其他人继续工作，如果所有人都不听从经理吩咐，则经理下岗，但是，由于员工之间信息是不透明的，而且，都担心别人听话自己不听话而下岗，所以，大家只能继续繁重的工作。

囚徒困境是博弈论的非零和博弈中具代表性的例子，反映个人最佳选择并非

团体最佳选择。虽然困境本身只属模型性质，但现实中的价格竞争、环境保护等方面，也会频繁出现类似情况。单次发生的囚徒困境，和多次重复的囚徒困境结果不会一样。

在重复的囚徒困境中，博弈被反复地进行。因而每个参与者都有机会去“惩罚”另一个参与者前一回合的不合作行为。这时，合作可能会作为均衡的结果出现。欺骗的动机这时可能被受到惩罚的威胁所克服，从而可能导向一个较好的、合作的结果。作为反复接近无限的数量，纳什均衡趋向于帕累托最优。

本文来源：https://www.wddqw.com/doc/e2b2713c2c60ddccda38376baf1ffc4fff47e253.html

相关文章：

正在阅读：

数学博弈论经典故事01-01

我与明天的自己有个约定作文850字01-01

浮生六记(全译典藏版)读后感1500字01-01

梵高给我的启示01-01

中班数学教案及教学反思《认识数字9》01-01

幼儿园小班社会教案活动《穿鞋子》含反思01-01

【在职证明样本】在职证明开具理由01-01

第五个太阳的故事01-01

那一缕春风的作文600字01-01