<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>WusLee</title><description>生活随笔与学习记录</description><link>https://wuslee-yz.top/</link><language>zh_CN</language><item><title>《青春猪头少年》圣地巡礼与再游镰仓</title><link>https://wuslee-yz.top/posts/%E6%B8%B8%E8%AE%B0/2026%E5%A4%8F%E5%AD%A3-%E4%B8%9C%E4%BA%AC%E5%8F%8A%E5%91%A8%E8%BE%B9/%E9%95%B0%E4%BB%93/%E9%9D%92%E6%98%A5%E7%8C%AA%E5%A4%B4%E5%B0%91%E5%B9%B4%E5%9C%A3%E5%9C%B0%E5%B7%A1%E7%A4%BC%E4%B8%8E%E5%86%8D%E6%B8%B8%E9%95%B0%E4%BB%93/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E6%B8%B8%E8%AE%B0/2026%E5%A4%8F%E5%AD%A3-%E4%B8%9C%E4%BA%AC%E5%8F%8A%E5%91%A8%E8%BE%B9/%E9%95%B0%E4%BB%93/%E9%9D%92%E6%98%A5%E7%8C%AA%E5%A4%B4%E5%B0%91%E5%B9%B4%E5%9C%A3%E5%9C%B0%E5%B7%A1%E7%A4%BC%E4%B8%8E%E5%86%8D%E6%B8%B8%E9%95%B0%E4%BB%93/</guid><description>重访镰仓与江之岛，沿着《青春猪头少年》中的场景完成一次圣地巡礼，也记录阴天镰仓的另一种风景。</description><pubDate>Thu, 20 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;blockquote&gt;
&lt;p&gt;写于2026.8.3晚，修改于8.18-20。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;高中的时候和朋友聊动漫，朋友极力推荐我看《青春猪头少年》系列，可惜那时候因为学业繁忙没有看，直到今年寒假才将动画化的所有部分从头到尾看了一遍。正好去年去过镰仓，看到咲太、麻衣、翔子他们走过我走过的路，去过我去过的景点的时候，忽然生出一种仿佛他们真的生活在现实中的感动&amp;lt;del&amp;gt;（唉唉二次元）&amp;lt;/del&amp;gt;，于是决定这次无论如何一定要重新去一趟镰仓。&lt;/p&gt;
&lt;p&gt;本来打算昨天前往，然而由于天气太热未能成行。晚上看天气预报说今天是阴天，很凉快，于是决定把本来去立川市巡礼《超时空辉夜姬》的计划放到以后，起了个大早前往镰仓。&lt;/p&gt;
&lt;p&gt;到了藤泽站，从小田急线下来，就顺着南口的指示牌一路走到江之电的闸口。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E6%B1%9F%E4%B9%8B%E7%94%B5%E8%97%A4%E6%B3%BD%E7%AB%99%E5%89%8D.jpg&quot; alt=&quot;江之电藤泽站前&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在一旁的售票机上买了江之电的一日乘车券。我个人感觉这张日票很值，因为后面我坐着江之电在很多站上上下下，如果用IC卡的话每次上下车都得花七八块人民币。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E6%B1%9F%E4%B9%8B%E7%94%B5%E4%B8%80%E6%97%A5%E4%B9%98%E8%BD%A6%E5%88%B8.jpg&quot; alt=&quot;江之电一日乘车券&quot; /&gt;&lt;/p&gt;
&lt;p&gt;电车里基本上都是当地的居民。坐了几站就到江之岛站，江之岛站前有两排铁鸟栖息在栏杆上，据说有位老奶奶一年四季都会给这些小鸟织不同的衣服。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E6%B1%9F%E4%B9%8B%E5%B2%9B%E7%AB%99%E5%89%8D%E5%B0%8F%E9%B8%9F.jpg&quot; alt=&quot;江之岛站前小鸟&quot; /&gt;&lt;/p&gt;
&lt;p&gt;大概因为时间比较早，去江之岛的人很少，路上只有三三两两的游客。走过长长的弁天桥，沿着参道一路往上，就到了江岛神社。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E8%B5%B0%E5%88%B0%E6%B1%9F%E5%B2%9B%E7%A5%9E%E7%A4%BE.jpg&quot; alt=&quot;走到江岛神社&quot; /&gt;&lt;/p&gt;
&lt;p&gt;沿着江岛神社的台阶稍微爬一段路，就能看到咲太和朋绘的著名分手现场。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E6%B1%9F%E4%B9%8B%E5%B2%9B%E8%A7%82%E6%99%AF%E5%8F%B0.jpg&quot; alt=&quot;江之岛观景台&quot; /&gt;&lt;/p&gt;
&lt;p&gt;再往上走的地方去年已经去过，而且也没有其他巡礼画面了&amp;lt;del&amp;gt;（其实是懒得爬）&amp;lt;/del&amp;gt;，于是回头到江之岛站坐江之电去七里滨。&lt;/p&gt;
&lt;p&gt;七里滨的画面很多，因为学校和海滩都在这里。站内和站前就有几个很熟悉的场景。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E4%B8%83%E9%87%8C%E6%BB%A8%E7%AB%99%E5%86%85%E5%92%8C%E7%AB%99%E5%89%8D.jpg&quot; alt=&quot;七里滨站内和站前&quot; /&gt;&lt;/p&gt;
&lt;p&gt;学校离七里滨站很近，走出车站再左转过个铁路道口就到了。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E4%B8%83%E9%87%8C%E6%BB%A8%E9%93%81%E8%B7%AF%E9%81%93%E5%8F%A3%E4%B8%8E%E9%AB%98%E6%A0%A1%E5%89%8D.jpg&quot; alt=&quot;七里滨铁路道口与高校前&quot; /&gt;&lt;/p&gt;
&lt;p&gt;看完学校，回头向海滨走，就能看到海滩。阴天把金黄色的沙滩褪成了灰色，但是灰蒙蒙的一片倒是别有一番风味。顺带一提，天气好的时候真的可以从海滩看到富士山，可惜今天能见度不是很高。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E4%B8%83%E9%87%8C%E6%BB%A8%E6%B5%B7%E5%B2%B8.jpg&quot; alt=&quot;七里滨海岸&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在海边吹了一会儿海风，然后启程前往去年没有去过的几个寺庙。路上走走停停，沿着铁路看看景色拍拍车，还买到了麻衣代言的同款桃汁气泡水&amp;lt;del&amp;gt;（虽然包装不一样）&amp;lt;/del&amp;gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E8%B7%AF%E4%B8%8A2.png&quot; alt=&quot;路上2&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E8%B7%AF%E4%B8%8A.jpg&quot; alt=&quot;路上&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E6%A1%83%E6%B1%81%E8%8B%8F%E6%89%93%E6%B0%B4.jpg&quot; alt=&quot;桃汁苏打水&quot; /&gt;&lt;/p&gt;
&lt;p&gt;这时候已经快中午了，路上的游客也渐渐多了起来。现在在路上很少见到大陆游客，但是欧美的游客比去年多了很多。&lt;/p&gt;
&lt;p&gt;先去了极乐寺，是一座小小的寺庙。进门之后，窄窄的石板路掩映在两侧树木之间，很有曲径通幽的感觉。接着乘江之电往前坐一站，来到高德院，这里有一尊大佛像。《石纪元》开头千空用它准确定位了自己的位置，所以我对它印象深刻。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E5%AF%BA%E5%BA%99.jpg&quot; alt=&quot;寺庙&quot; /&gt;&lt;/p&gt;
&lt;p&gt;离开高德院后，坐江之电到镰仓站，下车之后沿着参道慢慢走到镰仓最气派的鹤冈八幡宫。这里也是咲太和麻衣去新年参拜的场所，比前面的寺院大多了，香火旺盛，有很多游客。&lt;/p&gt;
&lt;p&gt;最后回到藤泽站，去JR北口补拍了一张照片。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/JR%E8%97%A4%E6%B3%BD%E7%AB%99%E5%8C%97%E5%8F%A3.jpg&quot; alt=&quot;JR藤泽站北口&quot; /&gt;&lt;/p&gt;
&lt;p&gt;正遗憾这次没看到多少《青春猪头少年》相关的东西，却在旁边的大楼上看到了10月要上映的系列最后一部剧场版《不会梦到亲爱好朋友》的海报。听说江之岛展望灯塔上有很多《青猪》相关的贴纸，但是这次没有去。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Asssets/%E7%94%B5%E5%BD%B1%E6%B5%B7%E6%8A%A5.jpg&quot; alt=&quot;电影海报&quot; /&gt;&lt;/p&gt;
&lt;p&gt;::music{src=&quot;/media/posts/kamakura/fukashigi-no-karte.mp3&quot; title=&quot;不可思議のカルテ&quot; artist=&quot;fox capture plan&quot; album=&quot;Discovery&quot; cover=&quot;/media/posts/kamakura/fukashigi-no-karte-cover.jpg&quot;}&lt;/p&gt;
&lt;p&gt;我很喜欢《青猪》的氛围。所谓“思春期症候群”，其实是那些难以言说的孤独、期待与不安，被夸张成了看得见的异常。作品里的人一边被它折磨，一边学着理解友情、爱情与亲情，也在理解别人的过程中重新认识自己。整部作品的感情基调就像片尾曲《不可思議のカルテ》：有悲伤，却并不消沉，结束之后仍会留下很长的余韵。&lt;/p&gt;
&lt;p&gt;作为动画党，想到这个系列将在十月完结，还是有些舍不得。青春大概就是这样一段时期：我们已经开始认真面对人际关系和这个世界，却还没有足够的阅历去妥善处理随之而来的麻烦。有人走进大学后逐渐告别它，也总会有同龄人继续为学业、压抑的环境和人与人之间的距离烦恼。希望他们最终都能找到自己的答案，走出属于自己的“青春期症候群”。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;后记｜2026.8.20&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;我非常喜欢镰仓的氛围，在这个海滨小城吹风看景很惬意。这个地方是很多动漫的取景地，但在圣地巡礼之外也非常值得过来逛逛。去年去镰仓是大晴天，今年则是阴天，但各有各的美。晴天的镰仓是热烈的，金黄的沙滩和湛蓝的天空把海夹在中间，夕阳西下时仿佛置身于色彩绚丽的动漫里。而阴天的镰仓是内敛的，白色的天空与海平面在远处相交，在镰仓高校前站，还能看到柏油马路上的车在这个背景前来回奔流。这是一种语言和照片都难以传达的美丽感受。
&lt;img src=&quot;Asssets/%E5%85%AC%E8%B7%AF%E4%B8%8E%E6%B5%B7%E4%B8%8E%E5%A4%A9%E7%A9%BA.png&quot; alt=&quot;公路与海与天空&quot; /&gt;&lt;/p&gt;
&lt;p&gt;回国之后，把《青猪》的小说也全看完了。真是一部好作品，我宣布鸭志田一是神。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>10 天「看中文立刻说德语」口语训练</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%AF%AD%E8%A8%80%E5%AD%A6%E4%B9%A0/deutsch/%E5%8F%A3%E8%AF%AD/10%E5%A4%A9_%E7%9C%8B%E4%B8%AD%E6%96%87%E7%AB%8B%E5%88%BB%E8%AF%B4%E5%BE%B7%E8%AF%AD_%E5%8F%A3%E8%AF%AD%E8%AE%AD%E7%BB%83/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%AF%AD%E8%A8%80%E5%AD%A6%E4%B9%A0/deutsch/%E5%8F%A3%E8%AF%AD/10%E5%A4%A9_%E7%9C%8B%E4%B8%AD%E6%96%87%E7%AB%8B%E5%88%BB%E8%AF%B4%E5%BE%B7%E8%AF%AD_%E5%8F%A3%E8%AF%AD%E8%AE%AD%E7%BB%83/</guid><pubDate>Sun, 16 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;10 天「看中文立刻说德语」口语训练&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;适合：A2 左右，能看懂一些德语，但开口时容易忘词、忘介词、句子组织慢。&lt;/p&gt;
&lt;p&gt;目标：看到中文后，在 &lt;strong&gt;3–5 秒内&lt;/strong&gt; 尽量直接说出德语，不先写、不逐字翻译。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;使用方法&lt;/h2&gt;
&lt;p&gt;每天建议用 20–30 分钟。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;第一轮：直接说&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;只看中文。&lt;/li&gt;
&lt;li&gt;每句给自己 3–5 秒。&lt;/li&gt;
&lt;li&gt;会说就立刻说；不会说也先尝试绕着表达。&lt;/li&gt;
&lt;li&gt;不要一看到不会就马上看答案。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;第二轮：核对答案&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;看参考答案。&lt;/li&gt;
&lt;li&gt;标记自己卡住的词、介词和句型。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;第三轮：重新说&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;关掉答案。&lt;/li&gt;
&lt;li&gt;把当天 20 句重新说一遍。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;第二天复习&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;新内容开始前，快速重说前一天最卡的 5–10 句。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;参考答案不是唯一正确答案。只要你的德语自然、语法基本正确、意思一致，就算成功。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 1 — 最基本的日常表达&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我今天很累。&lt;/li&gt;
&lt;li&gt;我现在有一点饿。&lt;/li&gt;
&lt;li&gt;我今天没有课。&lt;/li&gt;
&lt;li&gt;我八点起床。&lt;/li&gt;
&lt;li&gt;我早上喝了一杯咖啡。&lt;/li&gt;
&lt;li&gt;我中午在学校吃饭。&lt;/li&gt;
&lt;li&gt;我下午学习德语。&lt;/li&gt;
&lt;li&gt;我晚上想看一部电影。&lt;/li&gt;
&lt;li&gt;我周末通常待在家里。&lt;/li&gt;
&lt;li&gt;我喜欢听音乐。&lt;/li&gt;
&lt;li&gt;我不喜欢早起。&lt;/li&gt;
&lt;li&gt;我现在没有时间。&lt;/li&gt;
&lt;li&gt;我今天有很多事情要做。&lt;/li&gt;
&lt;li&gt;我觉得这个很有意思。&lt;/li&gt;
&lt;li&gt;我觉得这个有一点难。&lt;/li&gt;
&lt;li&gt;我想买一杯咖啡。&lt;/li&gt;
&lt;li&gt;我想回家。&lt;/li&gt;
&lt;li&gt;我明天要去学校。&lt;/li&gt;
&lt;li&gt;我昨天学习了两个小时德语。&lt;/li&gt;
&lt;li&gt;因为我很累，所以我想早点睡觉。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich bin heute sehr müde.&lt;/li&gt;
&lt;li&gt;Ich habe jetzt ein bisschen Hunger.&lt;/li&gt;
&lt;li&gt;Ich habe heute keinen Unterricht.&lt;/li&gt;
&lt;li&gt;Ich stehe um acht Uhr auf.&lt;/li&gt;
&lt;li&gt;Ich habe morgens eine Tasse Kaffee getrunken.&lt;/li&gt;
&lt;li&gt;Ich esse mittags in der Schule.&lt;/li&gt;
&lt;li&gt;Ich lerne am Nachmittag Deutsch.&lt;/li&gt;
&lt;li&gt;Ich möchte am Abend einen Film sehen.&lt;/li&gt;
&lt;li&gt;Am Wochenende bleibe ich normalerweise zu Hause.&lt;/li&gt;
&lt;li&gt;Ich höre gern Musik.&lt;/li&gt;
&lt;li&gt;Ich stehe nicht gern früh auf.&lt;/li&gt;
&lt;li&gt;Ich habe jetzt keine Zeit.&lt;/li&gt;
&lt;li&gt;Ich habe heute viel zu tun.&lt;/li&gt;
&lt;li&gt;Ich finde das sehr interessant.&lt;/li&gt;
&lt;li&gt;Ich finde das ein bisschen schwierig.&lt;/li&gt;
&lt;li&gt;Ich möchte einen Kaffee kaufen.&lt;/li&gt;
&lt;li&gt;Ich möchte nach Hause gehen.&lt;/li&gt;
&lt;li&gt;Ich muss morgen zur Schule gehen.&lt;/li&gt;
&lt;li&gt;Ich habe gestern zwei Stunden Deutsch gelernt.&lt;/li&gt;
&lt;li&gt;Weil ich sehr müde bin, möchte ich früh schlafen gehen.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;um + Uhrzeit&lt;/code&gt;：um acht Uhr&lt;/li&gt;
&lt;li&gt;&lt;code&gt;am Morgen / am Nachmittag / am Abend&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;zu Hause&lt;/code&gt; = 在家&lt;/li&gt;
&lt;li&gt;&lt;code&gt;nach Hause&lt;/code&gt; = 回家&lt;/li&gt;
&lt;li&gt;&lt;code&gt;gern + Verb&lt;/code&gt;：Ich höre gern Musik.&lt;/li&gt;
&lt;li&gt;&lt;code&gt;weil ... Verb am Ende&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 2 — 时间、地点和移动&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我住在东京。&lt;/li&gt;
&lt;li&gt;我现在在学校。&lt;/li&gt;
&lt;li&gt;我的书在桌子上。&lt;/li&gt;
&lt;li&gt;我把书放到桌子上。&lt;/li&gt;
&lt;li&gt;我每天坐电车去学校。&lt;/li&gt;
&lt;li&gt;我今天坐公交车回家。&lt;/li&gt;
&lt;li&gt;我周一有德语课。&lt;/li&gt;
&lt;li&gt;我八月去德国。&lt;/li&gt;
&lt;li&gt;我周末想去大阪。&lt;/li&gt;
&lt;li&gt;我明天和朋友去餐厅。&lt;/li&gt;
&lt;li&gt;我从中国来。&lt;/li&gt;
&lt;li&gt;我从学校回家。&lt;/li&gt;
&lt;li&gt;我现在在车站等电车。&lt;/li&gt;
&lt;li&gt;我九点到学校。&lt;/li&gt;
&lt;li&gt;我下午三点离开学校。&lt;/li&gt;
&lt;li&gt;我在超市买了一些东西。&lt;/li&gt;
&lt;li&gt;我去超市买牛奶。&lt;/li&gt;
&lt;li&gt;我今晚待在家里。&lt;/li&gt;
&lt;li&gt;我昨天在图书馆学习。&lt;/li&gt;
&lt;li&gt;下课以后，我和朋友一起吃饭。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich wohne in Tokio.&lt;/li&gt;
&lt;li&gt;Ich bin jetzt in der Schule.&lt;/li&gt;
&lt;li&gt;Mein Buch liegt auf dem Tisch.&lt;/li&gt;
&lt;li&gt;Ich lege das Buch auf den Tisch.&lt;/li&gt;
&lt;li&gt;Ich fahre jeden Tag mit dem Zug zur Schule.&lt;/li&gt;
&lt;li&gt;Ich fahre heute mit dem Bus nach Hause.&lt;/li&gt;
&lt;li&gt;Ich habe am Montag Deutschunterricht.&lt;/li&gt;
&lt;li&gt;Ich fahre im August nach Deutschland.&lt;/li&gt;
&lt;li&gt;Ich möchte am Wochenende nach Osaka fahren.&lt;/li&gt;
&lt;li&gt;Ich gehe morgen mit einem Freund / einer Freundin ins Restaurant.&lt;/li&gt;
&lt;li&gt;Ich komme aus China.&lt;/li&gt;
&lt;li&gt;Ich komme von der Schule nach Hause.&lt;/li&gt;
&lt;li&gt;Ich warte jetzt am Bahnhof auf den Zug.&lt;/li&gt;
&lt;li&gt;Ich komme um neun Uhr in der Schule an.&lt;/li&gt;
&lt;li&gt;Ich verlasse die Schule um drei Uhr nachmittags.&lt;/li&gt;
&lt;li&gt;Ich habe im Supermarkt ein paar Sachen gekauft.&lt;/li&gt;
&lt;li&gt;Ich gehe in den Supermarkt, um Milch zu kaufen.&lt;/li&gt;
&lt;li&gt;Ich bleibe heute Abend zu Hause.&lt;/li&gt;
&lt;li&gt;Ich habe gestern in der Bibliothek gelernt.&lt;/li&gt;
&lt;li&gt;Nach dem Unterricht esse ich mit meinen Freunden.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;in + Dativ&lt;/code&gt;：in der Schule&lt;/li&gt;
&lt;li&gt;&lt;code&gt;in + Akkusativ&lt;/code&gt;：in die Schule / ins Restaurant&lt;/li&gt;
&lt;li&gt;&lt;code&gt;auf dem Tisch&lt;/code&gt; vs. &lt;code&gt;auf den Tisch&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;mit + Dativ&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;aus + Dativ&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;nach + 城市/国家&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;warten auf + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 3 — 喜好、想法和原因&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我喜欢坐火车旅行。&lt;/li&gt;
&lt;li&gt;我对德国很感兴趣。&lt;/li&gt;
&lt;li&gt;我对历史也感兴趣。&lt;/li&gt;
&lt;li&gt;我觉得学习德语很重要。&lt;/li&gt;
&lt;li&gt;我认为德语很难，但是很有意思。&lt;/li&gt;
&lt;li&gt;我喜欢这个城市，因为这里很方便。&lt;/li&gt;
&lt;li&gt;我不喜欢这里，因为人太多了。&lt;/li&gt;
&lt;li&gt;我学习德语，因为我以后想去德国。&lt;/li&gt;
&lt;li&gt;我喜欢旅行，因为我可以看到新的东西。&lt;/li&gt;
&lt;li&gt;我觉得坐火车比坐飞机舒服。&lt;/li&gt;
&lt;li&gt;我更喜欢咖啡，不太喜欢茶。&lt;/li&gt;
&lt;li&gt;我最喜欢的季节是秋天。&lt;/li&gt;
&lt;li&gt;我觉得冬天太冷了。&lt;/li&gt;
&lt;li&gt;我觉得夏天晚上散步很好。&lt;/li&gt;
&lt;li&gt;我对这个话题不太了解。&lt;/li&gt;
&lt;li&gt;我不知道这个词是什么意思。&lt;/li&gt;
&lt;li&gt;我忘了这个词。&lt;/li&gt;
&lt;li&gt;我想不起这个词了。&lt;/li&gt;
&lt;li&gt;我觉得这个问题不容易回答。&lt;/li&gt;
&lt;li&gt;但是我想试着解释一下。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich reise gern mit dem Zug.&lt;/li&gt;
&lt;li&gt;Ich interessiere mich für Deutschland.&lt;/li&gt;
&lt;li&gt;Ich interessiere mich auch für Geschichte.&lt;/li&gt;
&lt;li&gt;Ich finde es wichtig, Deutsch zu lernen.&lt;/li&gt;
&lt;li&gt;Ich finde Deutsch schwierig, aber sehr interessant.&lt;/li&gt;
&lt;li&gt;Ich mag diese Stadt, weil es hier sehr praktisch ist.&lt;/li&gt;
&lt;li&gt;Ich mag es hier nicht, weil es zu viele Menschen gibt.&lt;/li&gt;
&lt;li&gt;Ich lerne Deutsch, weil ich später nach Deutschland gehen möchte.&lt;/li&gt;
&lt;li&gt;Ich reise gern, weil ich neue Dinge sehen kann.&lt;/li&gt;
&lt;li&gt;Ich finde Zugfahren angenehmer als Fliegen.&lt;/li&gt;
&lt;li&gt;Ich trinke lieber Kaffee als Tee.&lt;/li&gt;
&lt;li&gt;Meine Lieblingsjahreszeit ist der Herbst.&lt;/li&gt;
&lt;li&gt;Ich finde den Winter zu kalt.&lt;/li&gt;
&lt;li&gt;Ich finde es schön, im Sommer abends spazieren zu gehen.&lt;/li&gt;
&lt;li&gt;Ich kenne mich mit diesem Thema nicht so gut aus.&lt;/li&gt;
&lt;li&gt;Ich weiß nicht, was dieses Wort bedeutet.&lt;/li&gt;
&lt;li&gt;Ich habe dieses Wort vergessen.&lt;/li&gt;
&lt;li&gt;Mir fällt dieses Wort gerade nicht ein.&lt;/li&gt;
&lt;li&gt;Ich finde diese Frage nicht leicht zu beantworten.&lt;/li&gt;
&lt;li&gt;Aber ich möchte versuchen, es zu erklären.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;sich interessieren für + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;lieber ... als ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Ich finde es + Adjektiv, ... zu ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;忘词时可用：&lt;code&gt;Mir fällt das Wort gerade nicht ein.&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 4 — 学校和学习&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我是一名大学生。&lt;/li&gt;
&lt;li&gt;我在大学学习计算机科学。&lt;/li&gt;
&lt;li&gt;我今天上午有两节课。&lt;/li&gt;
&lt;li&gt;第一节课九点开始。&lt;/li&gt;
&lt;li&gt;这节课十二点结束。&lt;/li&gt;
&lt;li&gt;我觉得这门课很难。&lt;/li&gt;
&lt;li&gt;老师讲得有一点快。&lt;/li&gt;
&lt;li&gt;有时候我听不懂老师说什么。&lt;/li&gt;
&lt;li&gt;所以我下课以后会再复习一次。&lt;/li&gt;
&lt;li&gt;我每天学习大约三个小时。&lt;/li&gt;
&lt;li&gt;我常常在图书馆学习。&lt;/li&gt;
&lt;li&gt;学习的时候我喜欢听音乐。&lt;/li&gt;
&lt;li&gt;但是有时候音乐会让我分心。&lt;/li&gt;
&lt;li&gt;我需要为考试复习。&lt;/li&gt;
&lt;li&gt;下周我要参加一个考试。&lt;/li&gt;
&lt;li&gt;我还没有准备好。&lt;/li&gt;
&lt;li&gt;我必须多做一些练习。&lt;/li&gt;
&lt;li&gt;我有一个问题想问老师。&lt;/li&gt;
&lt;li&gt;我想知道这个答案为什么是错的。&lt;/li&gt;
&lt;li&gt;如果我不明白，我会问同学。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich bin Student / Studentin.&lt;/li&gt;
&lt;li&gt;Ich studiere Informatik an der Universität.&lt;/li&gt;
&lt;li&gt;Ich habe heute Vormittag zwei Kurse.&lt;/li&gt;
&lt;li&gt;Der erste Kurs beginnt um neun Uhr.&lt;/li&gt;
&lt;li&gt;Der Kurs endet um zwölf Uhr.&lt;/li&gt;
&lt;li&gt;Ich finde diesen Kurs ziemlich schwierig.&lt;/li&gt;
&lt;li&gt;Der Lehrer / Die Lehrerin spricht ein bisschen schnell.&lt;/li&gt;
&lt;li&gt;Manchmal verstehe ich nicht, was der Lehrer sagt.&lt;/li&gt;
&lt;li&gt;Deshalb wiederhole ich den Stoff nach dem Unterricht noch einmal.&lt;/li&gt;
&lt;li&gt;Ich lerne jeden Tag ungefähr drei Stunden.&lt;/li&gt;
&lt;li&gt;Ich lerne oft in der Bibliothek.&lt;/li&gt;
&lt;li&gt;Beim Lernen höre ich gern Musik.&lt;/li&gt;
&lt;li&gt;Aber manchmal lenkt mich die Musik ab.&lt;/li&gt;
&lt;li&gt;Ich muss für die Prüfung lernen.&lt;/li&gt;
&lt;li&gt;Nächste Woche schreibe ich eine Prüfung.&lt;/li&gt;
&lt;li&gt;Ich bin noch nicht vorbereitet.&lt;/li&gt;
&lt;li&gt;Ich muss mehr Übungen machen.&lt;/li&gt;
&lt;li&gt;Ich möchte dem Lehrer eine Frage stellen.&lt;/li&gt;
&lt;li&gt;Ich möchte wissen, warum diese Antwort falsch ist.&lt;/li&gt;
&lt;li&gt;Wenn ich etwas nicht verstehe, frage ich meine Kommilitonen.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;an der Universität&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;für eine Prüfung lernen&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;jemandem eine Frage stellen&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;wenn ...&lt;/code&gt; 从句&lt;/li&gt;
&lt;li&gt;&lt;code&gt;deshalb&lt;/code&gt; 后面正常主句语序：&lt;code&gt;Deshalb lerne ich ...&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 5 — 高频动词 + 介词&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我在等公交车。&lt;/li&gt;
&lt;li&gt;我在等我的朋友。&lt;/li&gt;
&lt;li&gt;我正在想明天的考试。&lt;/li&gt;
&lt;li&gt;我经常想到我的旅行。&lt;/li&gt;
&lt;li&gt;我正在和朋友说话。&lt;/li&gt;
&lt;li&gt;我昨天和老师谈了这个问题。&lt;/li&gt;
&lt;li&gt;我对德国文化很感兴趣。&lt;/li&gt;
&lt;li&gt;我对这个课程不太感兴趣。&lt;/li&gt;
&lt;li&gt;这个取决于天气。&lt;/li&gt;
&lt;li&gt;这取决于价格。&lt;/li&gt;
&lt;li&gt;我害怕考试。&lt;/li&gt;
&lt;li&gt;我不害怕犯错误。&lt;/li&gt;
&lt;li&gt;我在为考试做准备。&lt;/li&gt;
&lt;li&gt;我想为旅行做准备。&lt;/li&gt;
&lt;li&gt;我需要集中注意力学习。&lt;/li&gt;
&lt;li&gt;我无法集中注意力。&lt;/li&gt;
&lt;li&gt;我很高兴见到你。&lt;/li&gt;
&lt;li&gt;我很期待周末。&lt;/li&gt;
&lt;li&gt;我想请你帮忙。&lt;/li&gt;
&lt;li&gt;谢谢你的帮助。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich warte auf den Bus.&lt;/li&gt;
&lt;li&gt;Ich warte auf meinen Freund / meine Freundin.&lt;/li&gt;
&lt;li&gt;Ich denke an die Prüfung morgen.&lt;/li&gt;
&lt;li&gt;Ich denke oft an meine Reise.&lt;/li&gt;
&lt;li&gt;Ich spreche gerade mit einem Freund / einer Freundin.&lt;/li&gt;
&lt;li&gt;Ich habe gestern mit dem Lehrer über dieses Problem gesprochen.&lt;/li&gt;
&lt;li&gt;Ich interessiere mich für die deutsche Kultur.&lt;/li&gt;
&lt;li&gt;Ich interessiere mich nicht besonders für diesen Kurs.&lt;/li&gt;
&lt;li&gt;Das hängt vom Wetter ab.&lt;/li&gt;
&lt;li&gt;Das hängt vom Preis ab.&lt;/li&gt;
&lt;li&gt;Ich habe Angst vor Prüfungen.&lt;/li&gt;
&lt;li&gt;Ich habe keine Angst davor, Fehler zu machen.&lt;/li&gt;
&lt;li&gt;Ich bereite mich auf die Prüfung vor.&lt;/li&gt;
&lt;li&gt;Ich möchte mich auf die Reise vorbereiten.&lt;/li&gt;
&lt;li&gt;Ich muss mich auf das Lernen konzentrieren.&lt;/li&gt;
&lt;li&gt;Ich kann mich nicht konzentrieren.&lt;/li&gt;
&lt;li&gt;Ich freue mich, dich zu sehen.&lt;/li&gt;
&lt;li&gt;Ich freue mich auf das Wochenende.&lt;/li&gt;
&lt;li&gt;Ich möchte dich um Hilfe bitten.&lt;/li&gt;
&lt;li&gt;Danke für deine Hilfe.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点搭配&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;warten auf + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;denken an + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;sprechen mit + Dat.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;sprechen über + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;sich interessieren für + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;abhängen von + Dat.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Angst haben vor + Dat.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;sich vorbereiten auf + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;sich konzentrieren auf + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;sich freuen auf + Akk.&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 6 — 过去发生的事情&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我昨天很忙。&lt;/li&gt;
&lt;li&gt;我早上七点起床了。&lt;/li&gt;
&lt;li&gt;然后我吃了早餐。&lt;/li&gt;
&lt;li&gt;八点我离开了家。&lt;/li&gt;
&lt;li&gt;我坐电车去了学校。&lt;/li&gt;
&lt;li&gt;第一节课九点开始。&lt;/li&gt;
&lt;li&gt;中午我和朋友一起吃饭了。&lt;/li&gt;
&lt;li&gt;下午我在图书馆学习了两个小时。&lt;/li&gt;
&lt;li&gt;然后我买了一杯咖啡。&lt;/li&gt;
&lt;li&gt;晚上我回到了家。&lt;/li&gt;
&lt;li&gt;我做了晚饭。&lt;/li&gt;
&lt;li&gt;吃完饭以后我看了一部电影。&lt;/li&gt;
&lt;li&gt;我昨天没有学习德语。&lt;/li&gt;
&lt;li&gt;因为我太累了。&lt;/li&gt;
&lt;li&gt;上周末我去了大阪。&lt;/li&gt;
&lt;li&gt;我在那里见了一个朋友。&lt;/li&gt;
&lt;li&gt;我们一起去了一个餐厅。&lt;/li&gt;
&lt;li&gt;食物很好吃，但是有一点贵。&lt;/li&gt;
&lt;li&gt;晚上我们在城市里散步。&lt;/li&gt;
&lt;li&gt;我觉得那一天非常开心。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich war gestern sehr beschäftigt.&lt;/li&gt;
&lt;li&gt;Ich bin morgens um sieben Uhr aufgestanden.&lt;/li&gt;
&lt;li&gt;Dann habe ich gefrühstückt.&lt;/li&gt;
&lt;li&gt;Um acht Uhr habe ich das Haus verlassen.&lt;/li&gt;
&lt;li&gt;Ich bin mit dem Zug zur Schule gefahren.&lt;/li&gt;
&lt;li&gt;Der erste Kurs hat um neun Uhr angefangen.&lt;/li&gt;
&lt;li&gt;Mittags habe ich mit meinen Freunden gegessen.&lt;/li&gt;
&lt;li&gt;Am Nachmittag habe ich zwei Stunden in der Bibliothek gelernt.&lt;/li&gt;
&lt;li&gt;Danach habe ich einen Kaffee gekauft.&lt;/li&gt;
&lt;li&gt;Am Abend bin ich nach Hause gekommen.&lt;/li&gt;
&lt;li&gt;Ich habe Abendessen gekocht.&lt;/li&gt;
&lt;li&gt;Nach dem Essen habe ich einen Film gesehen.&lt;/li&gt;
&lt;li&gt;Ich habe gestern kein Deutsch gelernt.&lt;/li&gt;
&lt;li&gt;Weil ich zu müde war.&lt;/li&gt;
&lt;li&gt;Letztes Wochenende bin ich nach Osaka gefahren.&lt;/li&gt;
&lt;li&gt;Dort habe ich einen Freund / eine Freundin getroffen.&lt;/li&gt;
&lt;li&gt;Wir sind zusammen in ein Restaurant gegangen.&lt;/li&gt;
&lt;li&gt;Das Essen war sehr lecker, aber ein bisschen teuer.&lt;/li&gt;
&lt;li&gt;Am Abend sind wir in der Stadt spazieren gegangen.&lt;/li&gt;
&lt;li&gt;Ich fand den Tag sehr schön.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Perfekt：&lt;code&gt;haben/sein + Partizip II&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;移动/状态变化常用 &lt;code&gt;sein&lt;/code&gt;：
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;bin gefahren&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;bin gegangen&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;bin gekommen&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;bin aufgestanden&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;code&gt;danach&lt;/code&gt; = 在那之后&lt;/li&gt;
&lt;li&gt;&lt;code&gt;dort&lt;/code&gt; = 在那里&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 7 — 计划、建议和选择&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我明天想早点起床。&lt;/li&gt;
&lt;li&gt;我明天打算去图书馆学习。&lt;/li&gt;
&lt;li&gt;周末我想和朋友见面。&lt;/li&gt;
&lt;li&gt;如果天气好，我想去公园。&lt;/li&gt;
&lt;li&gt;如果下雨，我就待在家。&lt;/li&gt;
&lt;li&gt;我还没有决定去哪里。&lt;/li&gt;
&lt;li&gt;我在考虑去京都还是大阪。&lt;/li&gt;
&lt;li&gt;我觉得京都更有意思。&lt;/li&gt;
&lt;li&gt;但是大阪可能更便宜。&lt;/li&gt;
&lt;li&gt;我需要考虑一下。&lt;/li&gt;
&lt;li&gt;你应该早点睡觉。&lt;/li&gt;
&lt;li&gt;你可以坐电车去那里。&lt;/li&gt;
&lt;li&gt;我建议你先查一下价格。&lt;/li&gt;
&lt;li&gt;你最好提前买票。&lt;/li&gt;
&lt;li&gt;我觉得这个选择比较好。&lt;/li&gt;
&lt;li&gt;一方面它比较便宜。&lt;/li&gt;
&lt;li&gt;另一方面它需要更多时间。&lt;/li&gt;
&lt;li&gt;对我来说，价格更重要。&lt;/li&gt;
&lt;li&gt;所以我会选择第一个方案。&lt;/li&gt;
&lt;li&gt;不过这取决于具体情况。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich möchte morgen früh aufstehen.&lt;/li&gt;
&lt;li&gt;Ich habe vor, morgen in der Bibliothek zu lernen.&lt;/li&gt;
&lt;li&gt;Am Wochenende möchte ich mich mit Freunden treffen.&lt;/li&gt;
&lt;li&gt;Wenn das Wetter gut ist, möchte ich in den Park gehen.&lt;/li&gt;
&lt;li&gt;Wenn es regnet, bleibe ich zu Hause.&lt;/li&gt;
&lt;li&gt;Ich habe noch nicht entschieden, wohin ich gehen soll.&lt;/li&gt;
&lt;li&gt;Ich überlege, ob ich nach Kyoto oder Osaka fahren soll.&lt;/li&gt;
&lt;li&gt;Ich finde Kyoto interessanter.&lt;/li&gt;
&lt;li&gt;Aber Osaka ist vielleicht günstiger.&lt;/li&gt;
&lt;li&gt;Ich muss noch darüber nachdenken.&lt;/li&gt;
&lt;li&gt;Du solltest früher schlafen gehen.&lt;/li&gt;
&lt;li&gt;Du kannst mit dem Zug dorthin fahren.&lt;/li&gt;
&lt;li&gt;Ich würde dir empfehlen, zuerst den Preis zu prüfen.&lt;/li&gt;
&lt;li&gt;Du solltest die Fahrkarte am besten vorher kaufen.&lt;/li&gt;
&lt;li&gt;Ich finde diese Möglichkeit besser.&lt;/li&gt;
&lt;li&gt;Einerseits ist sie günstiger.&lt;/li&gt;
&lt;li&gt;Andererseits braucht man dafür mehr Zeit.&lt;/li&gt;
&lt;li&gt;Für mich ist der Preis wichtiger.&lt;/li&gt;
&lt;li&gt;Deshalb würde ich die erste Möglichkeit wählen.&lt;/li&gt;
&lt;li&gt;Allerdings hängt das von der Situation ab.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;vorhaben, ... zu ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;sich mit jemandem treffen&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;überlegen, ob ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Einerseits ..., andererseits ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;jemandem empfehlen, ... zu ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;abhängen von + Dat.&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 8 — 描述问题和应对忘词&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我有一个小问题。&lt;/li&gt;
&lt;li&gt;我的电脑不能联网。&lt;/li&gt;
&lt;li&gt;我不知道为什么。&lt;/li&gt;
&lt;li&gt;我已经重启过电脑了。&lt;/li&gt;
&lt;li&gt;但是问题还是存在。&lt;/li&gt;
&lt;li&gt;我想找一个解决办法。&lt;/li&gt;
&lt;li&gt;我不知道这个东西用德语怎么说。&lt;/li&gt;
&lt;li&gt;我忘了这个词。&lt;/li&gt;
&lt;li&gt;这是一个用来拍照的东西。&lt;/li&gt;
&lt;li&gt;这是一个你可以借书的地方。&lt;/li&gt;
&lt;li&gt;这是一个下雨的时候会用的东西。&lt;/li&gt;
&lt;li&gt;我不知道准确的词，但是我可以解释。&lt;/li&gt;
&lt;li&gt;我的意思是……&lt;/li&gt;
&lt;li&gt;换句话说……&lt;/li&gt;
&lt;li&gt;我可以举一个例子。&lt;/li&gt;
&lt;li&gt;比如我每天都会用这个。&lt;/li&gt;
&lt;li&gt;这个问题对我来说有一点复杂。&lt;/li&gt;
&lt;li&gt;我需要一点时间想一想。&lt;/li&gt;
&lt;li&gt;我不确定我的答案对不对。&lt;/li&gt;
&lt;li&gt;但是我觉得大概是这样。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich habe ein kleines Problem.&lt;/li&gt;
&lt;li&gt;Mein Computer kann keine Verbindung zum Internet herstellen.&lt;/li&gt;
&lt;li&gt;Ich weiß nicht, warum.&lt;/li&gt;
&lt;li&gt;Ich habe den Computer schon neu gestartet.&lt;/li&gt;
&lt;li&gt;Aber das Problem besteht immer noch.&lt;/li&gt;
&lt;li&gt;Ich möchte eine Lösung finden.&lt;/li&gt;
&lt;li&gt;Ich weiß nicht, wie dieses Ding auf Deutsch heißt.&lt;/li&gt;
&lt;li&gt;Ich habe das Wort vergessen.&lt;/li&gt;
&lt;li&gt;Das ist ein Ding, mit dem man Fotos machen kann.&lt;/li&gt;
&lt;li&gt;Das ist ein Ort, an dem man Bücher ausleihen kann.&lt;/li&gt;
&lt;li&gt;Das ist ein Ding, das man benutzt, wenn es regnet.&lt;/li&gt;
&lt;li&gt;Ich kenne das genaue Wort nicht, aber ich kann es erklären.&lt;/li&gt;
&lt;li&gt;Ich meine ...&lt;/li&gt;
&lt;li&gt;Mit anderen Worten ...&lt;/li&gt;
&lt;li&gt;Ich kann ein Beispiel geben.&lt;/li&gt;
&lt;li&gt;Zum Beispiel benutze ich das jeden Tag.&lt;/li&gt;
&lt;li&gt;Dieses Problem ist für mich ein bisschen kompliziert.&lt;/li&gt;
&lt;li&gt;Ich brauche einen Moment, um darüber nachzudenken.&lt;/li&gt;
&lt;li&gt;Ich bin nicht sicher, ob meine Antwort richtig ist.&lt;/li&gt;
&lt;li&gt;Aber ich glaube, dass es ungefähr so ist.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点：不会词也要继续说&lt;/h3&gt;
&lt;p&gt;可以救场的表达：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;Ich weiß nicht, wie das auf Deutsch heißt.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Ich habe das Wort vergessen.&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Ich meine ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Das ist ein Ding, mit dem man ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Das ist ein Ort, an dem man ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Zum Beispiel ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Mit anderen Worten ...&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 9 — 简单观点表达&lt;/h1&gt;
&lt;h2&gt;训练题&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我认为大学生应该做运动。&lt;/li&gt;
&lt;li&gt;因为运动对健康有好处。&lt;/li&gt;
&lt;li&gt;而且运动可以减少压力。&lt;/li&gt;
&lt;li&gt;比如我学习很累的时候会去散步。&lt;/li&gt;
&lt;li&gt;之后我会感觉好一点。&lt;/li&gt;
&lt;li&gt;但是做运动也需要时间。&lt;/li&gt;
&lt;li&gt;有些学生可能没有很多空闲时间。&lt;/li&gt;
&lt;li&gt;所以我觉得每周运动两三次比较现实。&lt;/li&gt;
&lt;li&gt;我认为学生兼职有优点也有缺点。&lt;/li&gt;
&lt;li&gt;一个优点是可以赚钱。&lt;/li&gt;
&lt;li&gt;另一个优点是可以积累经验。&lt;/li&gt;
&lt;li&gt;但是兼职可能影响学习。&lt;/li&gt;
&lt;li&gt;对我来说，学习还是更重要。&lt;/li&gt;
&lt;li&gt;所以我不会每周工作太多小时。&lt;/li&gt;
&lt;li&gt;我觉得网络学习很方便。&lt;/li&gt;
&lt;li&gt;因为学生可以在家学习。&lt;/li&gt;
&lt;li&gt;但是面对面的课程也有优势。&lt;/li&gt;
&lt;li&gt;比如可以直接问老师问题。&lt;/li&gt;
&lt;li&gt;两种方式都有自己的优点。&lt;/li&gt;
&lt;li&gt;我认为最好的方法是把两者结合起来。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich bin der Meinung, dass Studierende Sport treiben sollten.&lt;/li&gt;
&lt;li&gt;Denn Sport ist gut für die Gesundheit.&lt;/li&gt;
&lt;li&gt;Außerdem kann Sport Stress reduzieren.&lt;/li&gt;
&lt;li&gt;Zum Beispiel gehe ich spazieren, wenn ich vom Lernen müde bin.&lt;/li&gt;
&lt;li&gt;Danach fühle ich mich besser.&lt;/li&gt;
&lt;li&gt;Allerdings braucht Sport auch Zeit.&lt;/li&gt;
&lt;li&gt;Manche Studierende haben vielleicht nicht viel Freizeit.&lt;/li&gt;
&lt;li&gt;Deshalb finde ich es realistisch, zwei- oder dreimal pro Woche Sport zu machen.&lt;/li&gt;
&lt;li&gt;Ich denke, dass ein Nebenjob für Studierende Vor- und Nachteile hat.&lt;/li&gt;
&lt;li&gt;Ein Vorteil ist, dass man Geld verdienen kann.&lt;/li&gt;
&lt;li&gt;Ein weiterer Vorteil ist, dass man Erfahrungen sammeln kann.&lt;/li&gt;
&lt;li&gt;Aber ein Nebenjob kann das Studium beeinflussen.&lt;/li&gt;
&lt;li&gt;Für mich ist das Studium trotzdem wichtiger.&lt;/li&gt;
&lt;li&gt;Deshalb würde ich nicht zu viele Stunden pro Woche arbeiten.&lt;/li&gt;
&lt;li&gt;Ich finde Online-Lernen sehr praktisch.&lt;/li&gt;
&lt;li&gt;Denn Studierende können zu Hause lernen.&lt;/li&gt;
&lt;li&gt;Aber Präsenzunterricht hat auch Vorteile.&lt;/li&gt;
&lt;li&gt;Zum Beispiel kann man dem Lehrer direkt Fragen stellen.&lt;/li&gt;
&lt;li&gt;Beide Möglichkeiten haben ihre eigenen Vorteile.&lt;/li&gt;
&lt;li&gt;Meiner Meinung nach ist es am besten, beide Formen zu kombinieren.&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;今日重点：观点结构&lt;/h3&gt;
&lt;p&gt;可以固定记成：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;观点 → 理由 → 例子 → 转折 → 结论&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;常用表达：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;Ich bin der Meinung, dass ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Ein Vorteil ist, dass ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Außerdem ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Zum Beispiel ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Allerdings ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Deshalb ...&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Meiner Meinung nach ...&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;Day 10 — 60 秒综合表达&lt;/h1&gt;
&lt;p&gt;今天的目标不是一句一句孤立说，而是逐渐把句子连起来。&lt;/p&gt;
&lt;h2&gt;Part A：热身句&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;我学习德语已经一年了。&lt;/li&gt;
&lt;li&gt;我一年前开始学习德语。&lt;/li&gt;
&lt;li&gt;一开始我觉得德语非常难。&lt;/li&gt;
&lt;li&gt;现在我已经能看懂一些简单的文章。&lt;/li&gt;
&lt;li&gt;但是说德语对我来说还是很难。&lt;/li&gt;
&lt;li&gt;我说话的时候经常忘记单词。&lt;/li&gt;
&lt;li&gt;我也经常忘记应该用哪个介词。&lt;/li&gt;
&lt;li&gt;所以我现在每天练习口语。&lt;/li&gt;
&lt;li&gt;我觉得经常开口比只背单词更重要。&lt;/li&gt;
&lt;li&gt;我希望以后能更流利地说德语。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Ich lerne seit einem Jahr Deutsch.&lt;/li&gt;
&lt;li&gt;Ich habe vor einem Jahr angefangen, Deutsch zu lernen.&lt;/li&gt;
&lt;li&gt;Am Anfang fand ich Deutsch sehr schwierig.&lt;/li&gt;
&lt;li&gt;Jetzt kann ich schon einige einfache Texte verstehen.&lt;/li&gt;
&lt;li&gt;Aber Deutsch zu sprechen ist für mich immer noch schwierig.&lt;/li&gt;
&lt;li&gt;Beim Sprechen vergesse ich oft Wörter.&lt;/li&gt;
&lt;li&gt;Ich vergesse auch oft, welche Präposition ich benutzen soll.&lt;/li&gt;
&lt;li&gt;Deshalb übe ich jetzt jeden Tag Sprechen.&lt;/li&gt;
&lt;li&gt;Ich finde es wichtiger, regelmäßig zu sprechen, als nur Wörter auswendig zu lernen.&lt;/li&gt;
&lt;li&gt;Ich hoffe, dass ich in Zukunft flüssiger Deutsch sprechen kann.&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h2&gt;Part B：把下面 10 句连成一段话&lt;/h2&gt;
&lt;p&gt;不要看答案，尝试连续说 60–90 秒。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;我觉得旅行很有意思。&lt;/li&gt;
&lt;li&gt;我喜欢去新的城市。&lt;/li&gt;
&lt;li&gt;因为我可以了解不同的文化。&lt;/li&gt;
&lt;li&gt;我特别喜欢坐火车旅行。&lt;/li&gt;
&lt;li&gt;我觉得火车比飞机舒服。&lt;/li&gt;
&lt;li&gt;但是火车有时候需要更多时间。&lt;/li&gt;
&lt;li&gt;如果路程太远，我也会坐飞机。&lt;/li&gt;
&lt;li&gt;对我来说，价格和时间都很重要。&lt;/li&gt;
&lt;li&gt;所以我会根据情况选择交通方式。&lt;/li&gt;
&lt;li&gt;总的来说，我很喜欢旅行。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;参考答案&lt;/h2&gt;
&lt;p&gt;Ich finde Reisen sehr interessant. Ich besuche gern neue Städte, weil ich dadurch verschiedene Kulturen kennenlernen kann. Besonders gern reise ich mit dem Zug. Ich finde Zugfahren angenehmer als Fliegen. Allerdings braucht eine Zugfahrt manchmal mehr Zeit. Wenn die Strecke zu lang ist, fliege ich auch. Für mich sind sowohl der Preis als auch die Zeit wichtig. Deshalb wähle ich das Verkehrsmittel je nach Situation. Insgesamt reise ich sehr gern.&lt;/p&gt;
&lt;hr /&gt;
&lt;h1&gt;10 天后自测&lt;/h1&gt;
&lt;p&gt;不要准备稿子，随机选择下面一个主题，准备 30 秒，然后说 60 秒。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Mein Alltag&lt;/li&gt;
&lt;li&gt;Mein Studium&lt;/li&gt;
&lt;li&gt;Mein Wochenende&lt;/li&gt;
&lt;li&gt;Meine letzte Reise&lt;/li&gt;
&lt;li&gt;Warum lerne ich Deutsch?&lt;/li&gt;
&lt;li&gt;Meine Lieblingsstadt&lt;/li&gt;
&lt;li&gt;Online-Lernen oder Präsenzunterricht?&lt;/li&gt;
&lt;li&gt;Sollten Studierende einen Nebenjob haben?&lt;/li&gt;
&lt;li&gt;Warum ist Sport wichtig?&lt;/li&gt;
&lt;li&gt;Wie lerne ich am besten Deutsch?&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;自测标准&lt;/h2&gt;
&lt;p&gt;每次说完，只检查下面 5 项：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;[ ] 我能连续说至少 45–60 秒。&lt;/li&gt;
&lt;li&gt;[ ] 我没有因为忘记一个词就完全停下来。&lt;/li&gt;
&lt;li&gt;[ ] 我至少使用了 2 个连接词（例如 &lt;code&gt;weil&lt;/code&gt;, &lt;code&gt;deshalb&lt;/code&gt;, &lt;code&gt;aber&lt;/code&gt;, &lt;code&gt;außerdem&lt;/code&gt;）。&lt;/li&gt;
&lt;li&gt;[ ] 我尽量正确使用了常见介词。&lt;/li&gt;
&lt;li&gt;[ ] 我能用简单德语绕着解释不会的词。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;高频口语救场句&lt;/h1&gt;
&lt;p&gt;这些句子建议练到不用思考就能说出来。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Ich weiß nicht genau, wie ich das sagen soll.&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;我不太确定该怎么说。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Mir fällt das Wort gerade nicht ein.&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;我一时想不起这个词。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Ich weiß nicht, wie das auf Deutsch heißt.&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;我不知道这个用德语怎么说。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Ich meine ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;我的意思是……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Zum Beispiel ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;比如……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Mit anderen Worten ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;换句话说……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Ich glaube, dass ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;我觉得……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Meiner Meinung nach ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;在我看来……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Ein wichtiger Grund dafür ist, dass ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;一个重要原因是……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Außerdem ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;此外……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Allerdings ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;不过……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;code&gt;Deshalb ...&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;所以……&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h1&gt;高频「动词 + 介词」清单&lt;/h1&gt;
&lt;p&gt;建议把这些作为整体记忆，而不是拆成单词背。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;搭配&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;th&gt;例句&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;warten auf + Akk.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;等待&lt;/td&gt;
&lt;td&gt;Ich warte auf den Bus.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;denken an + Akk.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;想到&lt;/td&gt;
&lt;td&gt;Ich denke an die Prüfung.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;sprechen mit + Dat.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;和……说话&lt;/td&gt;
&lt;td&gt;Ich spreche mit meinem Freund.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;sprechen über + Akk.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;谈论&lt;/td&gt;
&lt;td&gt;Wir sprechen über das Problem.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;sich interessieren für + Akk.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;对……感兴趣&lt;/td&gt;
&lt;td&gt;Ich interessiere mich für Deutschland.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;abhängen von + Dat.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;取决于&lt;/td&gt;
&lt;td&gt;Das hängt vom Wetter ab.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;Angst haben vor + Dat.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;害怕&lt;/td&gt;
&lt;td&gt;Ich habe Angst vor der Prüfung.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;sich vorbereiten auf + Akk.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;为……做准备&lt;/td&gt;
&lt;td&gt;Ich bereite mich auf die Prüfung vor.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;sich konzentrieren auf + Akk.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;集中于&lt;/td&gt;
&lt;td&gt;Ich konzentriere mich auf das Lernen.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;sich freuen auf + Akk.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;期待&lt;/td&gt;
&lt;td&gt;Ich freue mich auf das Wochenende.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;bitten um + Akk.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;请求&lt;/td&gt;
&lt;td&gt;Ich bitte dich um Hilfe.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;sich treffen mit + Dat.&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;和……见面&lt;/td&gt;
&lt;td&gt;Ich treffe mich mit Freunden.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;h1&gt;建议的复习节奏&lt;/h1&gt;
&lt;ul&gt;
&lt;li&gt;Day 1：Day 1&lt;/li&gt;
&lt;li&gt;Day 2：Day 2 + 复习 Day 1 最卡的 5 句&lt;/li&gt;
&lt;li&gt;Day 3：Day 3 + 复习 Day 2&lt;/li&gt;
&lt;li&gt;Day 4：Day 4 + 随机复习 Day 1–3 的 10 句&lt;/li&gt;
&lt;li&gt;Day 5：Day 5 + 重点复习介词搭配&lt;/li&gt;
&lt;li&gt;Day 6：Day 6 + 复习 Day 3&lt;/li&gt;
&lt;li&gt;Day 7：Day 7 + 复习 Day 4&lt;/li&gt;
&lt;li&gt;Day 8：Day 8 + 复习 Day 5&lt;/li&gt;
&lt;li&gt;Day 9：Day 9 + 随机复习前 8 天的 15 句&lt;/li&gt;
&lt;li&gt;Day 10：Day 10 + 60 秒综合自测&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;这 10 天最重要的不是“全都说对”，而是让大脑逐渐习惯：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;看到意思 → 直接调出德语 → 即使忘词也继续说。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 2 - State Values and Bellman Equation</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-2-state-values-and-bellman-equation/chapter-2---state-values-and-bellman-equation/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-2-state-values-and-bellman-equation/chapter-2---state-values-and-bellman-equation/</guid><pubDate>Thu, 13 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 2 - State Values and Bellman Equation&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
本章围绕一个评价问题展开：给定策略（policy）后，怎样用数学量化“从某个状态出发，这个策略有多好”？单条轨迹的回报（return）会随随机动作或随机转移而变化，因此教材用&lt;strong&gt;期望回报&lt;/strong&gt;定义状态价值（state value），再利用回报的递归分解导出 Bellman 方程。将每个状态的方程联立，就得到可闭式求解或迭代求解的策略评估（policy evaluation）问题。最后，本章把评价对象从状态扩展到状态—动作对，得到动作价值（action value）及其 Bellman 方程。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识结构&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-2-1.png&quot; alt=&quot;Figure 2.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; Chapter 2 位于基础工具层：它承接 Chapter 1 的 MDP、策略、奖励与回报，并为 Chapter 3 的 Bellman optimality equation、Chapter 4 的 value/policy iteration 以及之后的 model-free 方法提供价值递归工具。&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;flowchart LR
    R[&quot;轨迹回报 G_t&quot;] --&amp;gt; V[&quot;状态价值 v_π(s)&amp;lt;br/&amp;gt;期望回报&quot;]
    V --&amp;gt; B[&quot;Bellman 方程&amp;lt;br/&amp;gt;一步奖励 + 后继价值&quot;]
    B --&amp;gt; M[&quot;矩阵形式&amp;lt;br/&amp;gt;v_π = r_π + γP_πv_π&quot;]
    M --&amp;gt; E[&quot;策略评估&amp;lt;br/&amp;gt;闭式解或迭代解&quot;]
    V --&amp;gt; Q[&quot;动作价值 q_π(s,a)&quot;]
    Q --&amp;gt; QB[&quot;动作价值 Bellman 方程&quot;]
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;主线可以概括为：&lt;/p&gt;
&lt;p&gt;$$
\text{回报比较策略}
\rightarrow \text{随机性要求取期望}
\rightarrow v_\pi(s)
\rightarrow \text{Bellman 递归}
\rightarrow \text{联立求解}
\rightarrow q_\pi(s,a).
$$&lt;/p&gt;
&lt;h2&gt;1. 动机示例 1：为什么回报重要？&lt;/h2&gt;
&lt;p&gt;教材考虑同一个四状态网格中的三种策略，它们只在 $s_1$ 处不同。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-2-2.png&quot; alt=&quot;Figure 2.2：三种策略及其从 s1 出发的不同选择&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;左侧策略从 $s_1$ 向下，避开橙色禁止格 $s_2$；&lt;/li&gt;
&lt;li&gt;中间策略从 $s_1$ 向右，进入 $s_2$ 并立即获得 $-1$；&lt;/li&gt;
&lt;li&gt;右侧策略以 $0.5$ 概率向右、以 $0.5$ 概率向下；&lt;/li&gt;
&lt;li&gt;到达 $s_4$ 后持续获得奖励 $1$。直觉上，左侧最好，中间最差，随机策略居中。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;设折扣率（discount rate）$\gamma\in(0,1)$，并从 $s_1$ 出发。&lt;/p&gt;
&lt;h3&gt;1.1 第一种策略：确定性地避开禁止格&lt;/h3&gt;
&lt;p&gt;轨迹为 $s_1\rightarrow s_3\rightarrow s_4\rightarrow s_4\rightarrow\cdots$，回报为&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\operatorname{return}_1
&amp;amp;=0+\gamma\cdot1+\gamma^2\cdot1+\cdots\
&amp;amp;=\gamma(1+\gamma+\gamma^2+\cdots)\
&amp;amp;=\frac{\gamma}{1-\gamma}.
\end{aligned}
$$&lt;/p&gt;
&lt;h3&gt;1.2 第二种策略：确定性地进入禁止格&lt;/h3&gt;
&lt;p&gt;轨迹为 $s_1\rightarrow s_2\rightarrow s_4\rightarrow s_4\rightarrow\cdots$，因此&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\operatorname{return}_2
&amp;amp;=-1+\gamma\cdot1+\gamma^2\cdot1+\cdots\
&amp;amp;=-1+\frac{\gamma}{1-\gamma}.
\end{aligned}
$$&lt;/p&gt;
&lt;h3&gt;1.3 第三种策略：在两条路线间随机选择&lt;/h3&gt;
&lt;p&gt;两条轨迹各以 $0.5$ 的概率出现，平均回报为&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\operatorname{return}_3
&amp;amp;=0.5\left(-1+\frac{\gamma}{1-\gamma}\right)
+0.5\left(\frac{\gamma}{1-\gamma}\right)\
&amp;amp;=-0.5+\frac{\gamma}{1-\gamma}.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;于是，对任意 $\gamma\in(0,1)$ 都有&lt;/p&gt;
&lt;p&gt;$$
\operatorname{return}_1&amp;gt;\operatorname{return}_3&amp;gt;\operatorname{return}_2.
$$&lt;/p&gt;
&lt;p&gt;这个顺序与直觉一致：**回报越大，策略越好。**不过，$\operatorname{return}_3$ 已不是某一条实际轨迹的回报，而是两种可能回报的平均值；后文会把它正式识别为状态价值。&lt;/p&gt;
&lt;h2&gt;2. 动机示例 2：怎样计算回报？&lt;/h2&gt;
&lt;p&gt;考虑一个没有目标格和禁止格的四状态循环。每个状态按图中箭头确定性地移动，并依次获得 $r_1,r_2,r_3,r_4$。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-2-3.png&quot; alt=&quot;Figure 2.3：四状态循环及每一步奖励&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.1 按定义直接展开&lt;/h3&gt;
&lt;p&gt;用 $v_i$ 表示从 $s_i$ 出发的回报，则&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_1&amp;amp;=r_1+\gamma r_2+\gamma^2r_3+\cdots,\
v_2&amp;amp;=r_2+\gamma r_3+\gamma^2r_4+\cdots,\
v_3&amp;amp;=r_3+\gamma r_4+\gamma^2r_1+\cdots,\
v_4&amp;amp;=r_4+\gamma r_1+\gamma^2r_2+\cdots.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;这种方式忠实于回报定义，但需要处理无限长奖励序列。&lt;/p&gt;
&lt;h3&gt;2.2 Bootstrap：利用下一状态的价值&lt;/h3&gt;
&lt;p&gt;观察各式的尾部：$v_1$ 中从 $r_2$ 开始的部分正是 $v_2$，其余同理。因此&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_1&amp;amp;=r_1+\gamma v_2,\
v_2&amp;amp;=r_2+\gamma v_3,\
v_3&amp;amp;=r_3+\gamma v_4,\
v_4&amp;amp;=r_4+\gamma v_1.
\end{aligned}
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!definition] Bootstrap（自举）
用待求量自身或其他待求量的当前关系来计算该量。本例中，每个状态的价值由“一步奖励 + 下一状态的价值”表达。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这看似循环依赖，实质上是一个联立线性方程组。令&lt;/p&gt;
&lt;p&gt;$$
v=\begin{bmatrix}v_1\v_2\v_3\v_4\end{bmatrix},\quad
r=\begin{bmatrix}r_1\r_2\r_3\r_4\end{bmatrix},\quad
P=\begin{bmatrix}
0&amp;amp;1&amp;amp;0&amp;amp;0\
0&amp;amp;0&amp;amp;1&amp;amp;0\
0&amp;amp;0&amp;amp;0&amp;amp;1\
1&amp;amp;0&amp;amp;0&amp;amp;0
\end{bmatrix},
$$&lt;/p&gt;
&lt;p&gt;则&lt;/p&gt;
&lt;p&gt;$$
v=r+\gamma Pv,
$$&lt;/p&gt;
&lt;p&gt;从而&lt;/p&gt;
&lt;p&gt;$$
v=(I-\gamma P)^{-1}r.
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 核心理解
“价值依赖价值”不是程序陷入死循环，而是所有状态必须一起满足的一组一致性约束。Bellman 方程正是这种约束的一般形式。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;3. 状态价值&lt;/h2&gt;
&lt;h3&gt;3.1 轨迹与随机回报&lt;/h3&gt;
&lt;p&gt;在时刻 $t$，智能体处于随机状态 $S_t$，依据策略 $\pi$ 选择随机动作 $A_t$，环境产生下一状态 $S_{t+1}$ 和即时奖励 $R_{t+1}$：&lt;/p&gt;
&lt;p&gt;$$
S_t\xrightarrow{A_t}S_{t+1},R_{t+1}.
$$&lt;/p&gt;
&lt;p&gt;其中 $S_t,S_{t+1}\in\mathcal S$，$A_t\in\mathcal A(S_t)$，$R_{t+1}\in\mathcal R(S_t,A_t)$。从时刻 $t$ 开始的轨迹为&lt;/p&gt;
&lt;p&gt;$$
S_t\xrightarrow{A_t}S_{t+1},R_{t+1}
\xrightarrow{A_{t+1}}S_{t+2},R_{t+2}
\xrightarrow{A_{t+2}}\cdots.
$$&lt;/p&gt;
&lt;p&gt;对应的折扣回报是随机变量&lt;/p&gt;
&lt;p&gt;$$
G_t\triangleq R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots.
$$&lt;/p&gt;
&lt;h3&gt;3.2 正式定义&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!definition] 状态价值函数（state-value function）
给定策略 $\pi$，状态 $s$ 的价值是从 $S_t=s$ 出发并随后遵循 $\pi$ 时所得回报的条件期望：
$$
v_\pi(s)\triangleq\mathbb E[G_t\mid S_t=s].
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;定义包含三个关键点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$v_\pi(s)$ 依赖状态 $s$，因为条件指定了出发状态；&lt;/li&gt;
&lt;li&gt;$v_\pi(s)$ 依赖策略 $\pi$，因为策略决定后续动作与轨迹分布；&lt;/li&gt;
&lt;li&gt;在教材采用的平稳 MDP 和固定策略设定下，$v_\pi(s)$ 不依赖具体时刻 $t$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.3 回报与状态价值的关系&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;情形&lt;/th&gt;
&lt;th&gt;从同一状态出发的轨迹&lt;/th&gt;
&lt;th&gt;回报&lt;/th&gt;
&lt;th&gt;状态价值&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;策略和系统模型都确定&lt;/td&gt;
&lt;td&gt;唯一&lt;/td&gt;
&lt;td&gt;唯一&lt;/td&gt;
&lt;td&gt;等于该轨迹回报&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;策略或系统模型含随机性&lt;/td&gt;
&lt;td&gt;可能有多条&lt;/td&gt;
&lt;td&gt;随轨迹变化&lt;/td&gt;
&lt;td&gt;所有可能回报的均值&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;所以，回报 $G_t$ 是一次轨迹的随机结果，而 $v_\pi(s)$ 是给定起点与策略后的统计评价。正式评价策略时应使用状态价值。&lt;/p&gt;
&lt;h2&gt;4. Bellman 方程&lt;/h2&gt;
&lt;p&gt;Bellman 方程（Bellman equation）是一组描述所有状态价值之间关系的线性方程。&lt;/p&gt;
&lt;h3&gt;4.1 从回报递归开始&lt;/h3&gt;
&lt;p&gt;首先分离第一步奖励：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
G_t
&amp;amp;=R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots\
&amp;amp;=R_{t+1}+\gamma(R_{t+2}+\gamma R_{t+3}+\cdots)\
&amp;amp;=R_{t+1}+\gamma G_{t+1}.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;代入状态价值定义：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_\pi(s)
&amp;amp;=\mathbb E[G_t\mid S_t=s]\
&amp;amp;=\mathbb E[R_{t+1}+\gamma G_{t+1}\mid S_t=s]\
&amp;amp;=\mathbb E[R_{t+1}\mid S_t=s]
+\gamma\mathbb E[G_{t+1}\mid S_t=s].
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;这已经显示了 Bellman 结构：&lt;strong&gt;当前价值 = 即时奖励的均值 + 折扣后的未来回报均值。&lt;/strong&gt;&lt;/p&gt;
&lt;h3&gt;4.2 即时奖励项&lt;/h3&gt;
&lt;p&gt;根据全期望公式，先对动作，再对奖励求和：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E[R_{t+1}\mid S_t=s]
&amp;amp;=\sum_{a\in\mathcal A}\pi(a\mid s)
\mathbb E[R_{t+1}\mid S_t=s,A_t=a]\
&amp;amp;=\sum_{a\in\mathcal A}\pi(a\mid s)
\sum_{r\in\mathcal R}p(r\mid s,a)r.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;教材为简化记号省略了动作集和奖励集对 $s$ 或 $(s,a)$ 的依赖；若实际为 $\mathcal A(s)$、$\mathcal R(s,a)$，结论不变。&lt;/p&gt;
&lt;h3&gt;4.3 未来回报项与 Markov 性质&lt;/h3&gt;
&lt;p&gt;对下一状态 $S_{t+1}=s&apos;$ 分解：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E[G_{t+1}\mid S_t=s]
&amp;amp;=\sum_{s&apos;\in\mathcal S}
\mathbb E[G_{t+1}\mid S_t=s,S_{t+1}=s&apos;]p(s&apos;\mid s)\
&amp;amp;=\sum_{s&apos;\in\mathcal S}
\mathbb E[G_{t+1}\mid S_{t+1}=s&apos;]p(s&apos;\mid s)\
&amp;amp;=\sum_{s&apos;\in\mathcal S}v_\pi(s&apos;)p(s&apos;\mid s)\
&amp;amp;=\sum_{s&apos;\in\mathcal S}v_\pi(s&apos;)
\sum_{a\in\mathcal A}p(s&apos;\mid s,a)\pi(a\mid s).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;第二行使用 Markov 性质：给定当前的下一状态 $S_{t+1}$ 后，未来回报不再需要过去状态 $S_t$。&lt;/p&gt;
&lt;h3&gt;4.4 一般形式&lt;/h3&gt;
&lt;p&gt;把两部分合并，得到对每个 $s\in\mathcal S$ 都成立的 Bellman 方程：&lt;/p&gt;
&lt;p&gt;$$
\boxed{
v_\pi(s)=
\sum_{a\in\mathcal A}\pi(a\mid s)
\left[
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)v_\pi(s&apos;)
\right]
}
$$&lt;/p&gt;
&lt;p&gt;各部分含义：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\pi(a\mid s)$：给定、待评价的策略；&lt;/li&gt;
&lt;li&gt;$p(r\mid s,a)$ 与 $p(s&apos;\mid s,a)$：系统模型；&lt;/li&gt;
&lt;li&gt;$v_\pi(s)$ 与 $v_\pi(s&apos;)$：待求价值；&lt;/li&gt;
&lt;li&gt;第一项：即时奖励的均值；&lt;/li&gt;
&lt;li&gt;第二项：折扣后的下一状态价值均值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Bellman 方程不是只求一个 $v_\pi(s)$ 的单方程，而是为所有状态各写一个方程并联立求解。解出价值就是&lt;strong&gt;策略评估&lt;/strong&gt;。&lt;/p&gt;
&lt;h3&gt;4.5 两种等价写法&lt;/h3&gt;
&lt;p&gt;若使用联合分布 $p(s&apos;,r\mid s,a)$，由全概率公式可得&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s)=\sum_{a\in\mathcal A}\sum_{s&apos;\in\mathcal S}\sum_{r\in\mathcal R}
\pi(a\mid s)p(s&apos;,r\mid s,a)[r+\gamma v_\pi(s&apos;)].
$$&lt;/p&gt;
&lt;p&gt;若奖励只由下一状态决定，即写作 $r(s&apos;)$，则&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s)=\sum_{a\in\mathcal A}\pi(a\mid s)
\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)[r(s&apos;)+\gamma v_\pi(s&apos;)].
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 记号差异
不同文献采用联合模型、分离的奖励/转移模型或下一状态奖励写法。它们的条件不同，但核心都是对“一步奖励 + 后继价值”取期望。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;5. Bellman 方程示例&lt;/h2&gt;
&lt;h3&gt;5.1 确定性策略&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-2-4.png&quot; alt=&quot;Figure 2.4：确定性策略示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 在 $s_1$ 向下且即时奖励为 $0$；$s_2$ 向下、$s_3$ 向右、$s_4$ 原地停留，后三者每步奖励均为 $1$。&lt;/p&gt;
&lt;p&gt;在 $s_1$，策略、转移和奖励都确定，所以一般 Bellman 方程立即化简为&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s_1)=0+\gamma v_\pi(s_3).
$$&lt;/p&gt;
&lt;p&gt;其余状态为&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_\pi(s_2)&amp;amp;=1+\gamma v_\pi(s_4),\
v_\pi(s_3)&amp;amp;=1+\gamma v_\pi(s_4),\
v_\pi(s_4)&amp;amp;=1+\gamma v_\pi(s_4).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;从最后一个方程开始求解：&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s_4)=v_\pi(s_3)=v_\pi(s_2)=\frac{1}{1-\gamma},\qquad
v_\pi(s_1)=\frac{\gamma}{1-\gamma}.
$$&lt;/p&gt;
&lt;p&gt;取 $\gamma=0.9$，有&lt;/p&gt;
&lt;p&gt;$$
[v_\pi(s_1),v_\pi(s_2),v_\pi(s_3),v_\pi(s_4)]^T=[9,10,10,10]^T.
$$&lt;/p&gt;
&lt;h3&gt;5.2 随机策略&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-2-5.png&quot; alt=&quot;Figure 2.5：随机策略示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; $s_1$ 以 $0.5$ 概率向下，得到 $0$ 后到 $s_3$；以 $0.5$ 概率向右，得到 $-1$ 后到禁止格 $s_2$。其余状态与上例相同。&lt;/p&gt;
&lt;p&gt;因此&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s_1)=0.5[0+\gamma v_\pi(s_3)]
+0.5[-1+\gamma v_\pi(s_2)].
$$&lt;/p&gt;
&lt;p&gt;$s_2,s_3,s_4$ 的方程不变，所以&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s_1)=-0.5+\frac{\gamma}{1-\gamma}.
$$&lt;/p&gt;
&lt;p&gt;当 $\gamma=0.9$ 时，价值向量为&lt;/p&gt;
&lt;p&gt;$$
[8.5,10,10,10]^T.
$$&lt;/p&gt;
&lt;p&gt;若用 $\pi_1$ 表示确定性策略、$\pi_2$ 表示随机策略，则&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_1}(s_i)\geq v_{\pi_2}(s_i),\qquad i=1,2,3,4.
$$&lt;/p&gt;
&lt;p&gt;这说明第一种策略不劣于第二种；差异只出现在会以一定概率进入禁止格的 $s_1$。&lt;/p&gt;
&lt;h2&gt;6. Bellman 方程的矩阵—向量形式&lt;/h2&gt;
&lt;p&gt;先定义策略下的平均即时奖励和状态转移概率：&lt;/p&gt;
&lt;p&gt;$$
r_\pi(s)\triangleq
\sum_{a\in\mathcal A}\pi(a\mid s)
\sum_{r\in\mathcal R}p(r\mid s,a)r,
$$&lt;/p&gt;
&lt;p&gt;$$
p_\pi(s&apos;\mid s)\triangleq
\sum_{a\in\mathcal A}\pi(a\mid s)p(s&apos;\mid s,a).
$$&lt;/p&gt;
&lt;p&gt;于是逐状态形式可简写为&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s)=r_\pi(s)+\gamma\sum_{s&apos;\in\mathcal S}p_\pi(s&apos;\mid s)v_\pi(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;将状态编号为 $s_1,\ldots,s_n$，其中 $n=\lvert\mathcal S\rvert$，并令&lt;/p&gt;
&lt;p&gt;$$
v_\pi=[v_\pi(s_1),\ldots,v_\pi(s_n)]^T,
\qquad
r_\pi=[r_\pi(s_1),\ldots,r_\pi(s_n)]^T,
$$&lt;/p&gt;
&lt;p&gt;$$
[P_\pi]&lt;em&gt;{ij}=p&lt;/em&gt;\pi(s_j\mid s_i).
$$&lt;/p&gt;
&lt;p&gt;所有状态的方程合并为&lt;/p&gt;
&lt;p&gt;$$
\boxed{v_\pi=r_\pi+\gamma P_\pi v_\pi.}
$$&lt;/p&gt;
&lt;p&gt;$P_\pi$ 有两个重要性质：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;非负：$P_\pi\geq0$，这里为逐元素比较；&lt;/li&gt;
&lt;li&gt;行随机：$P_\pi\mathbf1=\mathbf1$，即每行元素之和为 $1$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-2-6.png&quot; alt=&quot;Figure 2.6：矩阵形式示例所用的随机策略&quot; /&gt;&lt;/p&gt;
&lt;p&gt;对 Figure 2.6，&lt;/p&gt;
&lt;p&gt;$$
r_\pi=\begin{bmatrix}-0.5\1\1\1\end{bmatrix},\qquad
P_\pi=\begin{bmatrix}
0&amp;amp;0.5&amp;amp;0.5&amp;amp;0\
0&amp;amp;0&amp;amp;0&amp;amp;1\
0&amp;amp;0&amp;amp;0&amp;amp;1\
0&amp;amp;0&amp;amp;0&amp;amp;1
\end{bmatrix}.
$$&lt;/p&gt;
&lt;p&gt;第一行体现从 $s_1$ 以相同概率到 $s_2$ 或 $s_3$；其余三行都确定地到 $s_4$。每行之和确为 $1$。&lt;/p&gt;
&lt;h2&gt;7. 从 Bellman 方程求状态价值&lt;/h2&gt;
&lt;p&gt;给定策略后求 $v_\pi$ 的过程就是策略评估。本章给出两种方法。&lt;/p&gt;
&lt;h3&gt;7.1 闭式解&lt;/h3&gt;
&lt;p&gt;由&lt;/p&gt;
&lt;p&gt;$$
(I-\gamma P_\pi)v_\pi=r_\pi
$$&lt;/p&gt;
&lt;p&gt;得到&lt;/p&gt;
&lt;p&gt;$$
\boxed{v_\pi=(I-\gamma P_\pi)^{-1}r_\pi.}
$$&lt;/p&gt;
&lt;h4&gt;为什么 $I-\gamma P_\pi$ 可逆？&lt;/h4&gt;
&lt;p&gt;教材使用 Gershgorin 圆盘定理。第 $i$ 个圆盘的中心为&lt;/p&gt;
&lt;p&gt;$$
1-\gamma p_\pi(s_i\mid s_i),
$$&lt;/p&gt;
&lt;p&gt;半径为&lt;/p&gt;
&lt;p&gt;$$
\sum_{j\neq i}\gamma p_\pi(s_j\mid s_i).
$$&lt;/p&gt;
&lt;p&gt;由于该行概率和为 $1$ 且 $\gamma&amp;lt;1$，半径严格小于中心的模：&lt;/p&gt;
&lt;p&gt;$$
\sum_{j\neq i}\gamma p_\pi(s_j\mid s_i)
&amp;lt;1-\gamma p_\pi(s_i\mid s_i).
$$&lt;/p&gt;
&lt;p&gt;因此所有 Gershgorin 圆盘都不包含原点，$I-\gamma P_\pi$ 没有零特征值，因而可逆。&lt;/p&gt;
&lt;p&gt;此外，由 Neumann 级数&lt;/p&gt;
&lt;p&gt;$$
(I-\gamma P_\pi)^{-1}
=I+\gamma P_\pi+\gamma^2P_\pi^2+\cdots\geq I\geq0.
$$&lt;/p&gt;
&lt;p&gt;所以若 $r\geq0$，则&lt;/p&gt;
&lt;p&gt;$$
(I-\gamma P_\pi)^{-1}r\geq r\geq0.
$$&lt;/p&gt;
&lt;p&gt;进一步，若 $r_1\geq r_2$，则&lt;/p&gt;
&lt;p&gt;$$
(I-\gamma P_\pi)^{-1}r_1
\geq(I-\gamma P_\pi)^{-1}r_2.
$$&lt;/p&gt;
&lt;h3&gt;7.2 迭代解&lt;/h3&gt;
&lt;p&gt;闭式解适合理论分析，但显式矩阵求逆本身仍需数值计算。可直接迭代：&lt;/p&gt;
&lt;p&gt;$$
\boxed{v_{k+1}=r_\pi+\gamma P_\pi v_k,\qquad k=0,1,2,\ldots}
$$&lt;/p&gt;
&lt;p&gt;其中 $v_0\in\mathbb R^n$ 是任意初始猜测，并且&lt;/p&gt;
&lt;p&gt;$$
v_k\rightarrow v_\pi=(I-\gamma P_\pi)^{-1}r_\pi,\qquad k\rightarrow\infty.
$$&lt;/p&gt;
&lt;h4&gt;Box 2.1：收敛证明&lt;/h4&gt;
&lt;p&gt;定义误差 $\delta_k=v_k-v_\pi$。利用迭代式和 Bellman 不动点方程：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\delta_{k+1}
&amp;amp;=v_{k+1}-v_\pi\
&amp;amp;=r_\pi+\gamma P_\pi v_k-v_\pi\
&amp;amp;=\gamma P_\pi(v_k-v_\pi)\
&amp;amp;=\gamma P_\pi\delta_k.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;递推得到&lt;/p&gt;
&lt;p&gt;$$
\delta_{k+1}=\gamma^{k+1}P_\pi^{k+1}\delta_0.
$$&lt;/p&gt;
&lt;p&gt;由于 $P_\pi$ 是随机矩阵，其任意次幂仍为非负随机矩阵，元素不超过 $1$；又因 $0&amp;lt;\gamma&amp;lt;1$，$\gamma^k\rightarrow0$，所以 $\delta_k\rightarrow0$。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 证明的核心
Bellman 更新每轮都让旧误差乘上 $\gamma P_\pi$。转移矩阵只重新分配误差，而折扣因子 $\gamma&amp;lt;1$ 持续缩小误差，最终收敛到唯一不动点。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;7.3 网格策略评估示例&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-2-7.png&quot; alt=&quot;Figure 2.7：四种策略及迭代求得的状态价值&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 左列是策略箭头，右列是对应状态价值；橙色为禁止格，青色为目标格。设置为 $r_{\text{boundary}}=r_{\text{forbidden}}=-1$、$r_{\text{target}}=1$、$\gamma=0.9$。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;上半部两种“好”策略在第 4 列顶部两个状态选择不同，却得到完全相同的价值；说明&lt;strong&gt;不同策略可能拥有相同状态价值&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;下半部两种“坏”策略包含大量直觉上不合理的动作，其价值大多为负且显著小于好策略。&lt;/li&gt;
&lt;li&gt;数值价值把“策略看起来好不好”的直觉转化为可比较的量。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;8. 从状态价值到动作价值&lt;/h2&gt;
&lt;h3&gt;8.1 定义&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!definition] 动作价值函数（action-value function）
给定策略 $\pi$，在状态 $s$ 先执行动作 $a$，随后遵循 $\pi$ 时的期望回报为
$$
q_\pi(s,a)\triangleq\mathbb E[G_t\mid S_t=s,A_t=a].
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;严格说它是“状态—动作价值”，因为它依赖 $(s,a)$，而不是只依赖动作。&lt;/p&gt;
&lt;h3&gt;8.2 状态价值与动作价值：两面关系&lt;/h3&gt;
&lt;p&gt;对动作按策略概率求全期望：&lt;/p&gt;
&lt;p&gt;$$
\boxed{v_\pi(s)=\sum_{a\in\mathcal A}\pi(a\mid s)q_\pi(s,a).}
$$&lt;/p&gt;
&lt;p&gt;因此状态价值是该状态下各动作价值按策略分布加权后的均值。&lt;/p&gt;
&lt;p&gt;另一方面，将状态价值 Bellman 方程与上式比较，得到&lt;/p&gt;
&lt;p&gt;$$
\boxed{
q_\pi(s,a)=
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)v_\pi(s&apos;).
}
$$&lt;/p&gt;
&lt;p&gt;即动作价值也是“执行该动作的即时奖励均值 + 折扣后的下一状态价值均值”。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方向&lt;/th&gt;
&lt;th&gt;公式含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi\rightarrow v_\pi$&lt;/td&gt;
&lt;td&gt;按策略 $\pi(a\mid s)$ 对同一状态的动作价值取平均&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi\rightarrow q_\pi$&lt;/td&gt;
&lt;td&gt;固定先执行 $a$，再对奖励与下一状态求期望&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;8.3 示例：策略不选的动作仍有价值&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-2-8.png&quot; alt=&quot;Figure 2.8：计算 s1 各动作价值的示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;策略在 $s_1$ 只选择 $a_2$（向右）与 $a_3$（向下），各自概率为 $0.5$：&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s_1,a_2)=-1+\gamma v_\pi(s_2),
$$&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s_1,a_3)=0+\gamma v_\pi(s_3).
$$&lt;/p&gt;
&lt;p&gt;虽然该策略不选择 $a_1,a_4,a_5$，这些动作依然有明确价值。向上或向左会撞边界并弹回 $s_1$，原地不动也留在 $s_1$，所以&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
q_\pi(s_1,a_1)&amp;amp;=-1+\gamma v_\pi(s_1),\
q_\pi(s_1,a_4)&amp;amp;=-1+\gamma v_\pi(s_1),\
q_\pi(s_1,a_5)&amp;amp;=0+\gamma v_\pi(s_1).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;策略实际采用的两个动作恢复出状态价值：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_\pi(s_1)
&amp;amp;=0.5q_\pi(s_1,a_2)+0.5q_\pi(s_1,a_3)\
&amp;amp;=0.5[-1+\gamma v_\pi(s_2)]
+0.5[0+\gamma v_\pi(s_3)].
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;为什么还要计算策略不会选的动作？因为“当前策略不选”不等于“动作不好”。当前策略可能本身不优；要寻找更优策略，就必须比较和探索其他动作。&lt;/p&gt;
&lt;h3&gt;8.4 动作价值形式的 Bellman 方程&lt;/h3&gt;
&lt;p&gt;把 $v_\pi(s&apos;)=\sum_{a&apos;\in\mathcal A(s&apos;)}\pi(a&apos;\mid s&apos;)q_\pi(s&apos;,a&apos;)$ 代入动作价值表达式：&lt;/p&gt;
&lt;p&gt;$$
\boxed{
q_\pi(s,a)=
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)
\sum_{a&apos;\in\mathcal A(s&apos;)}\pi(a&apos;\mid s&apos;)q_\pi(s&apos;,a&apos;).
}
$$&lt;/p&gt;
&lt;p&gt;该式对每个状态—动作对成立。联立后，其矩阵形式为&lt;/p&gt;
&lt;p&gt;$$
q_\pi=\tilde r+\gamma P\Pi q_\pi.
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$q_\pi$ 按状态—动作对索引，$[q_\pi]&lt;em&gt;{(s,a)}=q&lt;/em&gt;\pi(s,a)$；&lt;/li&gt;
&lt;li&gt;$\tilde r$ 也是按状态—动作对索引，$[\tilde r]&lt;em&gt;{(s,a)}=\sum&lt;/em&gt;{r\in\mathcal R}p(r\mid s,a)r$；&lt;/li&gt;
&lt;li&gt;$P$ 的行按 $(s,a)$ 索引、列按 $s&apos;$ 索引，$[P]_{(s,a),s&apos;}=p(s&apos;\mid s,a)$；&lt;/li&gt;
&lt;li&gt;$\Pi$ 把下一状态映射到策略下的动作分布，$\Pi_{s&apos;,(s&apos;,a&apos;)}=\pi(a&apos;\mid s&apos;)$，其余元素为零。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这里 $\tilde r$ 与 $P$ 只由系统模型决定，策略单独嵌入 $\Pi$。教材指出该映射也是压缩映射，具有唯一解并可迭代求解；更完整细节留给参考文献。&lt;/p&gt;
&lt;h2&gt;9. 本章总结&lt;/h2&gt;
&lt;p&gt;本章从“怎样比较策略”开始。确定性轨迹可以直接比较回报，但随机策略或随机环境会让同一状态对应多种回报，因此引入状态价值 $v_\pi(s)$，即给定状态和策略后的期望回报。&lt;/p&gt;
&lt;p&gt;回报满足 $G_t=R_{t+1}+\gamma G_{t+1}$。结合全期望公式、策略概率、奖励模型、转移模型和 Markov 性质，就得到 Bellman 方程：当前状态价值等于即时奖励均值加折扣后的后继状态价值均值。所谓 bootstrap，是用相互依赖的价值表达价值；矩阵形式表明它本质上是一组联立线性方程，而不是无法终止的循环。&lt;/p&gt;
&lt;p&gt;给定策略求解这些状态价值就是策略评估。可以使用闭式解 $(I-\gamma P_\pi)^{-1}r_\pi$，也可以反复执行 $v_{k+1}=r_\pi+\gamma P_\pi v_k$；$\gamma&amp;lt;1$ 保证误差逐步衰减。最后，动作价值 $q_\pi(s,a)$ 把评价细化到具体状态—动作对，并通过 $v_\pi$ 与策略相互联系，为后续寻找最优动作和最优策略打下基础。&lt;/p&gt;
&lt;h2&gt;教材 Q&amp;amp;A&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Q1：状态价值与回报是什么关系？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;状态价值是智能体从该状态出发、遵循给定策略时可能得到的回报的均值。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q2：为什么关注状态价值？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;状态价值可以评价策略；下一章还会基于状态价值定义最优策略。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q3：为什么关注 Bellman 方程？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;它描述全部状态价值之间的关系，是分析和求解状态价值的工具。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q4：为什么解 Bellman 方程称为策略评估？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;解方程得到给定策略的状态价值，而这些价值正用于评价该策略。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q5：为什么需要矩阵—向量形式？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Bellman 方程是针对所有状态建立的一组线性方程；矩阵—向量形式把它们集中表示，便于统一求解与分析。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q6：状态价值与动作价值是什么关系？为什么关心策略不选的动作？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;状态价值是同一状态下动作价值按策略概率的均值；动作价值则由执行动作后的即时奖励与可能到达的下一状态价值决定。当前策略不选某动作并不能证明该动作不好，寻找更优策略仍需评价和探索这些动作。&lt;/p&gt;
&lt;h2&gt;10. 一页式复习&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;回报&lt;/strong&gt;：$G_t=R_{t+1}+\gamma R_{t+2}+\cdots$，是单条轨迹上的随机量。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;状态价值&lt;/strong&gt;：$v_\pi(s)=\mathbb E[G_t\mid S_t=s]$，是从状态 $s$ 出发遵循 $\pi$ 的平均回报。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;递归关键&lt;/strong&gt;：$G_t=R_{t+1}+\gamma G_{t+1}$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Bellman 方程&lt;/strong&gt;：对策略、奖励和下一状态求期望，结构是“一步奖励 + 折扣后继价值”。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;矩阵形式&lt;/strong&gt;：$v_\pi=r_\pi+\gamma P_\pi v_\pi$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;策略评估&lt;/strong&gt;：给定 $\pi$ 求 $v_\pi$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;闭式解&lt;/strong&gt;：$v_\pi=(I-\gamma P_\pi)^{-1}r_\pi$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;迭代解&lt;/strong&gt;：$v_{k+1}=r_\pi+\gamma P_\pi v_k$，当 $\gamma&amp;lt;1$ 时收敛。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;动作价值&lt;/strong&gt;：$q_\pi(s,a)=\mathbb E[G_t\mid S_t=s,A_t=a]$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;两者关系&lt;/strong&gt;：$v_\pi(s)=\sum_a\pi(a\mid s)q_\pi(s,a)$；$q_\pi(s,a)$ 等于该动作的即时奖励均值加折扣后继状态价值均值。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;关键误区&lt;/strong&gt;：策略概率为零的动作仍有动作价值；Bellman 方程必须对所有状态联立理解。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;11. 公式清单&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;公式&lt;/th&gt;
&lt;th&gt;名称&lt;/th&gt;
&lt;th&gt;作用&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$G_t=R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots$&lt;/td&gt;
&lt;td&gt;折扣回报&lt;/td&gt;
&lt;td&gt;评价一条轨迹的长期奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$G_t=R_{t+1}+\gamma G_{t+1}$&lt;/td&gt;
&lt;td&gt;回报递归&lt;/td&gt;
&lt;td&gt;导出 Bellman 结构&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi(s)=\mathbb E[G_t\mid S_t=s]$&lt;/td&gt;
&lt;td&gt;状态价值&lt;/td&gt;
&lt;td&gt;评价给定状态下的策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi(s)=\sum_a\pi(a\mid s)[\sum_r p(r\mid s,a)r+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_\pi(s&apos;)]$&lt;/td&gt;
&lt;td&gt;状态价值 Bellman 方程&lt;/td&gt;
&lt;td&gt;联立描述所有状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi=r_\pi+\gamma P_\pi v_\pi$&lt;/td&gt;
&lt;td&gt;矩阵 Bellman 方程&lt;/td&gt;
&lt;td&gt;将逐状态方程写成线性系统&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi=(I-\gamma P_\pi)^{-1}r_\pi$&lt;/td&gt;
&lt;td&gt;闭式策略评估&lt;/td&gt;
&lt;td&gt;理论分析或小规模求解&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{k+1}=r_\pi+\gamma P_\pi v_k$&lt;/td&gt;
&lt;td&gt;迭代策略评估&lt;/td&gt;
&lt;td&gt;不显式求逆地逼近价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi(s,a)=\mathbb E[G_t\mid S_t=s,A_t=a]$&lt;/td&gt;
&lt;td&gt;动作价值&lt;/td&gt;
&lt;td&gt;评价在状态中先执行某动作&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi(s)=\sum_a\pi(a\mid s)q_\pi(s,a)$&lt;/td&gt;
&lt;td&gt;从动作价值到状态价值&lt;/td&gt;
&lt;td&gt;按策略对动作价值取期望&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi(s,a)=\sum_r p(r\mid s,a)r+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_\pi(s&apos;)$&lt;/td&gt;
&lt;td&gt;从状态价值到动作价值&lt;/td&gt;
&lt;td&gt;一步前瞻评价具体动作&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi=\tilde r+\gamma P\Pi q_\pi$&lt;/td&gt;
&lt;td&gt;动作价值矩阵 Bellman 方程&lt;/td&gt;
&lt;td&gt;联立描述所有状态—动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;12. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$S_t,A_t,R_{t+1}$&lt;/td&gt;
&lt;td&gt;时刻 $t$ 的状态、动作及随后获得的奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$G_t$&lt;/td&gt;
&lt;td&gt;从时刻 $t$ 开始的折扣回报&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\gamma$&lt;/td&gt;
&lt;td&gt;折扣率，教材设 $\gamma\in(0,1)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi(a\mid s)$&lt;/td&gt;
&lt;td&gt;策略在状态 $s$ 选择动作 $a$ 的概率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi(s)$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 下状态 $s$ 的价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi(s,a)$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 下状态—动作对 $(s,a)$ 的价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$p(r\mid s,a)$&lt;/td&gt;
&lt;td&gt;在 $(s,a)$ 后得到奖励 $r$ 的概率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$p(s&apos;\mid s,a)$&lt;/td&gt;
&lt;td&gt;在 $(s,a)$ 后转移到 $s&apos;$ 的概率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$r_\pi(s)$&lt;/td&gt;
&lt;td&gt;策略下状态 $s$ 的平均即时奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$P_\pi$&lt;/td&gt;
&lt;td&gt;策略诱导的状态转移矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_k$&lt;/td&gt;
&lt;td&gt;第 $k$ 次迭代的价值向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_k$&lt;/td&gt;
&lt;td&gt;迭代误差 $v_k-v_\pi$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\tilde r$&lt;/td&gt;
&lt;td&gt;按状态—动作对索引的平均即时奖励向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$P$&lt;/td&gt;
&lt;td&gt;从状态—动作对到下一状态的转移矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Pi$&lt;/td&gt;
&lt;td&gt;在下一状态按策略选择动作的矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;13. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;English&lt;/th&gt;
&lt;th&gt;中文&lt;/th&gt;
&lt;th&gt;简要解释&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;return&lt;/td&gt;
&lt;td&gt;回报&lt;/td&gt;
&lt;td&gt;一条轨迹上折扣奖励之和&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;state value&lt;/td&gt;
&lt;td&gt;状态价值&lt;/td&gt;
&lt;td&gt;给定状态与策略后的期望回报&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;state-value function&lt;/td&gt;
&lt;td&gt;状态价值函数&lt;/td&gt;
&lt;td&gt;将每个状态映射到其状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Bellman equation&lt;/td&gt;
&lt;td&gt;Bellman 方程 / 贝尔曼方程&lt;/td&gt;
&lt;td&gt;描述当前价值与后继价值关系的方程组&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;bootstrapping&lt;/td&gt;
&lt;td&gt;自举&lt;/td&gt;
&lt;td&gt;用价值之间的递归关系计算价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;policy evaluation&lt;/td&gt;
&lt;td&gt;策略评估&lt;/td&gt;
&lt;td&gt;给定策略，求其状态价值或动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;matrix-vector form&lt;/td&gt;
&lt;td&gt;矩阵—向量形式&lt;/td&gt;
&lt;td&gt;将所有逐状态方程合并成线性系统&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;closed-form solution&lt;/td&gt;
&lt;td&gt;闭式解&lt;/td&gt;
&lt;td&gt;通过矩阵逆直接表示解&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;iterative solution&lt;/td&gt;
&lt;td&gt;迭代解&lt;/td&gt;
&lt;td&gt;重复 Bellman 更新逐步逼近解&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action value&lt;/td&gt;
&lt;td&gt;动作价值&lt;/td&gt;
&lt;td&gt;在某状态先采取某动作后的期望回报&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;contraction mapping&lt;/td&gt;
&lt;td&gt;压缩映射&lt;/td&gt;
&lt;td&gt;迭代会缩小差异并趋向唯一不动点的映射&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;14. 常见误区&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 状态价值等于每次实际回报
只有策略和系统模型都确定时，两者才相等。只要存在随机性，$G_t$ 会随轨迹变化，而 $v_\pi(s)$ 是这些回报的条件均值。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] $v_\pi(s)$ 依赖另一个未知的 $v_\pi(s&apos;)$，所以无法计算
Bellman 方程是对所有状态同时成立的方程组。将它们写成 $v_\pi=r_\pi+\gamma P_\pi v_\pi$ 后即可闭式或迭代求解。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] Bellman 方程描述的是最优策略
本章方程评价的是一个&lt;strong&gt;给定策略&lt;/strong&gt; $\pi$。最优性 Bellman 方程是下一章的主题。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 动作价值只由动作决定
$q_\pi(s,a)$ 依赖状态—动作对；同一动作在不同状态可能产生完全不同的奖励和后继状态。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 策略不选择的动作可以把价值设为零
$\pi(a\mid s)=0$ 只表示当前策略不选它，不表示执行它后的期望回报为零。比较这些动作正是改进策略所需要的信息。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 显式求逆总是首选
闭式公式适合分析，但实际计算矩阵逆仍有成本。本章给出的 Bellman 迭代可以直接逼近解。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;15. 自测题&lt;/h2&gt;
&lt;h3&gt;15.1 概念题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;随机系统中，为什么用状态价值比用某一条轨迹的回报评价策略更正式？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;同一状态出发可能生成多条轨迹和多个回报。状态价值对这些可能回报取条件期望，反映策略在该状态下的平均长期表现，而不是一次随机结果。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;为什么“求 Bellman 方程”称为策略评估？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;给定策略 $\pi$ 后，解 Bellman 方程会得到所有 $v_\pi(s)$；状态价值又是评价该策略在各状态长期表现的指标，因此这一求解过程就是策略评估。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;判断：若 $\pi(a\mid s)=0$，则 $q_\pi(s,a)=0$。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;错误。策略概率为零只说明当前策略不选择该动作。动作价值仍由执行该动作后的即时奖励与后继价值决定。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;15.2 计算与推导题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;某状态 $s$ 在策略下以 $0.25$ 概率选择动作 $a_1$、以 $0.75$ 概率选择 $a_2$。若 $q_\pi(s,a_1)=4$、$q_\pi(s,a_2)=8$，求 $v_\pi(s)$。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s)=0.25\times4+0.75\times8=7.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;从 $G_t$ 的定义推导 $G_t=R_{t+1}+\gamma G_{t+1}$，并说明它为何是 Bellman 方程的起点。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
G_t
&amp;amp;=R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots\
&amp;amp;=R_{t+1}+\gamma(R_{t+2}+\gamma R_{t+3}+\cdots)\
&amp;amp;=R_{t+1}+\gamma G_{t+1}.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;它把完整长期回报分成“一步奖励”和“从下一时刻继续的回报”。对两边在给定状态下取条件期望，便得到当前状态价值与后继状态价值的递归关系。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;已知&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
r_\pi=\begin{bmatrix}1\0\end{bmatrix},\qquad
P_\pi=\begin{bmatrix}0&amp;amp;1\1&amp;amp;0\end{bmatrix},\qquad
\gamma=0.5,
$$&lt;/p&gt;
&lt;p&gt;写出两个逐状态 Bellman 方程。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s_1)=1+0.5v_\pi(s_2),
$$&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s_2)=0+0.5v_\pi(s_1).
$$&lt;/p&gt;
&lt;p&gt;联立可得 $v_\pi(s_1)=4/3$、$v_\pi(s_2)=2/3$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;在迭代策略评估中，为什么任意初始 $v_0$ 都能收敛到同一个 $v_\pi$？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;误差满足 $\delta_{k+1}=\gamma P_\pi\delta_k$，从而 $\delta_k=\gamma^kP_\pi^k\delta_0$。$P_\pi^k$ 不会产生无界放大，而 $\gamma^k\rightarrow0$，所以任何有限初始误差最终都趋于零，极限是 Bellman 方程的唯一解。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;简述状态价值 Bellman 方程与动作价值 Bellman 方程中策略 $\pi$ 出现的位置差异。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;状态价值方程在当前状态先按 $\pi(a\mid s)$ 对动作求平均；动作价值方程已固定当前动作 $a$，因此当前步不再按策略平均，但到达 $s&apos;$ 后要按 $\pi(a&apos;\mid s&apos;)$ 对下一动作求平均。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 1 — Basic Concepts</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-1-basic-concepts/chapter-1-basic-concepts/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-1-basic-concepts/chapter-1-basic-concepts/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 1 — Basic Concepts&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章目标
本章用一个 $3\times 3$ 网格世界建立强化学习的基本语言：状态、动作、状态转移、策略、奖励、轨迹、回报、回合，以及把这些概念统一起来的马尔可夫决策过程（Markov decision process, MDP）。这些对象不是孤立名词：Bellman Equation 会在 MDP 与 Markov 性质上递归分解回报；Bellman Optimality Equation、Value Iteration 与 Policy Iteration 会据此寻找更优策略；Monte Carlo 与 Temporal-Difference 方法会用经验轨迹估计长期回报；后续 Value Function、Policy Gradient 和 Actor-Critic 方法则分别从价值、策略或两者结合的角度表示和改进决策。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识地图&lt;/h2&gt;
&lt;p&gt;Figure 1.1 把全书分成“基础工具”和“算法/方法”两层。本章是基础工具的入口，向后连接 Bellman Equation（Chapter 2）与 Bellman Optimality Equation（Chapter 3）。在算法层，Value/Policy Iteration（Chapter 4）使用模型，Monte Carlo（Chapter 5）不使用模型；Stochastic Approximation（Chapter 6）与 Temporal-Difference（Chapter 7）引出增量方法；之后从表格表示转向函数表示（Chapter 8），再到 Policy Gradient（Chapter 9）以及结合 policy-based 与 value-based 思路的 Actor-Critic（Chapter 10）。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-1-1.png&quot; alt=&quot;Figure 1.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：第 1—10 章之间的依赖、方法类别与表示方式的演进。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：本章提供后续所有方法共同使用的 MDP 基本对象。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：Chapter 1 位于“Fundamental tools”的起点；Chapter 4 与 Chapter 5 的主要区分是 with model / without model；Chapter 7 之后逐步从 tabular representation 走向 function representation。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：本章定义的 $p(s&apos;|s,a)$、$p(r|s,a)$、$\pi(a|s)$ 和回报 $G_t$，正是后续 Bellman 方程和各种求解算法操作的对象。&lt;/li&gt;
&lt;/ul&gt;
&lt;pre&gt;&lt;code&gt;flowchart LR
    SA[&quot;状态与动作&amp;lt;br/&amp;gt;s, a&quot;] --&amp;gt; T[&quot;状态转移&amp;lt;br/&amp;gt;p(s&apos;|s,a)&quot;]
    T --&amp;gt; P[&quot;策略&amp;lt;br/&amp;gt;π(a|s)&quot;]
    P --&amp;gt; R[&quot;奖励&amp;lt;br/&amp;gt;r 或 p(r|s,a)&quot;]
    R --&amp;gt; TR[&quot;轨迹&amp;lt;br/&amp;gt;状态-动作-奖励链&quot;]
    TR --&amp;gt; G[&quot;回报&amp;lt;br/&amp;gt;G 或 G_t&quot;]
    G --&amp;gt; M[&quot;MDP&amp;lt;br/&amp;gt;集合 + 模型 + 策略 + Markov 性质&quot;]
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;这条链不是严格的执行时间顺序，而是一条学习路径：先说清楚系统“在哪里、能做什么”，再描述动作带来的环境响应与反馈，最后用轨迹和回报评价策略，并由 MDP 统一形式化。&lt;/p&gt;
&lt;h2&gt;1. Grid World 示例&lt;/h2&gt;
&lt;p&gt;网格世界由 $3\times 3$ 个格子组成。机器人是智能体（agent），网格以及决定移动结果和奖励的规则构成环境（environment）。每个时刻，智能体只占据一个格子，并可以尝试移动到相邻格子。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;白色格&lt;/strong&gt;：可正常进入的格子。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;禁止格&lt;/strong&gt;：橙色的 $s_6$、$s_7$。本章允许进入，但进入会受到负奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;目标格&lt;/strong&gt;：青色的 $s_9$，智能体希望到达这里。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;智能体的目标&lt;/strong&gt;：从任意初始格出发，找到一条“好”的策略到达目标，同时避免禁止格、无意义绕路和撞击边界。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-1-2.png&quot; alt=&quot;Figure 1.2：Grid World 示例&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：起点、机器人、两个禁止格、目标格及一条示意路径。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：强化学习任务是智能体与环境反复交互并改进行为规则。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：禁止格不是墙；图中路径只是一条示意轨迹，不是状态空间本身，也不是唯一策略。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：九个格子将形成状态空间 $\mathcal S$；每一步移动对应动作 $a$、状态转移 $s\to s&apos;$ 和奖励 $r$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;若地图及移动规则全部已知，直接规划一条到目标的路线相对简单；若智能体事先不知道环境，就必须通过试错（trial and error）执行动作、观察新状态和奖励，再逐渐找到好策略。这里的“试错”不是随意乱走，而是用交互结果识别哪些状态—动作组合会碰边界、进入禁止格或到达目标。&lt;/p&gt;
&lt;p&gt;“好策略”不是只要求最终到达 $s_9$。原书同时要求它尽量避免禁止格、边界碰撞和不必要的绕路，因此策略优劣必须结合整条轨迹的累计结果来判断。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 直观理解
可以把网格世界看成一个没有预先给出说明书的迷宫：状态回答“我现在在哪里”，动作回答“我准备怎么走”，环境决定“实际走到哪里”，奖励给出“这一步是否符合目标”，策略则是“在每个位置准备采用什么走法”的整套规则。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;2. 状态与动作&lt;/h2&gt;
&lt;h3&gt;2.1 状态&lt;/h3&gt;
&lt;p&gt;状态（state）描述智能体相对于环境的当前状况。在本例中，只要知道机器人位于哪个格子，就足以描述后续移动，因此“格子位置”可以作为状态。九个位置分别记为 $s_1,s_2,\ldots,s_9$，所有可能状态构成状态空间（state space）：&lt;/p&gt;
&lt;p&gt;$$
\mathcal{S} = {s_1,s_2,\ldots,s_9}.
$$&lt;/p&gt;
&lt;p&gt;状态不是机器人本身，也不是某个动作；它是决策时用于概括当前情形的信息。网格位置之所以可用，是因为本章假定同一位置下，下一步的转移与奖励规则相同。&lt;/p&gt;
&lt;h3&gt;2.2 动作&lt;/h3&gt;
&lt;p&gt;动作（action）是智能体可以尝试执行的决策：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;动作&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$a_1$&lt;/td&gt;
&lt;td&gt;向上&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$a_2$&lt;/td&gt;
&lt;td&gt;向右&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$a_3$&lt;/td&gt;
&lt;td&gt;向下&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$a_4$&lt;/td&gt;
&lt;td&gt;向左&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$a_5$&lt;/td&gt;
&lt;td&gt;保持不动&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;全局动作空间（action space）为&lt;/p&gt;
&lt;p&gt;$$
\mathcal{A} = {a_1,a_2,a_3,a_4,a_5}.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-1-3.png&quot; alt=&quot;Figure 1.3：状态和动作&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：左图给出九个状态及禁止格、目标格的位置；右图给出四个方向动作和原地不动动作。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：状态是位置的编号，动作是从当前位置发出的控制选择。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：$a_5$ 不是“没有定义动作”，而是明确选择保持不动；$s_6$、$s_7$ 虽是禁止格，仍属于状态空间。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：左图枚举 $\mathcal S$，右图枚举 $\mathcal A$，二者共同定义状态—动作对 $(s,a)$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2.3 全局动作空间与状态相关动作空间&lt;/h3&gt;
&lt;p&gt;一种建模方法是只保留物理上不会撞边界的动作。例如在左上角 $s_1$，向上 $a_1$ 和向左 $a_4$ 会撞边界，于是可以定义&lt;/p&gt;
&lt;p&gt;$$
\mathcal{A}(s_1)={a_2,a_3,a_5}.
$$&lt;/p&gt;
&lt;p&gt;另一种方法是让每个状态都有相同的全局动作空间：&lt;/p&gt;
&lt;p&gt;$$
\mathcal{A}(s_i)=\mathcal{A}={a_1,a_2,a_3,a_4,a_5},\qquad \forall i.
$$&lt;/p&gt;
&lt;p&gt;本书采用第二种、更一般的方式。边界动作仍可被选择，只是环境会把智能体弹回原状态并给予边界惩罚。这种表示把“能否选择动作”和“动作执行后会发生什么”分开：前者属于动作空间，后者属于状态转移与奖励规则。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 常见误区&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;状态不是动作：$s_1$ 表示当前位置，$a_2$ 表示向右的选择。&lt;/li&gt;
&lt;li&gt;状态空间不是一条实际轨迹：$\mathcal S$ 列出所有可能状态；轨迹只记录一次交互实际访问的顺序。&lt;/li&gt;
&lt;li&gt;动作可选不代表动作一定产生预期结果：动作表达智能体的意图，下一状态由环境的转移规则决定；随机环境中结果尤其可能偏离意图。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h2&gt;3. 状态转移&lt;/h2&gt;
&lt;h3&gt;3.1 状态转移的基本形式&lt;/h3&gt;
&lt;p&gt;状态转移（state transition）是执行动作后从当前状态到下一状态的过程。例如在 $s_1$ 选择向右 $a_2$：&lt;/p&gt;
&lt;p&gt;$$
s_1 \xrightarrow{a_2} s_2.
$$&lt;/p&gt;
&lt;p&gt;箭头左侧是当前状态，箭头上的标记是动作，右侧是环境产生的下一状态。&lt;/p&gt;
&lt;h3&gt;3.2 撞击边界&lt;/h3&gt;
&lt;p&gt;若在 $s_1$ 选择向上 $a_1$，机器人不可能离开状态空间，因此被边界“弹回”，仍在 $s_1$：
$$
s_1 \xrightarrow{a_1} s_1.
$$
这是一条自转移。虽然下一状态没变，但动作确实执行过，并会按奖励规则得到 $r_{\text{boundary}}=-1$。&lt;/p&gt;
&lt;h3&gt;3.3 进入禁止格&lt;/h3&gt;
&lt;p&gt;禁止格有两种常见建模方式：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;可进入&lt;/strong&gt;：如在 $s_5$ 选择 $a_2$，下一状态为 $s_6$，即 $s_5\xrightarrow{a_2}s_6$，同时受到惩罚。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;不可进入&lt;/strong&gt;：若禁止区域由墙围住，同一动作会被弹回，得到 $s_5\xrightarrow{a_2}s_5$。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;采用哪种方式取决于物理环境或仿真设计。本章采用第一种：禁止格可进入，但进入会受到负奖励。现实任务中的转移由真实动力学决定；仿真任务则可按问题需要定义。&lt;/p&gt;
&lt;h3&gt;3.4 状态转移表&lt;/h3&gt;
&lt;p&gt;Table 1.1 逐项给出当前状态与动作确定的下一状态。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;当前状态&lt;/th&gt;
&lt;th&gt;$a_1$（向上）&lt;/th&gt;
&lt;th&gt;$a_2$（向右）&lt;/th&gt;
&lt;th&gt;$a_3$（向下）&lt;/th&gt;
&lt;th&gt;$a_4$（向左）&lt;/th&gt;
&lt;th&gt;$a_5$（不动）&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$s_5$&lt;/td&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$s_6$&lt;/td&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$s_5$&lt;/td&gt;
&lt;td&gt;$s_7$&lt;/td&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_5$&lt;/td&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$s_6$&lt;/td&gt;
&lt;td&gt;$s_8$&lt;/td&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$s_5$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_6$&lt;/td&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$s_6$&lt;/td&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;td&gt;$s_5$&lt;/td&gt;
&lt;td&gt;$s_6$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_7$&lt;/td&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$s_8$&lt;/td&gt;
&lt;td&gt;$s_7$&lt;/td&gt;
&lt;td&gt;$s_7$&lt;/td&gt;
&lt;td&gt;$s_7$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_8$&lt;/td&gt;
&lt;td&gt;$s_5$&lt;/td&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;td&gt;$s_8$&lt;/td&gt;
&lt;td&gt;$s_7$&lt;/td&gt;
&lt;td&gt;$s_8$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;td&gt;$s_6$&lt;/td&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;td&gt;$s_8$&lt;/td&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;assets/table-1-1.png&quot; alt=&quot;Table 1.1：状态转移表原图&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：全部 $9\times5$ 个状态—动作对对应的下一状态。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：本例的转移是一个确定性查表规则。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：碰边界会原地不动；禁止格 $s_6,s_7$ 可进入；从 $s_9$ 执行不同动作可能留在 $s_9$ 或离开到 $s_6,s_8$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：表中每个单元格都等价于某个概率为 1 的 $p(s&apos;|s,a)$，其他候选下一状态概率为 0。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.5 状态转移概率&lt;/h3&gt;
&lt;p&gt;状态转移概率&lt;/p&gt;
&lt;p&gt;$$
p(s&apos;|s,a)
$$&lt;/p&gt;
&lt;p&gt;表示：已知当前状态为 $s$ 且执行动作 $a$ 时，下一状态为 $s&apos;$ 的条件概率。原书例子中，$s_1$ 向右必到 $s_2$：&lt;/p&gt;
&lt;p&gt;$$
p(s_2|s_1,a_2)=1.
$$&lt;/p&gt;
&lt;p&gt;对这个固定的 $(s_1,a_2)$，可能的下一状态形成一个完整概率分布：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
p(s_1|s_1,a_2)&amp;amp;=0,\
p(s_2|s_1,a_2)&amp;amp;=1,\
p(s_3|s_1,a_2)&amp;amp;=0,\
p(s_4|s_1,a_2)&amp;amp;=0,\
p(s_5|s_1,a_2)&amp;amp;=0.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其余 $s_6,s_7,s_8,s_9$ 的概率同样为 0。原因不是这些状态“不存在”，而是本例的确定性动力学规定这一步只能到达 $s_2$。&lt;/p&gt;
&lt;h3&gt;3.6 确定性与随机性状态转移&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;对比项&lt;/th&gt;
&lt;th&gt;确定性状态转移（deterministic）&lt;/th&gt;
&lt;th&gt;随机性状态转移（stochastic）&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;定义&lt;/td&gt;
&lt;td&gt;给定 $(s,a)$ 后，下一状态唯一确定&lt;/td&gt;
&lt;td&gt;给定 $(s,a)$ 后，下一状态仍有多个可能结果&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;数学形式&lt;/td&gt;
&lt;td&gt;某个 $s&apos;$ 的概率为 1，其余为 0&lt;/td&gt;
&lt;td&gt;多个 $s&apos;$ 可有大于 0 的概率，且总和为 1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;网格世界例子&lt;/td&gt;
&lt;td&gt;$p(s_2\mid s_1,a_2)=1$&lt;/td&gt;
&lt;td&gt;有随机风时，向右也可能被吹到 $s_5$，故 $p(s_5\mid s_1,a_2)&amp;gt;0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;表示方式&lt;/td&gt;
&lt;td&gt;下一状态表足够直观&lt;/td&gt;
&lt;td&gt;必须用完整条件概率分布描述&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;原书的网格世界为简化起见采用确定性转移；随机风只是用来说明更一般的随机情形。&lt;/p&gt;
&lt;h2&gt;4. 策略&lt;/h2&gt;
&lt;h3&gt;4.1 策略是什么&lt;/h3&gt;
&lt;p&gt;策略（policy）规定智能体在各个状态下选择什么动作。它不是一次走过的路线，而是一套覆盖所有状态的决策规则。遵循同一策略，从不同初始状态出发，访问的前缀不同，因此可以得到不同轨迹；这些轨迹仍由同一套状态到动作的映射产生。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-1-4.png&quot; alt=&quot;Figure 1.4：确定性策略与不同初始状态产生的轨迹&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：上图用箭头给出每个状态的确定性动作，下图展示三个不同初始状态得到的轨迹。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：策略是全局规则，轨迹是从某个初始状态实际展开的结果。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：绿色箭头属于策略；红色虚线属于轨迹。改变初始状态会改变轨迹，但不改变图中的策略。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：每个绿色箭头表示对应动作的 $\pi(a|s)=1$；轨迹还需结合环境转移 $p(s&apos;|s,a)$ 才能生成。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;4.2 策略的数学表示&lt;/h3&gt;
&lt;p&gt;策略写为&lt;/p&gt;
&lt;p&gt;$$
\pi(a|s),
$$&lt;/p&gt;
&lt;p&gt;表示在状态 $s$ 下选择动作 $a$ 的条件概率。对每个固定状态，可选动作的概率必须归一化：&lt;/p&gt;
&lt;p&gt;$$
\sum_{a\in\mathcal{A}(s)}\pi(a|s)=1.
$$&lt;/p&gt;
&lt;p&gt;这里求和的是“在同一个状态下可选择的所有动作”，不是对状态或下一状态求和。&lt;/p&gt;
&lt;h3&gt;4.3 确定性策略&lt;/h3&gt;
&lt;p&gt;Figure 1.4 中 $s_1$ 的策略为&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\pi(a_1|s_1)&amp;amp;=0,\
\pi(a_2|s_1)&amp;amp;=1,\
\pi(a_3|s_1)&amp;amp;=0,\
\pi(a_4|s_1)&amp;amp;=0,\
\pi(a_5|s_1)&amp;amp;=0.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;$\pi(a_2|s_1)=1$ 表示只要处于 $s_1$，策略必然选择向右；它描述动作选择的确定性，而不是直接断言下一状态。下一状态仍由环境转移模型决定。在本章的确定性环境中，这一选择随后令智能体到达 $s_2$。&lt;/p&gt;
&lt;h3&gt;4.4 随机策略&lt;/h3&gt;
&lt;p&gt;随机策略允许同一状态下以不同概率选择多个动作。在 $s_1$，Figure 1.5 规定&lt;/p&gt;
&lt;p&gt;$$
\pi(a_2|s_1)=0.5,
$$&lt;/p&gt;
&lt;p&gt;$$
\pi(a_3|s_1)=0.5,
$$&lt;/p&gt;
&lt;p&gt;其余三个动作概率为 0。因而从相同的 $s_1$ 出发，多次执行策略可能先向右，也可能先向下。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-1-5.png&quot; alt=&quot;Figure 1.5：随机策略&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：在 $s_1$，向右和向下两条选择分支各有 $0.5$ 的概率，并绘出相应路径。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：随机性可以来自策略本身，即智能体的动作选择不唯一。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：图中的 $0.5$ 是动作概率 $\pi(a|s)$，不是风把智能体吹向某处的转移概率。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：$\pi(a_2|s_1)+\pi(a_3|s_1)=0.5+0.5=1$，满足策略归一化。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;4.5 策略的表格表示&lt;/h3&gt;
&lt;p&gt;Table 1.2 将 Figure 1.5 的随机策略存成表格。行是状态，列是动作，单元格是 $\pi(a_j|s_i)$。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;状态&lt;/th&gt;
&lt;th&gt;$a_1$（向上）&lt;/th&gt;
&lt;th&gt;$a_2$（向右）&lt;/th&gt;
&lt;th&gt;$a_3$（向下）&lt;/th&gt;
&lt;th&gt;$a_4$（向左）&lt;/th&gt;
&lt;th&gt;$a_5$（不动）&lt;/th&gt;
&lt;th&gt;行和&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0.5&lt;/td&gt;
&lt;td&gt;0.5&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_5$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_6$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_7$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_8$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;assets/table-1-2.png&quot; alt=&quot;Table 1.2：策略概率表原图&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：九个状态上五个动作的选择概率。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：tabular representation（表格表示）把有限状态、有限动作下的策略完整枚举出来。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：每一行对应一个条件概率分布，所以行和必须为 1；只有 $s_1$ 一行含两个非零概率，其余各行都是确定性选择。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：表中第 $i$ 行第 $j$ 列就是 $\pi(a_j|s_i)$，每行满足 $\sum_a\pi(a|s_i)=1$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;策略和状态转移的区别&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;对比项&lt;/th&gt;
&lt;th&gt;策略 $\pi(a\mid s)$&lt;/th&gt;
&lt;th&gt;状态转移 $p(s&apos;\mid s,a)$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;由谁决定&lt;/td&gt;
&lt;td&gt;智能体&lt;/td&gt;
&lt;td&gt;环境动力学或仿真规则&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;条件&lt;/td&gt;
&lt;td&gt;当前状态 $s$&lt;/td&gt;
&lt;td&gt;当前状态 $s$ 与已执行动作 $a$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;随机变量&lt;/td&gt;
&lt;td&gt;选择的动作 $a$&lt;/td&gt;
&lt;td&gt;产生的下一状态 $s&apos;$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;回答的问题&lt;/td&gt;
&lt;td&gt;“我在 $s$ 时选什么？”&lt;/td&gt;
&lt;td&gt;“在 $s$ 执行 $a$ 后会到哪里？”&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$ 例子&lt;/td&gt;
&lt;td&gt;$\pi(a_2\mid s_1)=0.5$ 表示有一半概率选向右&lt;/td&gt;
&lt;td&gt;$p(s_2\mid s_1,a_2)=1$ 表示一旦选向右就必到 $s_2$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 本章最重要的区别之一
策略的随机性来自智能体如何选动作；状态转移的随机性来自环境如何响应动作。二者可以同时是确定性的、同时是随机的，也可以一方确定而另一方随机。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;5. 奖励&lt;/h2&gt;
&lt;h3&gt;5.1 奖励的定义&lt;/h3&gt;
&lt;p&gt;智能体在状态 $s$ 执行动作 $a$ 后，会从环境获得奖励（reward）$r$。在本章的确定性写法中，奖励可记为&lt;/p&gt;
&lt;p&gt;$$
r=r(s,a).
$$&lt;/p&gt;
&lt;p&gt;奖励是环境给出的标量反馈，可以是正数、负数或零。正奖励通常鼓励相应行为，负奖励通常抑制相应行为，但真正决定策略优劣的是长期累计的相对结果，而不是单个数值的正负。&lt;/p&gt;
&lt;h3&gt;5.2 本章的奖励设计&lt;/h3&gt;
&lt;p&gt;$$
r_{\text{boundary}}=-1,
$$&lt;/p&gt;
&lt;p&gt;表示尝试越过网格边界；&lt;/p&gt;
&lt;p&gt;$$
r_{\text{forbidden}}=-1,
$$&lt;/p&gt;
&lt;p&gt;表示尝试进入禁止格；&lt;/p&gt;
&lt;p&gt;$$
r_{\text{target}}=+1,
$$&lt;/p&gt;
&lt;p&gt;表示到达目标状态；其余普通情况为&lt;/p&gt;
&lt;p&gt;$$
r_{\text{other}}=0.
$$&lt;/p&gt;
&lt;p&gt;这些规则把任务偏好编码为反馈：希望到达目标，同时避免撞边界和踏入禁止区域。&lt;/p&gt;
&lt;h3&gt;5.3 目标状态的特殊情况&lt;/h3&gt;
&lt;p&gt;本章到达 $s_9$ 后不强制停止。两个动作展示了“下一状态相同，奖励却不同”：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;在 $s_9$ 执行 $a_5$，仍处于 $s_9$，并得到 $r_{\text{target}}=+1$。&lt;/li&gt;
&lt;li&gt;在 $s_9$ 执行 $a_2$，向右碰到边界，仍处于 $s_9$，但得到 $r_{\text{boundary}}=-1$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此，奖励不能只由“状态是否改变”判断。两次转移都得到 $s&apos;=s_9$，但动作语义和奖励规则不同。Table 1.3 中 $s_9$ 行还表明：$a_1$ 会进入禁止格 $s_6$，$a_4$ 会正常移动到 $s_8$。&lt;/p&gt;
&lt;h3&gt;5.4 奖励作为人机接口&lt;/h3&gt;
&lt;p&gt;奖励可理解为人和学习系统之间的接口。任务设计者不必为每个状态直接编写完整路线，而是定义哪些结果值得追求、哪些应避免；智能体再通过与环境交互学习能获得较高长期回报的策略。复杂任务中的奖励设计仍然困难，因为设计者必须理解任务目标，避免反馈与真实意图不一致。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip]
奖励告诉 agent 什么结果值得追求，但通常不会直接告诉 agent 应该走哪条路径。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.5 奖励表&lt;/h3&gt;
&lt;p&gt;Table 1.3 给出所有状态—动作对的确定性即时奖励。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;状态&lt;/th&gt;
&lt;th&gt;$a_1$（向上）&lt;/th&gt;
&lt;th&gt;$a_2$（向右）&lt;/th&gt;
&lt;th&gt;$a_3$（向下）&lt;/th&gt;
&lt;th&gt;$a_4$（向左）&lt;/th&gt;
&lt;th&gt;$a_5$（不动）&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{forbidden}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$r_{\text{forbidden}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_5$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$r_{\text{forbidden}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_6$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{target}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$r_{\text{forbidden}}$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_7$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{forbidden}}$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_8$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$r_{\text{target}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{forbidden}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;td&gt;$r_{\text{forbidden}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$r_{\text{boundary}}$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$r_{\text{target}}$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;其中 $r_{\text{boundary}}=-1$、$r_{\text{forbidden}}=-1$、$r_{\text{target}}=+1$。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/table-1-3.png&quot; alt=&quot;Table 1.3：奖励表原图&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：每个 $(s,a)$ 执行后立即获得的奖励类别。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：同一动作在不同状态、同一状态下的不同动作，都可能得到不同奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：该表是即时奖励表，不是回报表；$s_9$ 的多个自转移可能对应不同奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：确定性时单元格给出 $r(s,a)$；随机奖励时需改用 $p(r|s,a)$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;5.6 为什么不能只选择即时奖励最大的动作&lt;/h3&gt;
&lt;p&gt;即时奖励（immediate reward）只评价刚执行的一步；策略目标需要考虑之后所有奖励形成的长期回报。当前最大奖励动作可能把智能体带入未来较差的区域，也可能只是让它停滞，无法获得后续目标奖励。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!example] 补充理解
在 $s_4$，$a_1$、$a_2$ 和 $a_5$ 的即时奖励都是 0。若只按“当前最大值”并一直选 $a_5$，智能体会原地不动，永远得不到目标奖励；而选择 $a_2$ 可走向 $s_5$，再经 $s_8$ 到达 $s_9$ 并得到 $+1$。即时奖励相同，不代表长期结果相同。相反，经 $s_7$ 的路径会吃到禁止格奖励 $-1$，即使随后也能到目标，其总回报仍更低。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.7 随机奖励&lt;/h3&gt;
&lt;p&gt;更一般的奖励过程用&lt;/p&gt;
&lt;p&gt;$$
p(r|s,a)
$$&lt;/p&gt;
&lt;p&gt;表示给定状态和动作后，获得奖励值 $r$ 的概率。本章表格是确定性奖励，例如&lt;/p&gt;
&lt;p&gt;$$
p(r=-1|s_1,a_1)=1,
\qquad
p(r\neq-1|s_1,a_1)=0.
$$&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;对比项&lt;/th&gt;
&lt;th&gt;确定性奖励&lt;/th&gt;
&lt;th&gt;随机性奖励&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;结果&lt;/td&gt;
&lt;td&gt;给定 $(s,a)$ 后奖励唯一&lt;/td&gt;
&lt;td&gt;给定 $(s,a)$ 后奖励仍可能取多个值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;表示&lt;/td&gt;
&lt;td&gt;$r(s,a)$ 或概率集中在一个值上&lt;/td&gt;
&lt;td&gt;完整分布 $p(r\mid s,a)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;原书例子&lt;/td&gt;
&lt;td&gt;$s_1$ 向上必得 $-1$&lt;/td&gt;
&lt;td&gt;学生努力学习通常得到正反馈，但具体考试成绩仍不确定&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;6. 轨迹、回报与回合&lt;/h2&gt;
&lt;h3&gt;6.1 轨迹&lt;/h3&gt;
&lt;p&gt;轨迹（trajectory）是一次交互展开得到的状态—动作—奖励链。Figure 1.6 左侧策略从 $s_1$ 产生：&lt;/p&gt;
&lt;p&gt;$$
s_1
\xrightarrow[a_2]{r=0}
s_2
\xrightarrow[a_3]{r=0}
s_5
\xrightarrow[a_3]{r=0}
s_8
\xrightarrow[a_2]{r=1}
s_9.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-1-6.png&quot; alt=&quot;Figure 1.6：两种策略及其轨迹&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：两套策略从 $s_1$ 到 $s_9$ 的红色虚线轨迹，以及沿途即时奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：到达同一目标的不同策略会生成不同轨迹和不同回报。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：Policy 1 避开禁止格；Policy 2 经过 $s_7$，因此多出一次 $-1$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：左轨迹的奖励序列为 $(0,0,0,1)$，右轨迹为 $(0,-1,0,1)$，分别代入回报求和。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;6.2 回报&lt;/h3&gt;
&lt;p&gt;回报（return）是沿轨迹收集的奖励之和。原书也使用 total reward、cumulative reward 表达同一类累计概念。Policy 1 的回报为&lt;/p&gt;
&lt;p&gt;$$
G=0+0+0+1=1.
$$&lt;/p&gt;
&lt;p&gt;Policy 2 的轨迹是&lt;/p&gt;
&lt;p&gt;$$
s_1
\xrightarrow[a_3]{r=0}
s_4
\xrightarrow[a_3]{r=-1}
s_7
\xrightarrow[a_2]{r=0}
s_8
\xrightarrow[a_2]{r=+1}
s_9,
$$&lt;/p&gt;
&lt;p&gt;所以&lt;/p&gt;
&lt;p&gt;$$
G=0-1+0+1=0.
$$&lt;/p&gt;
&lt;p&gt;从同一初始状态比较，Policy 1 的回报 $1&amp;gt;0$，因此比 Policy 2 更好；这一结论与“Policy 2 穿过禁止格”的直觉一致。&lt;/p&gt;
&lt;h3&gt;6.3 即时奖励与未来奖励&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;即时奖励&lt;/strong&gt;：在初始状态执行当前动作后马上得到的奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;未来奖励（future rewards）&lt;/strong&gt;：离开初始状态后继续交互得到的奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;回报&lt;/strong&gt;：即时奖励与未来奖励的累计结果。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;一个动作可能先得到负奖励、随后带来更多正奖励；也可能当前没有损失、长期却停滞不前。因此用回报而非即时奖励做决策，才能避免短视。&lt;/p&gt;
&lt;h3&gt;6.4 无限轨迹与发散问题&lt;/h3&gt;
&lt;p&gt;若到达 $s_9$ 后一直执行 $a_5$，每次都留在 $s_9$ 并得到 $+1$，未折扣总和为&lt;/p&gt;
&lt;p&gt;$$
0+0+0+1+1+1+\cdots=\infty.
$$&lt;/p&gt;
&lt;p&gt;直接求和发散，无法得到有限的策略评价。这促使我们为越远的奖励赋予越小权重。&lt;/p&gt;
&lt;h3&gt;6.5 折扣回报&lt;/h3&gt;
&lt;p&gt;从时刻 $t$ 开始的折扣回报（discounted return）定义为&lt;/p&gt;
&lt;p&gt;$$
G_t=
r_{t+1}
+\gamma r_{t+2}
+\gamma^2r_{t+3}
+\cdots,
\qquad \gamma\in(0,1),
$$&lt;/p&gt;
&lt;p&gt;其中折扣率（discount rate）$\gamma$ 控制未来奖励的权重。对上面的无限轨迹，前三个奖励为 0，第一次 $+1$ 出现在第四步，所以&lt;/p&gt;
&lt;p&gt;$$
G=0+\gamma\cdot0+\gamma^2\cdot0+\gamma^3\cdot1
+\gamma^4\cdot1+\gamma^5\cdot1+\cdots.
$$&lt;/p&gt;
&lt;p&gt;删去为零的项：&lt;/p&gt;
&lt;p&gt;$$
G=\gamma^3+\gamma^4+\gamma^5+\cdots.
$$&lt;/p&gt;
&lt;p&gt;提取公因子 $\gamma^3$：&lt;/p&gt;
&lt;p&gt;$$
G=\gamma^3(1+\gamma+\gamma^2+\cdots).
$$&lt;/p&gt;
&lt;p&gt;令 $S=1+\gamma+\gamma^2+\cdots$。因为 $0&amp;lt;\gamma&amp;lt;1$，有&lt;/p&gt;
&lt;p&gt;$$
\gamma S=\gamma+\gamma^2+\gamma^3+\cdots,
$$&lt;/p&gt;
&lt;p&gt;两式相减：&lt;/p&gt;
&lt;p&gt;$$
S-\gamma S=1,
$$&lt;/p&gt;
&lt;p&gt;所以&lt;/p&gt;
&lt;p&gt;$$
S=\frac{1}{1-\gamma}.
$$&lt;/p&gt;
&lt;p&gt;最终得到&lt;/p&gt;
&lt;p&gt;$$
G=\frac{\gamma^3}{1-\gamma}.
$$&lt;/p&gt;
&lt;p&gt;指数 $3$ 很关键：按 $G_t$ 的定义，第一步奖励权重是 $\gamma^0=1$，第四步奖励的权重才是 $\gamma^3$。&lt;/p&gt;
&lt;h3&gt;6.6 折扣率的意义&lt;/h3&gt;
&lt;p&gt;折扣率一方面使某些无限长正奖励序列得到有限回报，另一方面调节近期与远期奖励的相对重要性。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;$\gamma$&lt;/th&gt;
&lt;th&gt;行为倾向&lt;/th&gt;
&lt;th&gt;优点&lt;/th&gt;
&lt;th&gt;风险&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;接近 0&lt;/td&gt;
&lt;td&gt;强调近期奖励，较短视&lt;/td&gt;
&lt;td&gt;对很快出现的反馈敏感&lt;/td&gt;
&lt;td&gt;可能忽视更远但更大的收益&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;中间值&lt;/td&gt;
&lt;td&gt;在近期与远期之间折中&lt;/td&gt;
&lt;td&gt;同时保留一定即时性和规划性&lt;/td&gt;
&lt;td&gt;结果依赖任务中奖励出现的时间尺度&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;接近 1&lt;/td&gt;
&lt;td&gt;强调远期奖励，较有远见&lt;/td&gt;
&lt;td&gt;更愿意为长期收益承受近期负奖励&lt;/td&gt;
&lt;td&gt;远期影响更强，且在无限任务中必须保持 $\gamma&amp;lt;1$ 才能使用本章的等比收敛论证&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;6.7 Episode&lt;/h3&gt;
&lt;p&gt;当智能体按策略与环境交互，并在某个终止状态（terminal state）停止时，得到的轨迹称为回合（episode），也称 trial。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;随机策略或随机环境下，从同一状态出发可得到不同回合。&lt;/li&gt;
&lt;li&gt;若策略和环境全部确定，从同一状态出发总会得到同一回合。&lt;/li&gt;
&lt;li&gt;回合通常假定为有限轨迹；具有回合的任务称为 episodic task。&lt;/li&gt;
&lt;li&gt;没有终止状态、交互永不结束的任务称为 continuing task。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;轨迹是更一般的状态—动作—奖励序列；回合强调这条轨迹按任务终止规则构成一次完整试验。&lt;/p&gt;
&lt;h3&gt;6.8 Absorbing State&lt;/h3&gt;
&lt;p&gt;吸收状态（absorbing state）是一旦到达就永远不会离开的状态。对终止状态 $s_9$，原书给出两种统一 episodic 与 continuing 任务的处理方式：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;把终止状态变成特殊的吸收状态&lt;/strong&gt;：可规定 $\mathcal A(s_9)={a_5}$；或者仍保留全部动作，但令&lt;/p&gt;
&lt;p&gt;$$
p(s_9|s_9,a_i)=1,\qquad i=1,\ldots,5.
$$&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;把目标状态当作普通状态&lt;/strong&gt;：令 $\mathcal A(s_9)={a_1,\ldots,a_5}$，允许离开再返回。由于每次到达或停留在 $s_9$ 可获得正奖励，智能体最终会倾向于留在这里；无限序列需用折扣回报避免发散。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;本书采用第二种方式：$s_9$ 是普通状态，动作空间与其他状态相同，而不是强制吸收状态。&lt;/p&gt;
&lt;h2&gt;7. 马尔可夫决策过程&lt;/h2&gt;
&lt;h3&gt;7.1 MDP 的组成&lt;/h3&gt;
&lt;p&gt;马尔可夫决策过程（Markov decision process, MDP）是描述随机动态系统的一般框架。本章将其组成整理为三层。&lt;/p&gt;
&lt;h4&gt;集合&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;状态空间 $\mathcal S$：所有状态的集合。&lt;/li&gt;
&lt;li&gt;状态相关动作空间 $\mathcal A(s)$：处于 $s\in\mathcal S$ 时可选动作的集合。&lt;/li&gt;
&lt;li&gt;奖励集合 $\mathcal R(s,a)$：状态—动作对 $(s,a)$ 可能产生的奖励值集合。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;模型&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;状态转移概率 $p(s&apos;|s,a)$：给定当前状态和动作，下一状态为 $s&apos;$ 的概率。&lt;/li&gt;
&lt;li&gt;奖励概率 $p(r|s,a)$：给定当前状态和动作，奖励为 $r$ 的概率。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;策略&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;$\pi(a|s)$：给定当前状态，智能体选择动作 $a$ 的概率。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;7.2 概率归一化条件&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;概率对象&lt;/th&gt;
&lt;th&gt;归一化公式&lt;/th&gt;
&lt;th&gt;固定什么&lt;/th&gt;
&lt;th&gt;对什么求和&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;下一状态分布&lt;/td&gt;
&lt;td&gt;$\displaystyle\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)=1$&lt;/td&gt;
&lt;td&gt;当前 $(s,a)$&lt;/td&gt;
&lt;td&gt;所有 $s&apos;$&lt;/td&gt;
&lt;td&gt;下一状态必落在状态空间中的某处&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;奖励分布&lt;/td&gt;
&lt;td&gt;$\displaystyle\sum_{r\in\mathcal R(s,a)}p(r\mid s,a)=1$&lt;/td&gt;
&lt;td&gt;当前 $(s,a)$&lt;/td&gt;
&lt;td&gt;所有可能奖励 $r$&lt;/td&gt;
&lt;td&gt;该步必产生奖励集合中的某个值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;动作分布&lt;/td&gt;
&lt;td&gt;$\displaystyle\sum_{a\in\mathcal A(s)}\pi(a\mid s)=1$&lt;/td&gt;
&lt;td&gt;当前状态 $s$&lt;/td&gt;
&lt;td&gt;所有可选动作 $a$&lt;/td&gt;
&lt;td&gt;策略会选择一个可行动作&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三条公式都“和为 1”，但随机变量不同：分别是下一状态、奖励和动作，不能互换。&lt;/p&gt;
&lt;h3&gt;7.3 马尔可夫性质&lt;/h3&gt;
&lt;p&gt;状态转移的马尔可夫性质（Markov property）为&lt;/p&gt;
&lt;h1&gt;$$
p(s_{t+1}|s_t,a_t,s_{t-1},a_{t-1},\ldots,s_0,a_0)&lt;/h1&gt;
&lt;p&gt;p(s_{t+1}|s_t,a_t).
$$&lt;/p&gt;
&lt;p&gt;奖励的对应表达式为&lt;/p&gt;
&lt;h1&gt;$$
p(r_{t+1}|s_t,a_t,s_{t-1},a_{t-1},\ldots,s_0,a_0)&lt;/h1&gt;
&lt;p&gt;p(r_{t+1}|s_t,a_t).
$$&lt;/p&gt;
&lt;p&gt;准确含义是：&lt;strong&gt;在给定当前状态和动作的条件下，更早的历史信息不会为下一状态和奖励提供额外信息。&lt;/strong&gt; 这不是笼统地说“未来与过去无关”；若没有给定足以概括当前情形的状态，过去仍可能有信息价值。Markov 性质是下一章推导 Bellman Equation 的基础。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!example] 补充理解：符合 Markov 性质
若状态完整记录机器人所在格子，且网格规则固定，那么给定 $s_t=s_1$ 和 $a_t=a_2$ 后，是否曾经访问过 $s_7$ 不会改变本章规定的下一状态 $s_2$ 与即时奖励 0。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!example] 补充理解：不符合 Markov 性质
假设真实环境有“有风/无风”两种模式，但状态仍只记录格子位置，且风模式会持续。过去几步的偏移可以帮助判断当前是否有风，从而改进对下一状态的预测。此时只用格子位置作为 $s_t$ 不充分；给定它和动作后，历史仍提供额外信息，因此这个状态定义不满足 Markov 性质。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;7.4 Model / Dynamics&lt;/h3&gt;
&lt;p&gt;对所有 $(s,a)$ 给出的&lt;/p&gt;
&lt;p&gt;$$
p(s&apos;|s,a)
$$&lt;/p&gt;
&lt;p&gt;和&lt;/p&gt;
&lt;p&gt;$$
p(r|s,a)
$$&lt;/p&gt;
&lt;p&gt;共同称为环境模型（model）或动力学（dynamics）。前者描述环境把状态推进到哪里，后者描述环境反馈什么奖励。策略不属于环境模型，因为它描述智能体如何选择动作。&lt;/p&gt;
&lt;h3&gt;7.5 Stationary 与 Nonstationary&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;平稳模型（stationary model / time-invariant）&lt;/strong&gt;：转移与奖励规律不随时间改变；同一 $(s,a)$ 在不同时刻遵循同一分布。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;非平稳模型（nonstationary model / time-variant）&lt;/strong&gt;：规律随时间改变。例如网格中的禁止区域有时出现、有时消失，会改变转移或奖励过程。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;本书只考虑平稳模型。&lt;/p&gt;
&lt;h3&gt;7.6 MDP 与 Markov Process&lt;/h3&gt;
&lt;p&gt;MDP 中存在动作选择和策略，智能体可以影响状态演化。一旦固定 MDP 的策略，动作选择规则不再是待决策对象，系统便退化为马尔可夫过程（Markov process, MP）。若过程为离散时间，且状态数有限或可数，随机过程文献也称其为马尔可夫链（Markov chain）。本书在上下文明确时交替使用 MP 与 Markov chain，并主要考虑状态数、动作数均有限的 finite MDP。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-1-7.png&quot; alt=&quot;Figure 1.7：Grid World 抽象为 Markov Process&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图中展示了什么&lt;/strong&gt;：左侧是固定随机策略下的网格，右侧用圆节点与有向边抽象出状态及状态间概率转移。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;它说明了哪个概念&lt;/strong&gt;：固定策略后，动作选择被吸收到总体状态演化中，MDP 可表示为 Markov process。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;阅读重点&lt;/strong&gt;：圆表示状态，带概率的箭头表示状态转移；$s_1$ 有两条概率为 $0.5$ 的分支，其余展示的分支为 1。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;与正文公式的联系&lt;/strong&gt;：图上的 Prob 值是固定策略与环境转移共同诱导的状态间概率；其每个状态的出边概率总和为 1。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;7.7 Agent–Environment Interaction&lt;/h3&gt;
&lt;pre&gt;&lt;code&gt;flowchart LR
    A[Agent] --&amp;gt;|Action| E[Environment]
    E --&amp;gt;|New state and reward| A
&lt;/code&gt;&lt;/pre&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;agent&lt;/strong&gt;：决策者；感知状态、维护策略并决定动作。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;environment&lt;/strong&gt;：智能体以外的一切；依据动力学产生新状态和奖励。网格例中分别对应机器人和网格世界。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;actuator&lt;/strong&gt;：执行智能体已经决定的动作。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;interpreter&lt;/strong&gt;：把环境结果解释成智能体可使用的新状态和奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;closed loop&lt;/strong&gt;：智能体选动作，环境反馈新状态与奖励，智能体再据此做下一次决策，循环不断重复。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;8. 本章概念之间的关系&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;概念&lt;/th&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;由谁决定&lt;/th&gt;
&lt;th&gt;输入&lt;/th&gt;
&lt;th&gt;输出&lt;/th&gt;
&lt;th&gt;网格世界例子&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;状态（state）&lt;/td&gt;
&lt;td&gt;$s$&lt;/td&gt;
&lt;td&gt;建模时定义，实际值由交互进程给出&lt;/td&gt;
&lt;td&gt;当前环境情形&lt;/td&gt;
&lt;td&gt;状态描述&lt;/td&gt;
&lt;td&gt;机器人位于 $s_5$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;动作（action）&lt;/td&gt;
&lt;td&gt;$a$&lt;/td&gt;
&lt;td&gt;智能体按策略选择&lt;/td&gt;
&lt;td&gt;当前状态&lt;/td&gt;
&lt;td&gt;控制选择&lt;/td&gt;
&lt;td&gt;在 $s_5$ 选择 $a_3$ 向下&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;转移模型（transition model）&lt;/td&gt;
&lt;td&gt;$p(s&apos;\mid s,a)$&lt;/td&gt;
&lt;td&gt;环境动力学&lt;/td&gt;
&lt;td&gt;$s,a$&lt;/td&gt;
&lt;td&gt;下一状态分布&lt;/td&gt;
&lt;td&gt;$p(s_8\mid s_5,a_3)=1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;奖励模型（reward model）&lt;/td&gt;
&lt;td&gt;$p(r\mid s,a)$&lt;/td&gt;
&lt;td&gt;环境/任务奖励设计&lt;/td&gt;
&lt;td&gt;$s,a$&lt;/td&gt;
&lt;td&gt;奖励分布&lt;/td&gt;
&lt;td&gt;$s_5$ 向右进入禁止格得 $-1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;策略（policy）&lt;/td&gt;
&lt;td&gt;$\pi(a\mid s)$&lt;/td&gt;
&lt;td&gt;智能体&lt;/td&gt;
&lt;td&gt;$s$&lt;/td&gt;
&lt;td&gt;动作分布&lt;/td&gt;
&lt;td&gt;在 $s_1$ 向右、向下各 $0.5$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;轨迹（trajectory）&lt;/td&gt;
&lt;td&gt;状态—动作—奖励链&lt;/td&gt;
&lt;td&gt;策略与环境共同产生&lt;/td&gt;
&lt;td&gt;初始状态、策略、模型&lt;/td&gt;
&lt;td&gt;一串 $s,a,r$&lt;/td&gt;
&lt;td&gt;$s_1\to s_2\to s_5\to s_8\to s_9$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;回报（return）&lt;/td&gt;
&lt;td&gt;$G$ 或 $G_t$&lt;/td&gt;
&lt;td&gt;由轨迹奖励及 $\gamma$ 计算&lt;/td&gt;
&lt;td&gt;奖励序列&lt;/td&gt;
&lt;td&gt;一个累计标量&lt;/td&gt;
&lt;td&gt;$0+0+0+1=1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;回合（episode）&lt;/td&gt;
&lt;td&gt;常用整条轨迹表示&lt;/td&gt;
&lt;td&gt;交互与终止规则共同确定&lt;/td&gt;
&lt;td&gt;初始状态、策略、模型、终止条件&lt;/td&gt;
&lt;td&gt;一次完整有限试验&lt;/td&gt;
&lt;td&gt;从起点运行至终止状态&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MDP&lt;/td&gt;
&lt;td&gt;$\mathcal S,\mathcal A,\mathcal R,p,\pi$ 等&lt;/td&gt;
&lt;td&gt;建模框架整合环境与决策&lt;/td&gt;
&lt;td&gt;集合、模型、策略、Markov 假设&lt;/td&gt;
&lt;td&gt;完整决策过程描述&lt;/td&gt;
&lt;td&gt;九状态、五动作的网格系统&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;三组容易混淆的关系&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;策略 $\pi(a|s)$ 与状态转移 $p(s&apos;|s,a)$&lt;/strong&gt;：前者是智能体在状态中怎样选动作，后者是环境收到动作后怎样产生下一状态。策略的条件中没有 $s&apos;$；转移模型的条件中已经给定 $a$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;即时奖励 $r$ 与回报 $G$&lt;/strong&gt;：$r$ 是一步反馈，$G$ 汇总当前与未来的奖励。某一步 $r=0$ 不表示该动作长期没有价值；某一步 $r&amp;gt;0$ 也不保证最终回报最大。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;episode 与 trajectory&lt;/strong&gt;：trajectory 泛指状态—动作—奖励序列，可有限也可无限；episode 是按任务定义从开始到终止的一次完整 trial，通常为有限轨迹。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;9. 本章 Q&amp;amp;A&lt;/h2&gt;
&lt;h3&gt;9.1 奖励是否可以全部为正数或全部为负数&lt;/h3&gt;
&lt;p&gt;可以。原书强调，决定鼓励或抑制作用的是奖励之间的&lt;strong&gt;相对大小&lt;/strong&gt;，而不是绝对正负。本章原奖励为&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}=-1,\quad
r_{\text{forbidden}}=-1,\quad
r_{\text{target}}=+1,\quad
r_{\text{other}}=0.
$$&lt;/p&gt;
&lt;p&gt;给所有奖励统一加上 $-2$，得到&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}=-3,\quad
r_{\text{forbidden}}=-3,\quad
r_{\text{target}}=-1,\quad
r_{\text{other}}=-2.
$$&lt;/p&gt;
&lt;p&gt;虽然现在全部为负，目标奖励 $-1$ 仍相对最好，边界与禁止格的 $-3$ 仍相对最差。按本章给出的结论，这种共同平移不改变所得最优策略；原书将其概括为“optimal policies are invariant to affine transformations of rewards”，并把详细讨论留到 Chapter 3.5。本章不提前展开其证明。&lt;/p&gt;
&lt;h3&gt;9.2 奖励是否依赖下一状态&lt;/h3&gt;
&lt;p&gt;很多任务中，奖励看起来确实由下一状态决定，例如只有下一状态是目标格时才给正奖励。更细的模型可以写成&lt;/p&gt;
&lt;p&gt;$$
p(r|s,a,s&apos;),
$$&lt;/p&gt;
&lt;p&gt;表示给定当前状态、动作和下一状态后的奖励分布。由于 $s&apos;$ 本身由 $(s,a)$ 产生，可以把 $s&apos;$ 边缘化，得到只以 $(s,a)$ 为条件的写法：&lt;/p&gt;
&lt;h1&gt;$$
p(r|s,a)&lt;/h1&gt;
&lt;p&gt;\sum_{s&apos;\in\mathcal S}
p(r|s,a,s&apos;)p(s&apos;|s,a).
$$&lt;/p&gt;
&lt;p&gt;直观上，对每个可能的下一状态，先计算“到该状态的概率”乘以“在该状态分支上得到奖励 $r$ 的概率”，再把所有分支相加。于是 $p(r|s,a,s&apos;)$ 与 $p(r|s,a)$ 可以建立联系；原书采用后者以便在 Chapter 2 建立 Bellman Equation。&lt;/p&gt;
&lt;h2&gt;10. 一页式复习总结&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!summary] Chapter 1 in one page
&lt;strong&gt;基本交互&lt;/strong&gt;：智能体在状态 $s_t$ 按策略 $\pi(a|s_t)$ 选择动作 $a_t$；环境按 $p(s_{t+1}|s_t,a_t)$ 产生新状态，并按 $p(r_{t+1}|s_t,a_t)$ 产生奖励；新状态和奖励返回智能体，形成闭环。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;MDP 的组成&lt;/strong&gt;：状态空间 $\mathcal S$、动作空间 $\mathcal A(s)$、奖励集合 $\mathcal R(s,a)$；转移模型 $p(s&apos;|s,a)$ 与奖励模型 $p(r|s,a)$；以及用于决策的策略 $\pi(a|s)$。本书主要研究有限、平稳 MDP。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;三种概率别混淆&lt;/strong&gt;：$\pi(a|s)$ 对动作归一化，表示智能体选什么；$p(s&apos;|s,a)$ 对下一状态归一化，表示环境把智能体带到哪里；$p(r|s,a)$ 对奖励值归一化，表示环境给什么反馈。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;为什么看回报&lt;/strong&gt;：即时奖励只反映一步，无法区分“暂时无收益但通往目标”和“原地停留”。回报 $G$ 汇总整条轨迹，才能评价长期结果。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;折扣率的作用&lt;/strong&gt;：$G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots$。$\gamma$ 越小越重近期，越接近 1 越重远期；当 $0&amp;lt;\gamma&amp;lt;1$ 时，某些无限正奖励序列可收敛。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Markov 性质的准确含义&lt;/strong&gt;：给定当前状态和动作后，更早历史不会再为下一状态和奖励提供额外信息。关键在于当前状态必须包含足够信息，而不是简单宣称“未来与过去无关”。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;11. 公式清单&lt;/h2&gt;
&lt;h3&gt;11.1 状态空间&lt;/h3&gt;
&lt;p&gt;$$
\mathcal S={s_1,s_2,\ldots,s_9}.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$s_i$ 是第 $i$ 个状态，$\mathcal S$ 是所有状态的集合。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：列出系统可能处于的全部状态。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：九个格子分别对应 $s_1$ 至 $s_9$，包括禁止格与目标格。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.2 动作空间&lt;/h3&gt;
&lt;p&gt;$$
\mathcal A={a_1,a_2,a_3,a_4,a_5}.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$a_1$ 至 $a_5$ 分别为上、右、下、左、不动。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：列出全局可供策略选择的动作。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：本书即使在边界状态也保留五个动作。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.3 状态相关动作空间&lt;/h3&gt;
&lt;p&gt;$$
\mathcal A(s_1)={a_2,a_3,a_5},
\qquad
\mathcal A(s_i)=\mathcal A.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$\mathcal A(s)$ 是状态 $s$ 的可选动作集合。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：区分“删去不可行动作”与“保留动作并由转移/奖励处理”的两种建模方式。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：前式可排除 $s_1$ 的上、左；本书采用后式，对所有状态保留五动作。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.4 状态转移箭头&lt;/h3&gt;
&lt;p&gt;$$
s_1\xrightarrow{a_2}s_2,
\qquad
s_1\xrightarrow{a_1}s_1.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：箭头上方是动作，左右分别为当前状态与下一状态。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：直观记录一次确定性转移。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：$s_1$ 向右到 $s_2$；向上撞边界后留在 $s_1$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.5 状态转移概率&lt;/h3&gt;
&lt;p&gt;$$
p(s&apos;|s,a).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$s$ 为当前状态，$a$ 为动作，$s&apos;$ 为下一状态。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：同时描述确定性与随机性环境。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：$p(s_2|s_1,a_2)=1$；有随机风时可能有 $p(s_5|s_1,a_2)&amp;gt;0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.6 下一状态概率归一化&lt;/h3&gt;
&lt;p&gt;$$
\sum_{s&apos;\in\mathcal S}p(s&apos;|s,a)=1.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：固定 $(s,a)$，对所有下一状态 $s&apos;$ 求和。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：保证 $p(\cdot|s,a)$ 是合法概率分布。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：$s_1$ 向右时 $s_2$ 概率为 1，其余状态概率为 0。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.7 策略概率&lt;/h3&gt;
&lt;p&gt;$$
\pi(a|s).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$\pi$ 为策略；$a$ 是在状态 $s$ 下被选择的动作。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：用统一形式表示确定性与随机策略。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：随机策略在 $s_1$ 令 $\pi(a_2|s_1)=\pi(a_3|s_1)=0.5$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.8 策略归一化&lt;/h3&gt;
&lt;p&gt;$$
\sum_{a\in\mathcal A(s)}\pi(a|s)=1.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：固定状态 $s$，对其所有可选动作求和。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：保证策略在每个状态给出合法动作分布。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：$s_1$ 行的 $0+0.5+0.5+0+0=1$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.9 确定性奖励&lt;/h3&gt;
&lt;p&gt;$$
r=r(s,a),
$$&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}=-1,\quad
r_{\text{forbidden}}=-1,\quad
r_{\text{target}}=+1,\quad
r_{\text{other}}=0.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$r$ 是执行状态—动作对后得到的即时奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：用标量反馈表达任务偏好。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：在 $s_8$ 选 $a_2$ 到达目标，得到 $+1$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.10 奖励概率与归一化&lt;/h3&gt;
&lt;p&gt;$$
p(r|s,a),
\qquad
\sum_{r\in\mathcal R(s,a)}p(r|s,a)=1.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$\mathcal R(s,a)$ 是该状态—动作对可能产生的奖励集合。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：描述随机奖励，并保证奖励分布合法。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：$p(r=-1|s_1,a_1)=1$，$p(r\neq-1|s_1,a_1)=0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.11 有限轨迹回报&lt;/h3&gt;
&lt;p&gt;$$
G=\sum_{k=1}^{T}r_k.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$r_k$ 是轨迹第 $k$ 步奖励，$T$ 是有限步数。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：把一次有限轨迹的奖励累计成策略评价。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：Policy 1 得 $G=0+0+0+1=1$；Policy 2 得 $G=0-1+0+1=0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.12 折扣回报&lt;/h3&gt;
&lt;p&gt;$$
G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots,
\qquad 0&amp;lt;\gamma&amp;lt;1.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$G_t$ 是从时刻 $t$ 开始的回报，$\gamma$ 是折扣率。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：处理无限轨迹并调节近期、远期奖励权重。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：前三步奖励为 0、第四步起每步为 1 时，$G=\gamma^3+\gamma^4+\cdots$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.13 等比数列结果&lt;/h3&gt;
&lt;h1&gt;$$
\gamma^3+\gamma^4+\gamma^5+\cdots&lt;/h1&gt;
&lt;h1&gt;\gamma^3(1+\gamma+\gamma^2+\cdots)&lt;/h1&gt;
&lt;p&gt;\frac{\gamma^3}{1-\gamma}.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：首个非零折扣项为 $\gamma^3$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：把无限奖励序列化为有限闭式表达。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：到达 $s_9$ 后不断执行 $a_5$ 并持续得到 $+1$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.14 吸收状态条件&lt;/h3&gt;
&lt;p&gt;$$
p(s_9|s_9,a_i)=1,
\qquad i=1,\ldots,5.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：对 $s_9$ 的每个动作，下一状态仍为 $s_9$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：把终止状态建模为不会离开的 absorbing state。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：这是原书列出的第一种处理方式；本书实际采用把 $s_9$ 当普通状态的第二种方式。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.15 状态的 Markov 性质&lt;/h3&gt;
&lt;p&gt;$$
p(s_{t+1}|s_t,a_t,s_{t-1},a_{t-1},\ldots,s_0,a_0)
=p(s_{t+1}|s_t,a_t).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$t$ 是当前时刻，$t+1$ 是下一时刻。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：说明给定当前状态、动作后，完整历史不再改进下一状态分布。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：规则固定时，$s_1$ 向右的结果不依赖更早走过哪些格子。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.16 奖励的 Markov 性质&lt;/h3&gt;
&lt;p&gt;$$
p(r_{t+1}|s_t,a_t,s_{t-1},a_{t-1},\ldots,s_0,a_0)
=p(r_{t+1}|s_t,a_t).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$r_{t+1}$ 是执行 $a_t$ 后得到的奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：说明当前状态与动作已包含预测下一奖励所需的信息。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：在 $s_5$ 向右进入禁止格的奖励不取决于早先路线。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.17 奖励对下一状态的边缘化&lt;/h3&gt;
&lt;h1&gt;$$
p(r|s,a)&lt;/h1&gt;
&lt;p&gt;\sum_{s&apos;\in\mathcal S}p(r|s,a,s&apos;)p(s&apos;|s,a).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;符号&lt;/strong&gt;：$p(r|s,a,s&apos;)$ 显式条件于下一状态，$p(s&apos;|s,a)$ 是下一状态概率。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;用途&lt;/strong&gt;：把依赖 $s&apos;$ 的奖励模型转成只条件于 $(s,a)$ 的形式。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;网格例子&lt;/strong&gt;：可按所有可能下一格加权汇总“到该格后获得奖励 $r$”的概率。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;12. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;English&lt;/th&gt;
&lt;th&gt;中文&lt;/th&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;简要定义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;agent&lt;/td&gt;
&lt;td&gt;智能体&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;感知状态、维护策略并执行动作的决策者&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;environment&lt;/td&gt;
&lt;td&gt;环境&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;智能体以外、产生新状态与奖励的一切&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;state&lt;/td&gt;
&lt;td&gt;状态&lt;/td&gt;
&lt;td&gt;$s$&lt;/td&gt;
&lt;td&gt;对智能体当前情形的描述&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;state space&lt;/td&gt;
&lt;td&gt;状态空间&lt;/td&gt;
&lt;td&gt;$\mathcal S$&lt;/td&gt;
&lt;td&gt;所有可能状态的集合&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action&lt;/td&gt;
&lt;td&gt;动作&lt;/td&gt;
&lt;td&gt;$a$&lt;/td&gt;
&lt;td&gt;智能体可尝试执行的决策&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action space&lt;/td&gt;
&lt;td&gt;动作空间&lt;/td&gt;
&lt;td&gt;$\mathcal A$、$\mathcal A(s)$&lt;/td&gt;
&lt;td&gt;全部或某状态下可选动作的集合&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;state transition&lt;/td&gt;
&lt;td&gt;状态转移&lt;/td&gt;
&lt;td&gt;$s\xrightarrow{a}s&apos;$&lt;/td&gt;
&lt;td&gt;执行动作后从当前状态到下一状态的过程&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;transition probability&lt;/td&gt;
&lt;td&gt;状态转移概率&lt;/td&gt;
&lt;td&gt;$p(s&apos;\mid s,a)$&lt;/td&gt;
&lt;td&gt;给定状态、动作后到达下一状态的概率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;deterministic&lt;/td&gt;
&lt;td&gt;确定性的&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;给定条件后结果唯一&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;stochastic&lt;/td&gt;
&lt;td&gt;随机性的&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;给定条件后仍可能出现多个结果&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;policy&lt;/td&gt;
&lt;td&gt;策略&lt;/td&gt;
&lt;td&gt;$\pi(a\mid s)$&lt;/td&gt;
&lt;td&gt;在各状态下选择动作的条件概率规则&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;tabular representation&lt;/td&gt;
&lt;td&gt;表格表示&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;逐个状态—动作单元格枚举数值的表示&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;reward&lt;/td&gt;
&lt;td&gt;奖励&lt;/td&gt;
&lt;td&gt;$r$、$r(s,a)$&lt;/td&gt;
&lt;td&gt;动作后由环境给出的标量反馈&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;reward probability&lt;/td&gt;
&lt;td&gt;奖励概率&lt;/td&gt;
&lt;td&gt;$p(r\mid s,a)$&lt;/td&gt;
&lt;td&gt;给定状态、动作后得到某奖励的概率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;immediate reward&lt;/td&gt;
&lt;td&gt;即时奖励&lt;/td&gt;
&lt;td&gt;$r_{t+1}$&lt;/td&gt;
&lt;td&gt;当前动作执行后立刻获得的奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;future rewards&lt;/td&gt;
&lt;td&gt;未来奖励&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;离开当前状态后继续获得的奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;trajectory&lt;/td&gt;
&lt;td&gt;轨迹&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;状态—动作—奖励链&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;return&lt;/td&gt;
&lt;td&gt;回报&lt;/td&gt;
&lt;td&gt;$G$、$G_t$&lt;/td&gt;
&lt;td&gt;轨迹奖励的累计结果&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;total reward&lt;/td&gt;
&lt;td&gt;总奖励&lt;/td&gt;
&lt;td&gt;$G$&lt;/td&gt;
&lt;td&gt;return 的同类称呼&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;cumulative reward&lt;/td&gt;
&lt;td&gt;累计奖励&lt;/td&gt;
&lt;td&gt;$G$&lt;/td&gt;
&lt;td&gt;return 的同类称呼&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;discounted return&lt;/td&gt;
&lt;td&gt;折扣回报&lt;/td&gt;
&lt;td&gt;$G_t$&lt;/td&gt;
&lt;td&gt;对越远奖励乘越高次 $\gamma$ 的累计奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;discount rate&lt;/td&gt;
&lt;td&gt;折扣率&lt;/td&gt;
&lt;td&gt;$\gamma$&lt;/td&gt;
&lt;td&gt;控制近期与远期奖励相对权重的参数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;episode&lt;/td&gt;
&lt;td&gt;回合&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;从开始到终止的一次完整有限轨迹&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;trial&lt;/td&gt;
&lt;td&gt;试验&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;episode 的同义称呼&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;terminal state&lt;/td&gt;
&lt;td&gt;终止状态&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;按任务定义结束一回合的状态&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;episodic task&lt;/td&gt;
&lt;td&gt;回合式任务&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;交互由有限回合构成的任务&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;continuing task&lt;/td&gt;
&lt;td&gt;持续式任务&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;没有终止状态、交互持续进行的任务&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;absorbing state&lt;/td&gt;
&lt;td&gt;吸收状态&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;一旦进入便永远不会离开的状态&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Markov decision process&lt;/td&gt;
&lt;td&gt;马尔可夫决策过程&lt;/td&gt;
&lt;td&gt;MDP&lt;/td&gt;
&lt;td&gt;用集合、模型、策略与 Markov 性质描述的决策系统&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Markov property&lt;/td&gt;
&lt;td&gt;马尔可夫性质&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;给定当前状态、动作后，历史不再提供额外预测信息&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;model / dynamics&lt;/td&gt;
&lt;td&gt;模型 / 动力学&lt;/td&gt;
&lt;td&gt;$p(s&apos;\mid s,a)$、$p(r\mid s,a)$&lt;/td&gt;
&lt;td&gt;环境的状态转移与奖励规律&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;stationary model&lt;/td&gt;
&lt;td&gt;平稳模型&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;模型不随时间改变&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;nonstationary model&lt;/td&gt;
&lt;td&gt;非平稳模型&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;模型可能随时间改变&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Markov process&lt;/td&gt;
&lt;td&gt;马尔可夫过程&lt;/td&gt;
&lt;td&gt;MP&lt;/td&gt;
&lt;td&gt;固定 MDP 策略后得到的 Markov 随机过程&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Markov chain&lt;/td&gt;
&lt;td&gt;马尔可夫链&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;离散时间、有限或可数状态的 Markov process&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;actuator&lt;/td&gt;
&lt;td&gt;执行器&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;执行智能体已决定动作的部分&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;interpreter&lt;/td&gt;
&lt;td&gt;解释器&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;把环境结果解释为新状态和奖励的部分&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;closed loop&lt;/td&gt;
&lt;td&gt;闭环&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;动作、环境反馈与再次决策不断循环的交互结构&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;13. 自测题&lt;/h2&gt;
&lt;h3&gt;13.1 概念判断题（10 题）&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;状态空间 $\mathcal S$ 是一次实际轨迹经过的状态序列。&lt;/li&gt;
&lt;li&gt;本书在网格例子中允许禁止格被进入，但进入会受到惩罚。&lt;/li&gt;
&lt;li&gt;$\pi(a_2|s_1)=1$ 直接意味着任何环境中下一状态必为 $s_2$。&lt;/li&gt;
&lt;li&gt;对固定 $(s,a)$，所有 $p(s&apos;|s,a)$ 之和必须为 1。&lt;/li&gt;
&lt;li&gt;状态转移随机性和策略随机性表示同一件事。&lt;/li&gt;
&lt;li&gt;两个动作得到相同下一状态时，它们的即时奖励必然相同。&lt;/li&gt;
&lt;li&gt;回报可能由一个即时奖励和多个未来奖励组成。&lt;/li&gt;
&lt;li&gt;$\gamma$ 越接近 0，策略越强调远期奖励。&lt;/li&gt;
&lt;li&gt;每个 episode 都是一条 trajectory，但并非每条 trajectory 都一定是完整 episode。&lt;/li&gt;
&lt;li&gt;Markov 性质意味着在给定当前状态和动作后，更早历史不会为下一状态和奖励提供额外信息。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;13.2 选择题（10 题）&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;在本书采用的全局动作空间建模中，$\mathcal A(s_1)$ 是：
&lt;ul&gt;
&lt;li&gt;A. ${a_2,a_3,a_5}$&lt;/li&gt;
&lt;li&gt;B. ${a_1,a_2,a_3,a_4,a_5}$&lt;/li&gt;
&lt;li&gt;C. ${s_1,s_2,s_4}$&lt;/li&gt;
&lt;li&gt;D. 只含 $a_2$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;在 $s_1$ 执行 $a_1$ 后：
&lt;ul&gt;
&lt;li&gt;A. 到 $s_2$，奖励 0&lt;/li&gt;
&lt;li&gt;B. 留在 $s_1$，奖励 $-1$&lt;/li&gt;
&lt;li&gt;C. 离开状态空间&lt;/li&gt;
&lt;li&gt;D. 到 $s_4$，奖励 0&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;下列哪个量由智能体的动作选择规则决定？
&lt;ul&gt;
&lt;li&gt;A. $p(s&apos;|s,a)$&lt;/li&gt;
&lt;li&gt;B. $p(r|s,a)$&lt;/li&gt;
&lt;li&gt;C. $\pi(a|s)$&lt;/li&gt;
&lt;li&gt;D. $\mathcal S$ 中当前所处格子的颜色&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Figure 1.5 中 $s_1$ 的动作分布是：
&lt;ul&gt;
&lt;li&gt;A. 向右概率 1&lt;/li&gt;
&lt;li&gt;B. 向下概率 1&lt;/li&gt;
&lt;li&gt;C. 向右、向下各 0.5&lt;/li&gt;
&lt;li&gt;D. 五个动作各 0.2&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;在 $s_9$ 执行 $a_2$ 的下一状态与奖励为：
&lt;ul&gt;
&lt;li&gt;A. $s_9,+1$&lt;/li&gt;
&lt;li&gt;B. $s_9,-1$&lt;/li&gt;
&lt;li&gt;C. $s_8,0$&lt;/li&gt;
&lt;li&gt;D. $s_6,-1$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Policy 2 穿过 $s_7$ 后到达目标，其未折扣回报是：
&lt;ul&gt;
&lt;li&gt;A. $-1$&lt;/li&gt;
&lt;li&gt;B. $0$&lt;/li&gt;
&lt;li&gt;C. $1$&lt;/li&gt;
&lt;li&gt;D. $2$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;若 $\gamma$ 接近 1，原书描述的行为倾向是：
&lt;ul&gt;
&lt;li&gt;A. 更强调远期奖励&lt;/li&gt;
&lt;li&gt;B. 完全忽略未来&lt;/li&gt;
&lt;li&gt;C. 不再需要策略&lt;/li&gt;
&lt;li&gt;D. 状态转移变成确定性&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;本书对目标状态 $s_9$ 的主要处理方式是：
&lt;ul&gt;
&lt;li&gt;A. 强制删除全部动作&lt;/li&gt;
&lt;li&gt;B. 仅允许 $a_5$&lt;/li&gt;
&lt;li&gt;C. 作为普通状态，保留五个动作&lt;/li&gt;
&lt;li&gt;D. 从状态空间删除&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;固定 MDP 的策略后，系统可退化为：
&lt;ul&gt;
&lt;li&gt;A. 监督学习分类器&lt;/li&gt;
&lt;li&gt;B. Markov process&lt;/li&gt;
&lt;li&gt;C. 动作空间&lt;/li&gt;
&lt;li&gt;D. 奖励表&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;下列哪一项最准确描述 Markov 性质？&lt;/li&gt;
&lt;/ol&gt;
&lt;ul&gt;
&lt;li&gt;A. 过去绝对不会影响未来&lt;/li&gt;
&lt;li&gt;B. 未来只由动作决定&lt;/li&gt;
&lt;li&gt;C. 给定当前状态和动作后，历史不再提供额外的下一状态与奖励信息&lt;/li&gt;
&lt;li&gt;D. 每个状态只能有一个后继状态&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;13.3 简答题（5 题）&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;为什么“动作可以选择”不等于“动作一定产生预期移动”？&lt;/li&gt;
&lt;li&gt;用一句条件概率语言分别解释策略与状态转移，并说明由谁决定。&lt;/li&gt;
&lt;li&gt;为什么只按即时奖励最大化可能得到短视策略？请结合网格世界说明。&lt;/li&gt;
&lt;li&gt;episode、trajectory、terminal state 三者是什么关系？&lt;/li&gt;
&lt;li&gt;为什么 $p(s&apos;|s,a)$ 与 $p(r|s,a)$ 共同构成环境模型，而 $\pi(a|s)$ 不属于环境模型？&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;13.4 计算或推导题（3 题）&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;使用 Table 1.1 与 Table 1.3，从 $s_3$ 开始依次执行 $a_4,a_3,a_3,a_2$。写出完整状态序列、每步奖励和未折扣回报。&lt;/li&gt;
&lt;li&gt;对原书“前三步奖励为 0、从第四步起每步为 1”的无限轨迹，取 $\gamma=0.5$，计算折扣回报。&lt;/li&gt;
&lt;li&gt;在 $s_1$ 使用 Figure 1.5 的策略：向右、向下各以 0.5 概率选择；环境转移按 Table 1.1 确定。求下一状态为 $s_2$ 与 $s_4$ 的概率，并说明其余状态概率。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!answer]- 点击查看答案&lt;/p&gt;
&lt;h4&gt;判断题答案&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;错&lt;/strong&gt;。$\mathcal S$ 枚举所有可能状态；轨迹只是一次交互实际访问的序列。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对&lt;/strong&gt;。$s_6,s_7$ 可进入，进入奖励为 $-1$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;错&lt;/strong&gt;。它只说明策略必选 $a_2$；下一状态还由 $p(s&apos;|s_1,a_2)$ 决定。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对&lt;/strong&gt;。这是下一状态条件分布的归一化条件。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;错&lt;/strong&gt;。前者来自环境响应，后者来自智能体选动作。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;错&lt;/strong&gt;。在 $s_9$ 执行 $a_5$ 与 $a_2$ 都留在 $s_9$，奖励分别为 $+1$ 与 $-1$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对&lt;/strong&gt;。回报累计当前一步与后续奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;错&lt;/strong&gt;。接近 0 更强调近期奖励；接近 1 更强调远期奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对&lt;/strong&gt;。episode 是按终止规则完成的一次 trial；trajectory 可不是完整回合，也可无限长。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对&lt;/strong&gt;。这是比“未来与过去无关”更准确的条件性表述。&lt;/li&gt;
&lt;/ol&gt;
&lt;h4&gt;选择题答案&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。本书采用所有状态共享五个动作的全局空间。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。向上撞边界，自转移到 $s_1$ 并得 $r_{\text{boundary}}=-1$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C&lt;/strong&gt;。$\pi(a|s)$ 是智能体的策略。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C&lt;/strong&gt;。两动作概率各为 0.5。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。向右撞边界，仍在 $s_9$，但得到 $-1$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。$0-1+0+1=0$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。$\gamma$ 接近 1 时远期权重衰减较慢。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C&lt;/strong&gt;。本书将 $s_9$ 当普通状态，$\mathcal A(s_9)={a_1,\ldots,a_5}$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。固定策略后 MDP 退化为 MP。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C&lt;/strong&gt;。Markov 性质是给定当前状态、动作后的条件独立陈述。&lt;/li&gt;
&lt;/ol&gt;
&lt;h4&gt;简答题参考答案&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;动作表达智能体意图；环境的 $p(s&apos;|s,a)$ 决定实际结果。撞边界会原地不动，随机风还可能使实际方向偏离意图。&lt;/li&gt;
&lt;li&gt;$\pi(a|s)$ 是给定状态时选择动作的概率，由智能体策略决定；$p(s&apos;|s,a)$ 是给定状态和动作时产生下一状态的概率，由环境动力学决定。&lt;/li&gt;
&lt;li&gt;即时奖励只评价当前一步，忽略未来。例如在 $s_4$ 一直选即时奖励为 0 的 $a_5$ 会停滞；选择同样即时奖励为 0 的 $a_2$ 却可继续到目标获得 $+1$。必须比较累计回报。&lt;/li&gt;
&lt;li&gt;trajectory 是状态—动作—奖励序列；terminal state 按任务规则结束交互；从开始到终止形成的一次完整、通常有限的 trajectory 就是 episode。&lt;/li&gt;
&lt;li&gt;两个 $p$ 都描述环境收到状态—动作后如何响应：产生下一状态和奖励；$\pi$ 描述智能体如何选动作，因此属于决策规则而非环境动力学。&lt;/li&gt;
&lt;/ol&gt;
&lt;h4&gt;计算或推导题答案&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;由 $s_3$ 开始：&lt;/p&gt;
&lt;p&gt;$$
s_3\xrightarrow[a_4]{r=0}s_2
\xrightarrow[a_3]{r=0}s_5
\xrightarrow[a_3]{r=0}s_8
\xrightarrow[a_2]{r=1}s_9.
$$&lt;/p&gt;
&lt;p&gt;未折扣回报为 $G=0+0+0+1=1$。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;使用闭式：&lt;/p&gt;
&lt;p&gt;$$
G=\frac{\gamma^3}{1-\gamma}
=\frac{0.5^3}{1-0.5}
=\frac{0.125}{0.5}
=0.25.
$$&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;策略先以 0.5 选 $a_2$，确定到 $s_2$；以 0.5 选 $a_3$，确定到 $s_4$。因此&lt;/p&gt;
&lt;p&gt;$$
P(s&apos;=s_2|s_1)=0.5,
\qquad
P(s&apos;=s_4|s_1)=0.5,
$$&lt;/p&gt;
&lt;p&gt;其余状态概率均为 0，全部下一状态概率之和为 1。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 10 - Actor-Critic Methods</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-10-actor-critic-methods/chapter-10---actor-critic-methods/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-10-actor-critic-methods/chapter-10---actor-critic-methods/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 10 - Actor-Critic Methods&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
Chapter 9 已经把策略优化写成梯度上升，但 REINFORCE 使用完整回合的 Monte Carlo 回报估计动作价值。本章把 TD 学习加入策略梯度，形成同时更新策略与价值的 Actor-Critic 结构：&lt;strong&gt;actor&lt;/strong&gt; 按价值反馈更新策略，&lt;strong&gt;critic&lt;/strong&gt; 用 TD 误差学习价值并评价 actor。教材从最简单的 Q actor-critic（QAC）出发，引入不改变期望梯度却能降低方差的基线，得到 advantage actor-critic（A2C）；随后用重要性采样把算法扩展到异策略数据；最后以确定性策略梯度说明，actor 也可以直接输出连续动作。整章的核心是把 Chapter 8 的 value-based 学习与 Chapter 9 的 policy-based 优化组合起来。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识结构&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-10-1-roadmap.png&quot; alt=&quot;Figure 10.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Chapter 8 提供价值函数近似与 TD 更新，构成 critic 的技术基础；&lt;/li&gt;
&lt;li&gt;Chapter 9 提供策略参数化、Policy Gradient Theorem 与 REINFORCE，构成 actor 的技术基础；&lt;/li&gt;
&lt;li&gt;Chapter 10 把策略更新和价值更新放进同一个在线学习循环；&lt;/li&gt;
&lt;li&gt;图中 “policy-based plus value-based” 正是 Actor-Critic 名称的结构含义。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;本章算法演进可以概括为：&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;flowchart LR
    PG[&quot;Policy Gradient&amp;lt;br/&amp;gt;策略参数更新&quot;] --&amp;gt; QAC[&quot;QAC&amp;lt;br/&amp;gt;用 TD 学 qπ&quot;]
    QAC --&amp;gt; BASE[&quot;加入状态基线 vπ&quot;]
    BASE --&amp;gt; A2C[&quot;A2C&amp;lt;br/&amp;gt;用 TD error 估计优势&quot;]
    A2C --&amp;gt; IS[&quot;Importance Sampling&amp;lt;br/&amp;gt;校正行为策略&quot;]
    IS --&amp;gt; OFF[&quot;Off-policy Actor-Critic&quot;]
    OFF --&amp;gt; DPG[&quot;Deterministic Actor-Critic&amp;lt;br/&amp;gt;actor 直接输出动作&quot;]
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;四个贯穿全章的问题是：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;actor 用什么信号更新？&lt;/strong&gt; 动作价值、优势或动作价值对动作的梯度。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;critic 学什么？&lt;/strong&gt; $q_\pi$、$v_\pi$ 或 $q_\mu$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;样本由谁产生？&lt;/strong&gt; 当前目标策略，或另一个行为策略。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;怎样控制估计误差？&lt;/strong&gt; 用基线降低方差，用重要性权重修正分布差异。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 一句话总览
Actor-Critic 仍然是策略梯度方法；“Actor-Critic”强调的是其实现结构：actor 直接改进策略，critic 用 TD 学习价值并为策略更新提供评价信号。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;1. 从 Policy Gradient 到 Q Actor-Critic&lt;/h2&gt;
&lt;h3&gt;1.1 Actor 与 Critic 分别做什么？&lt;/h3&gt;
&lt;p&gt;Actor-Critic（演员-评论家）包含两个相互配合的部分：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Actor&lt;/strong&gt;：策略更新步骤。动作按照策略产生，因而策略是“行动者”；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Critic&lt;/strong&gt;：价值更新步骤。价值估计评价当前策略及其动作选择，因而是“评论者”。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;两者的关系不是两个独立算法的简单拼接，而是一个反馈回路：&lt;/p&gt;
&lt;p&gt;$$
\text{策略产生动作}
\longrightarrow
\text{环境给出转移与奖励}
\longrightarrow
\text{critic 计算评价信号}
\longrightarrow
\text{actor 更新策略}.
$$&lt;/p&gt;
&lt;h3&gt;1.2 策略梯度的期望形式&lt;/h3&gt;
&lt;p&gt;回顾 Chapter 9，最大化标量指标 $J(\theta)$ 的梯度上升为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\theta_{t+1}
&amp;amp;=\theta_t+\alpha\nabla_\theta J(\theta_t)\
&amp;amp;=\theta_t+\alpha,
\mathbb E_{S\sim\eta,,A\sim\pi}
\left[
\nabla_\theta\ln\pi(A\mid S,\theta_t)q_\pi(S,A)
\right].
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\theta_t$：时刻 $t$ 的策略参数；&lt;/li&gt;
&lt;li&gt;$\alpha&amp;gt;0$：actor 的学习率；&lt;/li&gt;
&lt;li&gt;$\eta$：Policy Gradient Theorem 中的状态权重分布；&lt;/li&gt;
&lt;li&gt;$A\sim\pi$：动作由目标策略采样；&lt;/li&gt;
&lt;li&gt;$q_\pi(S,A)$：在策略 $\pi$ 下执行动作 $A$ 的长期价值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;由于真实期望未知，用时刻 $t$ 的单个样本近似后得到：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t
+\alpha\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t)
q_t(s_t,a_t).
\tag{10.2}
$$&lt;/p&gt;
&lt;p&gt;该式已经暴露了 Actor-Critic 的结构：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\nabla_\theta\ln\pi$ 直接修改策略，是 actor；&lt;/li&gt;
&lt;li&gt;$q_t(s_t,a_t)$ 必须由另一个学习过程估计，是 critic。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;1.3 REINFORCE 与 Actor-Critic 的分界&lt;/h3&gt;
&lt;p&gt;教材按照动作价值的估计方式区分两类算法：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;$q_t(s_t,a_t)$ 的来源&lt;/th&gt;
&lt;th&gt;更新时机&lt;/th&gt;
&lt;th&gt;教材名称&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Monte Carlo&lt;/td&gt;
&lt;td&gt;完整回合回报&lt;/td&gt;
&lt;td&gt;通常要等待回合结束&lt;/td&gt;
&lt;td&gt;REINFORCE / Monte Carlo policy gradient&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Temporal-Difference&lt;/td&gt;
&lt;td&gt;一步奖励与自举价值&lt;/td&gt;
&lt;td&gt;每个转移后即可更新&lt;/td&gt;
&lt;td&gt;Actor-Critic&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;因此，Actor-Critic 可以理解为：&lt;/p&gt;
&lt;p&gt;$$
\text{Policy Gradient}
+
\text{TD-based Value Estimation}.
$$&lt;/p&gt;
&lt;h3&gt;1.4 Algorithm 10.1：Q Actor-Critic（QAC）&lt;/h3&gt;
&lt;p&gt;QAC 是教材给出的最简单 Actor-Critic。Critic 用参数化动作价值函数 $q(s,a,w)$，并按 Sarsa 目标更新；Actor 使用 critic 当前给出的动作价值更新策略。&lt;/p&gt;
&lt;h4&gt;目标&lt;/h4&gt;
&lt;p&gt;学习最大化 $J(\theta)$ 的随机策略 $\pi(a\mid s,\theta)$。&lt;/p&gt;
&lt;h4&gt;初始化&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;策略函数 $\pi(a\mid s,\theta_0)$；&lt;/li&gt;
&lt;li&gt;动作价值函数 $q(s,a,w_0)$；&lt;/li&gt;
&lt;li&gt;学习率 $\alpha_\theta&amp;gt;0$、$\alpha_w&amp;gt;0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;每一步的交互与更新&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;按 $\pi(a\mid s_t,\theta_t)$ 生成 $a_t$；&lt;/li&gt;
&lt;li&gt;执行动作，观察 $r_{t+1},s_{t+1}$；&lt;/li&gt;
&lt;li&gt;按当前策略在 $s_{t+1}$ 生成 $a_{t+1}$；&lt;/li&gt;
&lt;li&gt;Actor 使用 $q(s_t,a_t,w_t)$ 更新策略；&lt;/li&gt;
&lt;li&gt;Critic 使用 Sarsa TD 误差更新 $w$。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Actor 更新为：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t
+\alpha_\theta
\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t)
q(s_t,a_t,w_t).
$$&lt;/p&gt;
&lt;p&gt;Critic 的 TD 误差为：&lt;/p&gt;
&lt;p&gt;$$
\delta_t^q
=r_{t+1}
+\gamma q(s_{t+1},a_{t+1},w_t)
-q(s_t,a_t,w_t).
$$&lt;/p&gt;
&lt;p&gt;Critic 更新为：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t
+\alpha_w\delta_t^q
\nabla_w q(s_t,a_t,w_t).
$$&lt;/p&gt;
&lt;p&gt;伪代码如下：&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;初始化策略参数 θ0、动作价值参数 w0
对每个回合：
    在状态 st 按 π(· | st, θt) 采样 at
    执行 at，观察 rt+1 和 st+1
    在 st+1 按 π(· | st+1, θt) 采样 at+1

    Actor:
        θt+1 &amp;lt;- θt + αθ grad_θ ln π(at | st, θt) q(st, at, wt)

    Critic:
        δt^q &amp;lt;- rt+1 + γq(st+1, at+1, wt) - q(st, at, wt)
        wt+1 &amp;lt;- wt + αw δt^q grad_w q(st, at, wt)
&lt;/code&gt;&lt;/pre&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] QAC 的核心
QAC 并没有改变策略梯度更新的形状，只是把原本由 Monte Carlo 完整回报提供的 $q_t$，换成由 Sarsa critic 在线学习的 $q(s,a,w)$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;2. Advantage Actor-Critic（A2C）&lt;/h2&gt;
&lt;p&gt;QAC 直接用动作价值的绝对大小更新策略。本节引入基线（baseline），把评价信号改成动作相对于该状态平均水平的优势，从而降低随机梯度的估计方差。&lt;/p&gt;
&lt;h3&gt;2.1 Baseline invariance：加入基线不改变期望梯度&lt;/h3&gt;
&lt;p&gt;对任意只依赖状态的标量函数 $b(S)$，策略梯度满足：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
&amp;amp;\mathbb E_{S\sim\eta,,A\sim\pi}
\left[
\nabla_\theta\ln\pi(A\mid S,\theta_t)q_\pi(S,A)
\right]\
&amp;amp;=\mathbb E_{S\sim\eta,,A\sim\pi}
\left[
\nabla_\theta\ln\pi(A\mid S,\theta_t)
\bigl(q_\pi(S,A)-b(S)\bigr)
\right].
\end{aligned}
\tag{10.3}
$$&lt;/p&gt;
&lt;p&gt;关键原因是基线项的期望为零：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E
\left[
\nabla_\theta\ln\pi(A\mid S,\theta_t)b(S)
\right]=0.
$$&lt;/p&gt;
&lt;h3&gt;2.2 为什么基线项的期望为零？&lt;/h3&gt;
&lt;p&gt;固定状态 $s$ 后，$b(s)$ 与动作 $a$ 无关，因此：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
&amp;amp;\mathbb E_{S\sim\eta,,A\sim\pi}
\left[
\nabla_\theta\ln\pi(A\mid S,\theta_t)b(S)
\right]\
&amp;amp;=\sum_{s\in\mathcal S}\eta(s)
\sum_{a\in\mathcal A}
\pi(a\mid s,\theta_t)
\nabla_\theta\ln\pi(a\mid s,\theta_t)b(s)\
&amp;amp;=\sum_s\eta(s)b(s)
\sum_a\nabla_\theta\pi(a\mid s,\theta_t)\
&amp;amp;=\sum_s\eta(s)b(s)
\nabla_\theta\sum_a\pi(a\mid s,\theta_t)\
&amp;amp;=\sum_s\eta(s)b(s)\nabla_\theta 1\
&amp;amp;=0.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;推导用到了 log-derivative 恒等式：&lt;/p&gt;
&lt;p&gt;$$
\pi(a\mid s,\theta)\nabla_\theta\ln\pi(a\mid s,\theta)
=\nabla_\theta\pi(a\mid s,\theta).
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 基线必须只依赖状态
上述抵消依赖于 $b(s)$ 能被移出动作求和。若直接令基线依赖所采样的动作，就不能由这段证明保证期望梯度保持不变。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.3 为什么基线有用？&lt;/h3&gt;
&lt;p&gt;定义单样本随机梯度向量：&lt;/p&gt;
&lt;p&gt;$$
X(S,A)
\doteq
\nabla_\theta\ln\pi(A\mid S,\theta_t)
\bigl[q_\pi(S,A)-b(S)\bigr].
\tag{10.4}
$$&lt;/p&gt;
&lt;p&gt;无论选择什么合法基线，$\mathbb E[X]$ 不变；但 $\operatorname{var}(X)$ 会改变。用单个样本 $x$ 近似 $\mathbb E[X]$ 时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;方差越小，单样本越可能接近期望梯度；&lt;/li&gt;
&lt;li&gt;方差越大，不同样本给出的更新方向和幅度越不稳定；&lt;/li&gt;
&lt;li&gt;REINFORCE 与 QAC 相当于选择 $b=0$，这并不保证方差较小。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2.4 Box 10.1：最优基线的推导&lt;/h3&gt;
&lt;p&gt;令 $\bar x\doteq\mathbb E[X]$。若 $X$ 是向量，教材以协方差矩阵迹作为标量方差目标：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\operatorname{tr}[\operatorname{var}(X)]
&amp;amp;=\operatorname{tr}\mathbb E[(X-\bar x)(X-\bar x)^T]\
&amp;amp;=\mathbb E[X^TX]-\bar x^T\bar x.
\end{aligned}
\tag{10.6}
$$&lt;/p&gt;
&lt;p&gt;这里使用了迹的循环性质 $\operatorname{tr}(AB)=\operatorname{tr}(BA)$。因为 $\bar x$ 对基线不变，只需最小化：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[X^TX]
=\mathbb E
\left[
\lVert\nabla_\theta\ln\pi\rVert^2
\bigl(q_\pi(S,A)-b(S)\bigr)^2
\right].
$$&lt;/p&gt;
&lt;p&gt;将状态期望展开：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[X^TX]
=\sum_{s\in\mathcal S}\eta(s)
\mathbb E_{A\sim\pi}
\left[
\lVert\nabla_\theta\ln\pi\rVert^2
\bigl(q_\pi(s,A)-b(s)\bigr)^2
\right].
$$&lt;/p&gt;
&lt;p&gt;令其关于每个 $b(s)$ 的导数为零，得到：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E_{A\sim\pi}
\left[
\lVert\nabla_\theta\ln\pi(A\mid s,\theta_t)\rVert^2
\bigl(b(s)-q_\pi(s,A)\bigr)
\right]=0.
$$&lt;/p&gt;
&lt;p&gt;解得最优基线：&lt;/p&gt;
&lt;h1&gt;$$
b^*(s)&lt;/h1&gt;
&lt;p&gt;\frac{
\mathbb E_{A\sim\pi}
\left[
\lVert\nabla_\theta\ln\pi(A\mid s,\theta_t)\rVert^2q_\pi(s,A)
\right]
}{
\mathbb E_{A\sim\pi}
\left[
\lVert\nabla_\theta\ln\pi(A\mid s,\theta_t)\rVert^2
\right]
}.
\tag{10.5}
$$&lt;/p&gt;
&lt;p&gt;该基线在方差意义下最优，但表达式较复杂。去掉梯度范数权重可得简洁的次优基线：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
b^\dagger(s)
&amp;amp;=\mathbb E_{A\sim\pi}[q_\pi(s,A)]\
&amp;amp;=v_\pi(s).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;因此，&lt;strong&gt;状态价值正好可以作为动作价值的基线&lt;/strong&gt;。&lt;/p&gt;
&lt;h3&gt;2.5 Advantage function&lt;/h3&gt;
&lt;p&gt;取 $b(s)=v_\pi(s)$ 后，策略梯度写成：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t
+\alpha\mathbb E
\left[
\nabla_\theta\ln\pi(A\mid S,\theta_t)
\bigl(q_\pi(S,A)-v_\pi(S)\bigr)
\right].
$$&lt;/p&gt;
&lt;p&gt;定义优势函数（advantage function）：&lt;/p&gt;
&lt;p&gt;$$
\delta_\pi(S,A)
\doteq q_\pi(S,A)-v_\pi(S).
$$&lt;/p&gt;
&lt;p&gt;由于：&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s)
=\sum_{a\in\mathcal A}\pi(a\mid s)q_\pi(s,a),
$$&lt;/p&gt;
&lt;p&gt;$v_\pi(s)$ 是该状态下动作价值的策略加权平均。因此：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\delta_\pi(s,a)&amp;gt;0$：动作 $a$ 优于当前策略在 $s$ 的平均水平；&lt;/li&gt;
&lt;li&gt;$\delta_\pi(s,a)&amp;lt;0$：动作 $a$ 劣于平均水平；&lt;/li&gt;
&lt;li&gt;$\delta_\pi(s,a)=0$：该动作与平均水平相同。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;单样本更新为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\theta_{t+1}
&amp;amp;=\theta_t
+\alpha\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t)
\bigl[q_t(s_t,a_t)-v_t(s_t)\bigr]\
&amp;amp;=\theta_t
+\alpha\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t)
\delta_t(s_t,a_t).
\end{aligned}
\tag{10.8}
$$&lt;/p&gt;
&lt;h3&gt;2.6 用 TD error 近似优势&lt;/h3&gt;
&lt;p&gt;教材利用动作价值定义得到：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
q_\pi(s_t,a_t)-v_\pi(s_t)
=\mathbb E\bigl[
R_{t+1}+\gamma v_\pi(S_{t+1})-v_\pi(S_t)
\mid S_t=s_t,A_t=a_t
\bigr].
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;因此可以用单个转移的 TD 误差近似优势：&lt;/p&gt;
&lt;p&gt;$$
q_t(s_t,a_t)-v_t(s_t)
\approx
r_{t+1}+\gamma v(s_{t+1},w_t)-v(s_t,w_t)
\doteq\delta_t.
$$&lt;/p&gt;
&lt;p&gt;这一替代有两个作用：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;无需等待完整回合；&lt;/li&gt;
&lt;li&gt;只需维护一个状态价值函数 $v(s,w)$，不用同时维护 $q(s,a,w)$ 与 $v(s,w)$ 两个网络。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;2.7 Algorithm 10.2：A2C / TD Actor-Critic&lt;/h3&gt;
&lt;h4&gt;初始化&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;随机策略 $\pi(a\mid s,\theta_0)$；&lt;/li&gt;
&lt;li&gt;状态价值函数 $v(s,w_0)$；&lt;/li&gt;
&lt;li&gt;学习率 $\alpha_\theta&amp;gt;0$、$\alpha_w&amp;gt;0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;一步更新&lt;/h4&gt;
&lt;p&gt;先按当前策略生成 $a_t$，观察 $r_{t+1},s_{t+1}$。TD 误差为：&lt;/p&gt;
&lt;p&gt;$$
\delta_t
=r_{t+1}+\gamma v(s_{t+1},w_t)-v(s_t,w_t).
$$&lt;/p&gt;
&lt;p&gt;Actor 更新：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t
+\alpha_\theta\delta_t
\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t).
$$&lt;/p&gt;
&lt;p&gt;Critic 更新：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t
+\alpha_w\delta_t\nabla_wv(s_t,w_t).
$$&lt;/p&gt;
&lt;p&gt;伪代码如下：&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;初始化策略参数 θ0、状态价值参数 w0
对每个时间步 t：
    按 π(· | st, θt) 采样 at
    执行 at，观察 rt+1 和 st+1

    δt &amp;lt;- rt+1 + γv(st+1, wt) - v(st, wt)

    Actor:
        θt+1 &amp;lt;- θt + αθ δt grad_θ ln π(at | st, θt)

    Critic:
        wt+1 &amp;lt;- wt + αw δt grad_w v(st, wt)
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;策略 $\pi(\theta_t)$ 本身是随机且具有探索性的，因此教材指出 A2C 不需要另加 $\epsilon$-greedy。教材还提到异步版本 A3C，但不在本章展开。&lt;/p&gt;
&lt;h3&gt;2.8 QAC、REINFORCE with baseline 与 A2C&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;策略评价信号&lt;/th&gt;
&lt;th&gt;价值估计&lt;/th&gt;
&lt;th&gt;需要的价值函数&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;QAC&lt;/td&gt;
&lt;td&gt;$q_t(s_t,a_t)$&lt;/td&gt;
&lt;td&gt;TD&lt;/td&gt;
&lt;td&gt;$q(s,a,w)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;REINFORCE with baseline&lt;/td&gt;
&lt;td&gt;$q_t(s_t,a_t)-v_t(s_t)$&lt;/td&gt;
&lt;td&gt;Monte Carlo&lt;/td&gt;
&lt;td&gt;回报估计与基线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;A2C&lt;/td&gt;
&lt;td&gt;TD error $\delta_t$&lt;/td&gt;
&lt;td&gt;TD&lt;/td&gt;
&lt;td&gt;$v(s,w)$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;3. Off-policy Actor-Critic&lt;/h2&gt;
&lt;h3&gt;3.1 为什么前面的算法是 on-policy？&lt;/h3&gt;
&lt;p&gt;QAC 与 A2C 的真实梯度都要求：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta J(\theta)
=\mathbb E_{S\sim\eta,,A\sim\pi}
\left[
\nabla_\theta\ln\pi(A\mid S,\theta)
\bigl(q_\pi(S,A)-v_\pi(S)\bigr)
\right].
$$&lt;/p&gt;
&lt;p&gt;用样本近似该期望时，动作必须由 $\pi$ 采样。此时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;产生数据的是 $\pi$；&lt;/li&gt;
&lt;li&gt;被评价、被改进的也是 $\pi$；&lt;/li&gt;
&lt;li&gt;行为策略与目标策略相同，所以是 on-policy。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;如果已有数据来自另一个行为策略 $\beta$，就需要把 $A\sim\beta$ 下的样本校正为目标策略 $\pi$ 下的期望。教材使用重要性采样（importance sampling）完成这一点。&lt;/p&gt;
&lt;h3&gt;3.2 Importance sampling 的一般形式&lt;/h3&gt;
&lt;p&gt;设目标分布为 $p_0$，但样本来自 $p_1$。目标是估计：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E_{X\sim p_0}[X].
$$&lt;/p&gt;
&lt;p&gt;插入 $p_1(x)/p_1(x)$：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E_{X\sim p_0}[X]
&amp;amp;=\sum_{x\in\mathcal X}p_0(x)x\
&amp;amp;=\sum_{x\in\mathcal X}p_1(x)
\frac{p_0(x)}{p_1(x)}x\
&amp;amp;=\mathbb E_{X\sim p_1}
\left[
\frac{p_0(X)}{p_1(X)}X
\right].
\end{aligned}
\tag{10.9}
$$&lt;/p&gt;
&lt;p&gt;定义：&lt;/p&gt;
&lt;p&gt;$$
f(x)=\frac{p_0(x)}{p_1(x)}x.
$$&lt;/p&gt;
&lt;p&gt;若 $x_1,\ldots,x_n$ 来自 $p_1$，则：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E_{X\sim p_0}[X]
\approx
\frac{1}{n}\sum_{i=1}^n
\frac{p_0(x_i)}{p_1(x_i)}x_i.
\tag{10.10}
$$&lt;/p&gt;
&lt;p&gt;比值：&lt;/p&gt;
&lt;p&gt;$$
\frac{p_0(x_i)}{p_1(x_i)}
$$&lt;/p&gt;
&lt;p&gt;称为重要性权重（importance weight）。其直观含义是：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;若 $p_0(x_i)&amp;gt;p_1(x_i)$，该样本在目标分布中更常见，应被放大；&lt;/li&gt;
&lt;li&gt;若 $p_0(x_i)&amp;lt;p_1(x_i)$，该样本在行为分布中出现得过多，应被缩小；&lt;/li&gt;
&lt;li&gt;若 $p_0=p_1$，权重恒为 $1$，退化为普通样本均值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;教材强调，公式只要求计算已采样点处的 $p_0(x_i)$ 和 $p_1(x_i)$，不要求枚举整个巨大样本空间。&lt;/p&gt;
&lt;h3&gt;3.3 教材示例：从偏置样本恢复目标期望&lt;/h3&gt;
&lt;p&gt;令：&lt;/p&gt;
&lt;p&gt;$$
\mathcal X={+1,-1}.
$$&lt;/p&gt;
&lt;p&gt;目标分布为：&lt;/p&gt;
&lt;p&gt;$$
p_0(X=+1)=0.5,
\qquad
p_0(X=-1)=0.5,
$$&lt;/p&gt;
&lt;p&gt;所以：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E_{X\sim p_0}[X]
=(+1)\times0.5+(-1)\times0.5=0.
$$&lt;/p&gt;
&lt;p&gt;行为分布为：&lt;/p&gt;
&lt;p&gt;$$
p_1(X=+1)=0.8,
\qquad
p_1(X=-1)=0.2,
$$&lt;/p&gt;
&lt;p&gt;所以：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E_{X\sim p_1}[X]
=(+1)\times0.8+(-1)\times0.2=0.6.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-10-2-importance-sampling.png&quot; alt=&quot;Figure 10.2：重要性采样示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;橙色圆点是由 $p_1$ 产生的 $+1$ 与 $-1$ 样本；由于 $p_1(+1)=0.8$，正样本明显更多；&lt;/li&gt;
&lt;li&gt;蓝色虚线是普通样本平均，随样本增加趋近 $\mathbb E_{p_1}[X]=0.6$；&lt;/li&gt;
&lt;li&gt;绿色实线是带重要性权重的平均，逐渐趋近目标值 $\mathbb E_{p_0}[X]=0$；&lt;/li&gt;
&lt;li&gt;该图展示了权重如何用来自 $p_1$ 的数据估计 $p_0$ 下的期望。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.4 支持集覆盖条件&lt;/h3&gt;
&lt;p&gt;重要性采样要求：&lt;/p&gt;
&lt;p&gt;$$
p_0(x)\neq0
\quad\Longrightarrow\quad
p_1(x)\neq0.
$$&lt;/p&gt;
&lt;p&gt;也就是说，行为分布必须覆盖目标分布可能取到的所有样本。若 $p_1(+1)=1$、$p_1(-1)=0$，则样本永远只有 $+1$。此时：&lt;/p&gt;
&lt;p&gt;$$
\frac{1}{n}\sum_{i=1}^n
\frac{p_0(x_i)}{p_1(x_i)}x_i
=\frac{1}{n}\sum_{i=1}^n\frac{0.5}{1}(+1)
=0.5,
$$&lt;/p&gt;
&lt;p&gt;无论样本数多大都无法恢复目标期望 $0$。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 覆盖条件不是“样本足够多”可以补救的
若行为策略对目标策略可能选择的某个动作给出零概率，那么这个动作永远不会进入数据集，重要性权重也无法凭空恢复缺失信息。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.5 Theorem 10.1：Off-policy Policy Gradient Theorem&lt;/h3&gt;
&lt;p&gt;设 $\beta$ 是行为策略，$\pi(a\mid s,\theta)$ 是要学习的目标策略。教材选择指标：&lt;/p&gt;
&lt;p&gt;$$
J(\theta)
=\sum_{s\in\mathcal S}d_\beta(s)v_\pi(s)
=\mathbb E_{S\sim d_\beta}[v_\pi(S)],
$$&lt;/p&gt;
&lt;p&gt;其中 $d_\beta$ 是行为策略 $\beta$ 的稳态状态分布。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 10.1 — Off-policy Policy Gradient Theorem
在折扣情形 $\gamma\in(0,1)$ 下，&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta J(\theta)
=\mathbb E_{S\sim\rho,,A\sim\beta}
\left[
\frac{\pi(A\mid S,\theta)}{\beta(A\mid S)}
\nabla_\theta\ln\pi(A\mid S,\theta)
q_\pi(S,A)
\right].
\tag{10.11}
$$&lt;/p&gt;
&lt;p&gt;状态权重为：&lt;/p&gt;
&lt;p&gt;$$
\rho(s)
\doteq
\sum_{s&apos;\in\mathcal S}
d_\beta(s&apos;)\Pr_\pi(s\mid s&apos;).
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;折扣总转移权重定义为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\Pr_\pi(s\mid s&apos;)
&amp;amp;=\sum_{k=0}^{\infty}\gamma^k[P_\pi^k]&lt;em&gt;{s&apos;s}\
&amp;amp;=\bigl[(I-\gamma P&lt;/em&gt;\pi)^{-1}\bigr]_{s&apos;s}.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;与 on-policy 梯度相比有两个显式变化：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;动作从 $A\sim\pi$ 改为 $A\sim\beta$；&lt;/li&gt;
&lt;li&gt;梯度中加入动作重要性权重 $\pi(A\mid S,\theta)/\beta(A\mid S)$。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;3.6 Box 10.2：Theorem 10.1 的证明&lt;/h3&gt;
&lt;p&gt;由于 $d_\beta$ 与目标策略参数 $\theta$ 无关：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta J(\theta)
=\sum_{s\in\mathcal S}d_\beta(s)\nabla_\theta v_\pi(s).
\tag{10.12}
$$&lt;/p&gt;
&lt;p&gt;利用 Chapter 9 的 Lemma 9.2：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\pi(s)
=\sum_{s&apos;\in\mathcal S}\Pr_\pi(s&apos;\mid s)
\sum_{a\in\mathcal A}
\nabla_\theta\pi(a\mid s&apos;,\theta)q_\pi(s&apos;,a).
\tag{10.13}
$$&lt;/p&gt;
&lt;p&gt;代入并交换求和顺序：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta J(\theta)
&amp;amp;=\sum_s d_\beta(s)
\sum_{s&apos;}\Pr_\pi(s&apos;\mid s)
\sum_a\nabla_\theta\pi(a\mid s&apos;,\theta)q_\pi(s&apos;,a)\
&amp;amp;=\sum_{s&apos;}
\left[
\sum_s d_\beta(s)\Pr_\pi(s&apos;\mid s)
\right]
\sum_a\nabla_\theta\pi(a\mid s&apos;,\theta)q_\pi(s&apos;,a)\
&amp;amp;=\sum_s\rho(s)
\sum_a\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;在动作求和中插入 $\beta(a\mid s)/\beta(a\mid s)$，并使用 $\nabla\pi=\pi\nabla\ln\pi$：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta J(\theta)
&amp;amp;=\sum_s\rho(s)
\sum_a\beta(a\mid s)
\frac{\pi(a\mid s,\theta)}{\beta(a\mid s)}
\nabla_\theta\ln\pi(a\mid s,\theta)q_\pi(s,a)\
&amp;amp;=\mathbb E_{S\sim\rho,,A\sim\beta}
\left[
\frac{\pi(A\mid S,\theta)}{\beta(A\mid S)}
\nabla_\theta\ln\pi(A\mid S,\theta)q_\pi(S,A)
\right].
\end{aligned}
$$&lt;/p&gt;
&lt;h3&gt;3.7 加入基线与 TD error&lt;/h3&gt;
&lt;p&gt;异策略梯度同样对任意状态基线 $b(S)$ 不变：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta J(\theta)
=\mathbb E
\left[
\frac{\pi(A\mid S,\theta)}{\beta(A\mid S)}
\nabla_\theta\ln\pi(A\mid S,\theta)
\bigl(q_\pi(S,A)-b(S)\bigr)
\right].
$$&lt;/p&gt;
&lt;p&gt;选择 $b(S)=v_\pi(S)$，并用 TD 误差近似优势：&lt;/p&gt;
&lt;p&gt;$$
\delta_t
=r_{t+1}+\gamma v(s_{t+1},w_t)-v(s_t,w_t).
$$&lt;/p&gt;
&lt;p&gt;定义时刻 $t$ 的重要性权重：&lt;/p&gt;
&lt;p&gt;$$
\omega_t
\doteq
\frac{\pi(a_t\mid s_t,\theta_t)}{\beta(a_t\mid s_t)}.
$$&lt;/p&gt;
&lt;p&gt;Actor 更新为：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t
+\alpha_\theta\omega_t\delta_t
\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t).
$$&lt;/p&gt;
&lt;h3&gt;3.8 Algorithm 10.3：Importance-sampling Off-policy Actor-Critic&lt;/h3&gt;
&lt;h4&gt;初始化&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;给定行为策略 $\beta(a\mid s)$；&lt;/li&gt;
&lt;li&gt;目标策略 $\pi(a\mid s,\theta_0)$；&lt;/li&gt;
&lt;li&gt;状态价值函数 $v(s,w_0)$；&lt;/li&gt;
&lt;li&gt;学习率 $\alpha_\theta&amp;gt;0$、$\alpha_w&amp;gt;0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;更新步骤&lt;/h4&gt;
&lt;pre&gt;&lt;code&gt;按行为策略 β(· | st) 采样 at
执行 at，观察 rt+1 和 st+1

δt &amp;lt;- rt+1 + γv(st+1, wt) - v(st, wt)
ωt &amp;lt;- π(at | st, θt) / β(at | st)

Actor:
    θt+1 &amp;lt;- θt + αθ ωt δt grad_θ ln π(at | st, θt)

Critic:
    wt+1 &amp;lt;- wt + αw ωt δt grad_w v(st, wt)
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;Critic 更新为：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t
+\alpha_w\omega_t\delta_t\nabla_wv(s_t,w_t).
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] Actor 和 Critic 都要校正
Algorithm 10.3 不只在策略更新中加入重要性权重；价值更新也从 on-policy 改成 off-policy，因此 critic 同样乘以 $\omega_t$。教材借此强调，重要性采样既能用于 policy-based 方法，也能用于 value-based 方法。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;教材指出，该算法还可进一步结合 eligibility traces，但本章不展开。&lt;/p&gt;
&lt;h2&gt;4. Deterministic Actor-Critic&lt;/h2&gt;
&lt;h3&gt;4.1 从随机策略到确定性策略&lt;/h3&gt;
&lt;p&gt;此前策略写成 $\pi(a\mid s,\theta)$，输出动作概率。确定性策略写成：&lt;/p&gt;
&lt;p&gt;$$
a=\mu(s,\theta),
$$&lt;/p&gt;
&lt;p&gt;它直接把状态映射到唯一动作。为简洁起见，教材常写作 $\mu(s)$。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;对比项&lt;/th&gt;
&lt;th&gt;随机策略 $\pi$&lt;/th&gt;
&lt;th&gt;确定性策略 $\mu$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;输出&lt;/td&gt;
&lt;td&gt;每个动作的概率&lt;/td&gt;
&lt;td&gt;一个具体动作&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;动作随机变量&lt;/td&gt;
&lt;td&gt;梯度期望中含 $A$&lt;/td&gt;
&lt;td&gt;梯度中不含 $A$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;典型表示&lt;/td&gt;
&lt;td&gt;概率分布网络&lt;/td&gt;
&lt;td&gt;状态到动作的函数或网络&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;重要用途&lt;/td&gt;
&lt;td&gt;直接探索、离散或连续动作&lt;/td&gt;
&lt;td&gt;自然异策略、连续动作空间&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;4.2 Theorem 10.2：Deterministic Policy Gradient&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 10.2 — Deterministic Policy Gradient Theorem
确定性策略的梯度可统一写为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta J(\theta)
&amp;amp;=\sum_{s\in\mathcal S}\eta(s)
\nabla_\theta\mu(s)
\left.
\nabla_a q_\mu(s,a)
\right\rvert_{a=\mu(s)}\
&amp;amp;=\mathbb E_{S\sim\eta}
\left[
\nabla_\theta\mu(S)
\left.
\nabla_aq_\mu(S,a)
\right\rvert_{a=\mu(S)}
\right].
\end{aligned}
\tag{10.14}
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;公式是一个链式法则结构：&lt;/p&gt;
&lt;p&gt;$$
\underbrace{\nabla_\theta\mu(s)}&lt;em&gt;{
\text{参数改变会怎样改变动作}}
\quad
\underbrace{\left.\nabla_aq&lt;/em&gt;\mu(s,a)\right\rvert_{a=\mu(s)}}_{
\text{动作改变会怎样改变价值}}.
$$&lt;/p&gt;
&lt;p&gt;二者相乘给出“参数改变会怎样改变价值”。&lt;/p&gt;
&lt;p&gt;教材特意保留先对 $a$ 求导、再令 $a=\mu(s)$ 的写法，因为直接写 $\nabla_aq_\mu(s,\mu(s))$ 容易让自变量 $a$ 的身份不清楚。&lt;/p&gt;
&lt;h3&gt;4.3 为什么确定性策略梯度天然是 off-policy？&lt;/h3&gt;
&lt;p&gt;式 (10.14) 的期望只对状态 $S$ 求，不含动作随机变量 $A$。因此，用样本估计梯度时不要求动作由目标策略 $\mu$ 采样；其他探索性行为策略也可以与环境交互。&lt;/p&gt;
&lt;p&gt;这与随机策略梯度形成对比：随机情形的梯度含 $A\sim\pi$，若数据来自 $\beta$，必须用重要性权重校正动作分布。&lt;/p&gt;
&lt;h3&gt;4.4 Metric 1：折扣平均状态价值&lt;/h3&gt;
&lt;p&gt;第一类指标是：&lt;/p&gt;
&lt;p&gt;$$
J(\theta)
=\mathbb E_{S\sim d_0}[v_\mu(S)]
=\sum_{s\in\mathcal S}d_0(s)v_\mu(s),
\tag{10.15}
$$&lt;/p&gt;
&lt;p&gt;其中 $d_0$ 与 $\mu$ 无关。教材给出两种重要选择：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;$d_0(s_0)=1$：只关心从特定状态 $s_0$ 出发的折扣回报；&lt;/li&gt;
&lt;li&gt;$d_0$ 取某个行为策略的状态分布：用行为策略采集的状态来学习目标策略。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;4.5 Lemma 10.1：单个状态价值的梯度&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Lemma 10.1 — Gradient of $v_\mu(s)$
在折扣情形下，对任意 $s\in\mathcal S$：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\mu(s)
=\sum_{s&apos;\in\mathcal S}
\Pr_\mu(s&apos;\mid s)
\nabla_\theta\mu(s&apos;)
\left.
\nabla_aq_\mu(s&apos;,a)
\right\rvert_{a=\mu(s&apos;)}.
\tag{10.16}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;p&gt;$$
\Pr_\mu(s&apos;\mid s)
\doteq
\sum_{k=0}^{\infty}\gamma^k[P_\mu^k]&lt;em&gt;{ss&apos;}
=\bigl[(I-\gamma P&lt;/em&gt;\mu)^{-1}\bigr]_{ss&apos;}.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;$\Pr_\mu(s&apos;\mid s)$ 是从 $s$ 出发，在任意步数到达 $s&apos;$ 的折扣总转移权重。&lt;/p&gt;
&lt;h3&gt;4.6 Box 10.3：Lemma 10.1 的证明&lt;/h3&gt;
&lt;p&gt;确定性策略下：&lt;/p&gt;
&lt;p&gt;$$
v_\mu(s)=q_\mu(s,\mu(s)).
$$&lt;/p&gt;
&lt;p&gt;由于 $q_\mu$ 和 $\mu$ 都依赖 $\theta$，链式法则给出：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta v_\mu(s)
&amp;amp;=\left.\nabla_\theta q_\mu(s,a)\right\rvert_{a=\mu(s)}\
&amp;amp;\quad+\nabla_\theta\mu(s)
\left.\nabla_aq_\mu(s,a)\right\rvert_{a=\mu(s)}.
\end{aligned}
\tag{10.17}
$$&lt;/p&gt;
&lt;p&gt;动作价值满足：&lt;/p&gt;
&lt;p&gt;$$
q_\mu(s,a)
=r(s,a)+\gamma\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)v_\mu(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;环境的 $r(s,a)$ 与 $p(s&apos;\mid s,a)$ 不依赖策略参数，因此：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta q_\mu(s,a)
=\gamma\sum_{s&apos;}p(s&apos;\mid s,a)\nabla_\theta v_\mu(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;代回式 (10.17)，并定义：&lt;/p&gt;
&lt;p&gt;$$
u(s)
\doteq
\nabla_\theta\mu(s)
\left.\nabla_aq_\mu(s,a)\right\rvert_{a=\mu(s)},
$$&lt;/p&gt;
&lt;p&gt;得到递归：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\mu(s)
=\gamma\sum_{s&apos;}p(s&apos;\mid s,\mu(s))
\nabla_\theta v_\mu(s&apos;)+u(s).
$$&lt;/p&gt;
&lt;p&gt;将所有状态堆叠，设状态数为 $n$、参数维数为 $m$：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\mu
=u+\gamma(P_\mu\otimes I_m)\nabla_\theta v_\mu.
$$&lt;/p&gt;
&lt;p&gt;解这个线性方程：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta v_\mu
&amp;amp;=(I_{mn}-\gamma P_\mu\otimes I_m)^{-1}u\
&amp;amp;=\bigl[(I_n-\gamma P_\mu)^{-1}\otimes I_m\bigr]u.
\end{aligned}
\tag{10.18}
$$&lt;/p&gt;
&lt;p&gt;元素形式为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta v_\mu(s)
&amp;amp;=\sum_{s&apos;}
\bigl[(I-\gamma P_\mu)^{-1}\bigr]&lt;em&gt;{ss&apos;}u(s&apos;)\
&amp;amp;=\sum&lt;/em&gt;{s&apos;}\Pr_\mu(s&apos;\mid s)
\nabla_\theta\mu(s&apos;)
\left.\nabla_aq_\mu(s&apos;,a)\right\rvert_{a=\mu(s&apos;)}.
\end{aligned}
\tag{10.19}
$$&lt;/p&gt;
&lt;p&gt;最后使用 Neumann 级数解释矩阵逆：&lt;/p&gt;
&lt;p&gt;$$
(I-\gamma P_\mu)^{-1}
=I+\gamma P_\mu+\gamma^2P_\mu^2+\cdots.
$$&lt;/p&gt;
&lt;p&gt;其中 $[P_\mu^k]_{ss&apos;}$ 是恰好经过 $k$ 步从 $s$ 到 $s&apos;$ 的概率，故求和正是折扣总转移权重。&lt;/p&gt;
&lt;h3&gt;4.7 Theorem 10.3：折扣情形的确定性策略梯度&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 10.3 — Discounted Deterministic Policy Gradient
对式 (10.15) 的指标：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta J(\theta)
&amp;amp;=\sum_{s\in\mathcal S}\rho_\mu(s)
\nabla_\theta\mu(s)
\left.\nabla_aq_\mu(s,a)\right\rvert_{a=\mu(s)}\
&amp;amp;=\mathbb E_{S\sim\rho_\mu}
\left[
\nabla_\theta\mu(S)
\left.\nabla_aq_\mu(S,a)\right\rvert_{a=\mu(S)}
\right],
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;p&gt;$$
\rho_\mu(s)
=\sum_{s&apos;\in\mathcal S}d_0(s&apos;)\Pr_\mu(s\mid s&apos;).
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.8 Box 10.4：Theorem 10.3 的证明&lt;/h3&gt;
&lt;p&gt;证明只需对式 (10.15) 求导并代入 Lemma 10.1：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta J(\theta)
&amp;amp;=\sum_s d_0(s)\nabla_\theta v_\mu(s)\
&amp;amp;=\sum_s d_0(s)\sum_{s&apos;}\Pr_\mu(s&apos;\mid s)u(s&apos;)\
&amp;amp;=\sum_{s&apos;}
\left[
\sum_s d_0(s)\Pr_\mu(s&apos;\mid s)
\right]u(s&apos;)\
&amp;amp;=\sum_s\rho_\mu(s)u(s).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;教材在有限状态、有限动作情形下给出上述证明；若状态和动作连续，则相应求和需要替换为积分。&lt;/p&gt;
&lt;h3&gt;4.9 Metric 2：无折扣平均奖励&lt;/h3&gt;
&lt;p&gt;无折扣指标定义为：&lt;/p&gt;
&lt;p&gt;$$
J(\theta)
=\bar r_\mu
=\sum_{s\in\mathcal S}d_\mu(s)r_\mu(s)
=\mathbb E_{S\sim d_\mu}[r_\mu(S)],
\tag{10.20}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;p&gt;$$
r_\mu(s)
=\mathbb E[R\mid s,a=\mu(s)]
=\sum_r r,p(r\mid s,a=\mu(s)),
$$&lt;/p&gt;
&lt;p&gt;$d_\mu$ 是策略 $\mu$ 诱导的稳态状态分布。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 10.4 — Undiscounted Deterministic Policy Gradient
在无折扣情形下：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta J(\theta)
&amp;amp;=\sum_{s\in\mathcal S}d_\mu(s)
\nabla_\theta\mu(s)
\left.\nabla_aq_\mu(s,a)\right\rvert_{a=\mu(s)}\
&amp;amp;=\mathbb E_{S\sim d_\mu}
\left[
\nabla_\theta\mu(S)
\left.\nabla_aq_\mu(S,a)\right\rvert_{a=\mu(S)}
\right].
\end{aligned}
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.10 Box 10.5：Theorem 10.4 的证明结构&lt;/h3&gt;
&lt;p&gt;无折扣差分动作价值为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
q_\mu(s,a)
&amp;amp;=\mathbb E[R_{t+1}-\bar r_\mu+v_\mu(S_{t+1})\mid s,a]\
&amp;amp;=r(s,a)-\bar r_\mu
+\sum_{s&apos;}p(s&apos;\mid s,a)v_\mu(s&apos;).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;仍从 $v_\mu(s)=q_\mu(s,\mu(s))$ 出发，链式法则给出：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\mu(s)
=\left.\nabla_\theta q_\mu(s,a)\right\rvert_{a=\mu(s)}
+u(s).
\tag{10.21}
$$&lt;/p&gt;
&lt;p&gt;由于环境奖励和转移概率不依赖 $\theta$：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta q_\mu(s,a)
=-\nabla_\theta\bar r_\mu
+\sum_{s&apos;}p(s&apos;\mid s,a)\nabla_\theta v_\mu(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;将所有状态堆叠：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\mu
=u-\mathbf 1_n\otimes\nabla_\theta\bar r_\mu
+(P_\mu\otimes I_m)\nabla_\theta v_\mu.
$$&lt;/p&gt;
&lt;p&gt;整理为：&lt;/p&gt;
&lt;p&gt;$$
\mathbf 1_n\otimes\nabla_\theta\bar r_\mu
=u+(P_\mu\otimes I_m)\nabla_\theta v_\mu
-\nabla_\theta v_\mu.
\tag{10.22}
$$&lt;/p&gt;
&lt;p&gt;左乘 $d_\mu^T\otimes I_m$，利用：&lt;/p&gt;
&lt;p&gt;$$
d_\mu^TP_\mu=d_\mu^T,
\qquad
d_\mu^T\mathbf 1_n=1,
$$&lt;/p&gt;
&lt;p&gt;两个价值梯度项抵消，最终得到：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta\bar r_\mu
&amp;amp;=(d_\mu^T\otimes I_m)u\
&amp;amp;=\sum_s d_\mu(s)
\nabla_\theta\mu(s)
\left.\nabla_aq_\mu(s,a)\right\rvert_{a=\mu(s)}.
\end{aligned}
$$&lt;/p&gt;
&lt;h3&gt;4.11 Algorithm 10.4：Deterministic Actor-Critic&lt;/h3&gt;
&lt;h4&gt;初始化&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;探索性行为策略 $\beta(a\mid s)$；&lt;/li&gt;
&lt;li&gt;确定性目标策略 $\mu(s,\theta_0)$；&lt;/li&gt;
&lt;li&gt;动作价值函数 $q(s,a,w_0)$；&lt;/li&gt;
&lt;li&gt;学习率 $\alpha_\theta&amp;gt;0$、$\alpha_w&amp;gt;0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;TD error&lt;/h4&gt;
&lt;p&gt;行为策略在 $s_t$ 产生 $a_t$ 并与环境交互。下一状态的目标动作由确定性策略计算：&lt;/p&gt;
&lt;p&gt;$$
\widetilde a_{t+1}=\mu(s_{t+1},\theta_t).
$$&lt;/p&gt;
&lt;p&gt;TD 误差为：&lt;/p&gt;
&lt;p&gt;$$
\delta_t
=r_{t+1}
+\gamma q(s_{t+1},\mu(s_{t+1},\theta_t),w_t)
-q(s_t,a_t,w_t).
$$&lt;/p&gt;
&lt;h4&gt;Actor 更新&lt;/h4&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t
+\alpha_\theta
\nabla_\theta\mu(s_t,\theta_t)
\left.
\nabla_aq(s_t,a,w_t)
\right\rvert_{a=\mu(s_t)}.
$$&lt;/p&gt;
&lt;h4&gt;Critic 更新&lt;/h4&gt;
&lt;p&gt;$$
w_{t+1}
=w_t
+\alpha_w\delta_t\nabla_wq(s_t,a_t,w_t).
$$&lt;/p&gt;
&lt;p&gt;完整伪代码：&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;初始化行为策略 β、目标策略参数 θ0、动作价值参数 w0
对每个时间步 t：
    按 β 在 st 生成 at
    执行 at，观察 rt+1 和 st+1

    ãt+1 &amp;lt;- μ(st+1, θt)
    δt &amp;lt;- rt+1 + γq(st+1, ãt+1, wt) - q(st, at, wt)

    Actor:
        θt+1 &amp;lt;- θt + αθ grad_θ μ(st, θt)
                    [grad_a q(st, a, wt)] evaluated at a = μ(st)

    Critic:
        wt+1 &amp;lt;- wt + αw δt grad_w q(st, at, wt)
&lt;/code&gt;&lt;/pre&gt;
&lt;h3&gt;4.12 为什么 critic 是 off-policy，却不使用重要性权重？&lt;/h3&gt;
&lt;p&gt;Critic 所需的经验可写成：&lt;/p&gt;
&lt;p&gt;$$
(s_t,a_t,r_{t+1},s_{t+1},\widetilde a_{t+1}).
$$&lt;/p&gt;
&lt;p&gt;其中有两个动作：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$a_t$ 由行为策略 $\beta$ 产生，并真正与环境交互；&lt;/li&gt;
&lt;li&gt;$\widetilde a_{t+1}=\mu(s_{t+1})$ 只用于构造 TD 目标，不在下一步与环境交互。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Critic 的更新结构与 Q-learning 类似：当前转移可由行为策略产生，而自举目标明确使用要评价的目标策略 $\mu$。因此教材的 Algorithm 10.4 不需要像 Algorithm 10.3 那样乘动作重要性权重。&lt;/p&gt;
&lt;h3&gt;4.13 价值函数与行为策略的选择&lt;/h3&gt;
&lt;p&gt;教材给出两种 critic 表示：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;原始 deterministic policy gradient 工作采用线性函数 $q(s,a,w)=\phi^T(s,a)w$；&lt;/li&gt;
&lt;li&gt;DDPG 使用神经网络表示 $q(s,a,w)$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;行为策略 $\beta$ 可以是任意探索性策略，也可以通过向 $\mu$ 的动作加入噪声构造。教材把后一种方式描述为由目标策略自身产生探索行为的 on-policy 实现。&lt;/p&gt;
&lt;h2&gt;5. 四类 Actor-Critic 算法的统一比较&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;算法&lt;/th&gt;
&lt;th&gt;Actor 信号&lt;/th&gt;
&lt;th&gt;Critic 表示&lt;/th&gt;
&lt;th&gt;数据策略&lt;/th&gt;
&lt;th&gt;关键新增机制&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;QAC&lt;/td&gt;
&lt;td&gt;$q(s_t,a_t,w_t)$&lt;/td&gt;
&lt;td&gt;动作价值 $q$&lt;/td&gt;
&lt;td&gt;$\pi$&lt;/td&gt;
&lt;td&gt;TD 替代 MC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;A2C&lt;/td&gt;
&lt;td&gt;TD error $\delta_t$&lt;/td&gt;
&lt;td&gt;状态价值 $v$&lt;/td&gt;
&lt;td&gt;$\pi$&lt;/td&gt;
&lt;td&gt;状态基线与优势&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Off-policy AC&lt;/td&gt;
&lt;td&gt;$\omega_t\delta_t$&lt;/td&gt;
&lt;td&gt;状态价值 $v$&lt;/td&gt;
&lt;td&gt;$\beta$&lt;/td&gt;
&lt;td&gt;重要性采样&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Deterministic AC&lt;/td&gt;
&lt;td&gt;$\nabla_\theta\mu,\nabla_aq$&lt;/td&gt;
&lt;td&gt;动作价值 $q$&lt;/td&gt;
&lt;td&gt;$\beta$&lt;/td&gt;
&lt;td&gt;确定性策略梯度&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;从更新结构看：&lt;/p&gt;
&lt;p&gt;$$
\text{QAC}
\xrightarrow{\text{减去 }v_\pi(s)}
\text{A2C}
\xrightarrow{\text{乘 }\pi/\beta}
\text{Off-policy AC}.
$$&lt;/p&gt;
&lt;p&gt;确定性 Actor-Critic 则改变了 actor 的形式：不再用 $\nabla\ln\pi$ 乘优势，而是沿着动作价值对动作的梯度，通过链式法则更新策略参数。&lt;/p&gt;
&lt;h2&gt;6. 本章 Q&amp;amp;A&lt;/h2&gt;
&lt;h3&gt;Q1：Actor-Critic 与 Policy Gradient 是什么关系？&lt;/h3&gt;
&lt;p&gt;Actor-Critic 本质上仍是策略梯度方法。任何策略梯度算法都需要动作价值或等价评价信号；当该信号由带函数近似的 TD 学习产生时，通常称为 Actor-Critic。“Actor-Critic”突出策略更新与价值更新同时存在的算法结构。&lt;/p&gt;
&lt;h3&gt;Q2：为什么要引入基线？&lt;/h3&gt;
&lt;p&gt;合法状态基线的期望梯度贡献为零，因此不会改变真实策略梯度；但它会改变随机梯度的方差。以状态价值为基线后，actor 根据相对优势而不是动作价值的绝对大小更新。&lt;/p&gt;
&lt;h3&gt;Q3：重要性采样只能用于策略方法吗？&lt;/h3&gt;
&lt;p&gt;不能。重要性采样是用一个分布的样本估计另一个分布下期望的一般技术。价值函数与策略梯度本身都由期望定义，因此它既能修正 actor，也能修正 critic；Algorithm 10.3 的两个更新都使用了重要性权重。&lt;/p&gt;
&lt;h3&gt;Q4：为什么确定性策略梯度是 off-policy？&lt;/h3&gt;
&lt;p&gt;其真实梯度只对状态分布取期望，不含动作随机变量。估计梯度时不要求动作来自目标策略 $\mu$，所以可以由另一个探索性策略产生交互动作。&lt;/p&gt;
&lt;h3&gt;Q5：为什么 A2C 可以只维护一个状态价值网络？&lt;/h3&gt;
&lt;p&gt;因为优势 $q_\pi-v_\pi$ 可以用单步 TD 误差 $r+\gamma v(s&apos;)-v(s)$ 近似。这样无需额外维护动作价值网络。&lt;/p&gt;
&lt;h3&gt;Q6：Algorithm 10.3 与 Algorithm 10.4 的 off-policy 机制相同吗？&lt;/h3&gt;
&lt;p&gt;不同。Algorithm 10.3 对随机策略的动作分布差异使用 $\pi/\beta$ 校正；Algorithm 10.4 的确定性梯度不需要对动作采样，critic 又直接在 TD 目标中使用 $\mu(s_{t+1})$，因此教材版本没有重要性权重。&lt;/p&gt;
&lt;h2&gt;7. 本章总结&lt;/h2&gt;
&lt;p&gt;本章从 Chapter 9 的随机策略梯度出发，首先观察到更新式中必须有动作价值估计。若该估计来自 Monte Carlo，就得到 REINFORCE；若来自 TD critic，就得到最简单的 QAC。QAC 使用动作价值的绝对大小，教材随后证明策略梯度对任意状态基线不变，并以方差最小化推导最优基线。用状态价值作为实用基线后，actor 根据优势更新；再以 TD error 近似优势，就得到 A2C。&lt;/p&gt;
&lt;p&gt;为了使用由其他行为策略产生的数据，教材引入重要性采样。它用概率比重新加权样本，并要求行为分布覆盖目标分布的支持集。Off-policy Policy Gradient Theorem 把动作采样从 $\pi$ 改为 $\beta$，同时在 actor 和 critic 更新中加入 $\pi/\beta$。&lt;/p&gt;
&lt;p&gt;最后，教材把策略限制为确定性映射 $a=\mu(s,\theta)$。通过链式法则，策略梯度变成 $\nabla_\theta\mu$ 与 $\nabla_aq_\mu$ 的乘积。由于期望中不再含动作随机变量，确定性策略梯度天然允许异策略数据，并适合连续动作空间。至此，本书的 value-based 与 policy-based 两条主线汇合为现代强化学习常用的 Actor-Critic 框架。&lt;/p&gt;
&lt;p&gt;教材还提到 SAC、TRPO、PPO、TD3、多智能体强化学习、模型学习、分布强化学习以及强化学习与控制理论的联系，但未在本章展开。&lt;/p&gt;
&lt;h2&gt;8. 一页式复习&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Actor 更新策略，Critic 用价值评价策略。&lt;/li&gt;
&lt;li&gt;Actor-Critic = Policy Gradient + TD value estimation。&lt;/li&gt;
&lt;li&gt;QAC 的 actor 信号是 $q(s_t,a_t,w_t)$，critic 使用 Sarsa。&lt;/li&gt;
&lt;li&gt;状态基线 $b(s)$ 不改变期望策略梯度，因为动作概率和的梯度为零。&lt;/li&gt;
&lt;li&gt;最优基线是按 $\lVert\nabla\ln\pi\rVert^2$ 加权的动作价值均值。&lt;/li&gt;
&lt;li&gt;实用基线取 $v_\pi(s)$，得到优势 $q_\pi(s,a)-v_\pi(s)$。&lt;/li&gt;
&lt;li&gt;A2C 用 TD error $r+\gamma v(s&apos;)-v(s)$ 近似优势。&lt;/li&gt;
&lt;li&gt;Importance sampling 用 $p_0/p_1$ 修正分布差异。&lt;/li&gt;
&lt;li&gt;行为分布必须覆盖目标分布：目标概率非零时，行为概率也必须非零。&lt;/li&gt;
&lt;li&gt;Off-policy AC 的 actor 和 critic 都乘 $\omega_t=\pi/\beta$。&lt;/li&gt;
&lt;li&gt;确定性策略 $\mu(s,\theta)$ 直接输出动作。&lt;/li&gt;
&lt;li&gt;Deterministic Policy Gradient 为 $\mathbb E[\nabla_\theta\mu,\nabla_aq_\mu]$。&lt;/li&gt;
&lt;li&gt;确定性梯度不含动作随机变量，因此自然支持 off-policy。&lt;/li&gt;
&lt;li&gt;Deterministic critic 的 TD 目标使用 $\mu(s_{t+1})$，而交互动作来自 $\beta$。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;9. 公式清单&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;公式&lt;/th&gt;
&lt;th&gt;名称&lt;/th&gt;
&lt;th&gt;作用&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$\theta_{t+1}=\theta_t+\alpha\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t)q_t(s_t,a_t)$&lt;/td&gt;
&lt;td&gt;随机策略梯度更新&lt;/td&gt;
&lt;td&gt;Actor-Critic 的起点&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_\pi(s,a)=q_\pi(s,a)-v_\pi(s)$&lt;/td&gt;
&lt;td&gt;优势函数&lt;/td&gt;
&lt;td&gt;衡量动作相对平均水平的好坏&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_t=r_{t+1}+\gamma v(s_{t+1},w_t)-v(s_t,w_t)$&lt;/td&gt;
&lt;td&gt;TD error&lt;/td&gt;
&lt;td&gt;A2C 中近似优势并更新 critic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$b^*(s)=\frac{\mathbb E[\lVert\nabla\ln\pi\rVert^2q_\pi]}{\mathbb E[\lVert\nabla\ln\pi\rVert^2]}$&lt;/td&gt;
&lt;td&gt;最优基线&lt;/td&gt;
&lt;td&gt;最小化随机梯度方差&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathbb E_{p_0}[X]=\mathbb E_{p_1}[\frac{p_0(X)}{p_1(X)}X]$&lt;/td&gt;
&lt;td&gt;Importance sampling identity&lt;/td&gt;
&lt;td&gt;用 $p_1$ 样本估计 $p_0$ 期望&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\omega_t=\frac{\pi(a_t\mid s_t,\theta_t)}{\beta(a_t\mid s_t)}$&lt;/td&gt;
&lt;td&gt;动作重要性权重&lt;/td&gt;
&lt;td&gt;校正行为策略与目标策略差异&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Pr_\mu(s&apos;\mid s)=\sum_{k=0}^{\infty}\gamma^k[P_\mu^k]_{ss&apos;}$&lt;/td&gt;
&lt;td&gt;折扣总转移权重&lt;/td&gt;
&lt;td&gt;汇总未来各步到达状态的权重&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\nabla_\theta J=\mathbb E[\nabla_\theta\mu(S),\nabla_aq_\mu(S,a)\rvert_{a=\mu(S)}]$&lt;/td&gt;
&lt;td&gt;Deterministic Policy Gradient&lt;/td&gt;
&lt;td&gt;用价值关于动作的梯度更新确定性 actor&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_t=r_{t+1}+\gamma q(s_{t+1},\mu(s_{t+1}),w_t)-q(s_t,a_t,w_t)$&lt;/td&gt;
&lt;td&gt;Deterministic critic TD error&lt;/td&gt;
&lt;td&gt;用目标策略动作构造异策略 TD 目标&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;10. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$\theta$&lt;/td&gt;
&lt;td&gt;Actor / 策略函数参数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$w$&lt;/td&gt;
&lt;td&gt;Critic / 价值函数参数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\alpha_\theta$&lt;/td&gt;
&lt;td&gt;Actor 学习率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\alpha_w$&lt;/td&gt;
&lt;td&gt;Critic 学习率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi(a\mid s,\theta)$&lt;/td&gt;
&lt;td&gt;参数化随机策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mu(s,\theta)$&lt;/td&gt;
&lt;td&gt;参数化确定性策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi(s,a)$&lt;/td&gt;
&lt;td&gt;随机策略 $\pi$ 的动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi(s)$&lt;/td&gt;
&lt;td&gt;随机策略 $\pi$ 的状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\mu(s,a)$&lt;/td&gt;
&lt;td&gt;确定性策略 $\mu$ 的动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$b(s)$&lt;/td&gt;
&lt;td&gt;只依赖状态的策略梯度基线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_\pi(s,a)$&lt;/td&gt;
&lt;td&gt;优势函数 $q_\pi(s,a)-v_\pi(s)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_t$&lt;/td&gt;
&lt;td&gt;单步 TD 误差&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\beta(a\mid s)$&lt;/td&gt;
&lt;td&gt;产生经验数据的行为策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$d_\beta$&lt;/td&gt;
&lt;td&gt;行为策略的稳态状态分布&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\omega_t$&lt;/td&gt;
&lt;td&gt;动作重要性权重 $\pi/\beta$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$d_0$&lt;/td&gt;
&lt;td&gt;与目标策略无关的状态分布&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$d_\mu$&lt;/td&gt;
&lt;td&gt;确定性策略的稳态状态分布&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\rho,\rho_\mu$&lt;/td&gt;
&lt;td&gt;初始/行为状态权重经折扣转移累积得到的状态权重&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$P_\pi,P_\mu$&lt;/td&gt;
&lt;td&gt;随机/确定性策略诱导的状态转移矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Pr_\pi,\Pr_\mu$&lt;/td&gt;
&lt;td&gt;折扣总转移权重&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\otimes$&lt;/td&gt;
&lt;td&gt;Kronecker product&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$I_m$&lt;/td&gt;
&lt;td&gt;$m\times m$ 单位矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathbf 1_n$&lt;/td&gt;
&lt;td&gt;$n$ 维全 1 向量&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;11. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;English&lt;/th&gt;
&lt;th&gt;中文&lt;/th&gt;
&lt;th&gt;简要解释&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;actor&lt;/td&gt;
&lt;td&gt;行动者 / Actor&lt;/td&gt;
&lt;td&gt;直接更新策略参数的部分&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;critic&lt;/td&gt;
&lt;td&gt;评论者 / Critic&lt;/td&gt;
&lt;td&gt;学习价值并评价 actor 的部分&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Q actor-critic&lt;/td&gt;
&lt;td&gt;Q Actor-Critic&lt;/td&gt;
&lt;td&gt;用动作价值 critic 的最简单 Actor-Critic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;baseline&lt;/td&gt;
&lt;td&gt;基线&lt;/td&gt;
&lt;td&gt;从动作价值中减去、但不改变期望梯度的状态函数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;baseline invariance&lt;/td&gt;
&lt;td&gt;基线不变性&lt;/td&gt;
&lt;td&gt;合法基线不改变真实策略梯度&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;advantage function&lt;/td&gt;
&lt;td&gt;优势函数&lt;/td&gt;
&lt;td&gt;动作价值相对状态价值的差&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;advantage actor-critic&lt;/td&gt;
&lt;td&gt;优势 Actor-Critic&lt;/td&gt;
&lt;td&gt;用优势或 TD error 更新 actor 的方法&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;importance sampling&lt;/td&gt;
&lt;td&gt;重要性采样&lt;/td&gt;
&lt;td&gt;用概率比校正不同采样分布&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;importance weight&lt;/td&gt;
&lt;td&gt;重要性权重&lt;/td&gt;
&lt;td&gt;目标概率与行为概率的比值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;behavior policy&lt;/td&gt;
&lt;td&gt;行为策略&lt;/td&gt;
&lt;td&gt;产生交互数据的策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;target policy&lt;/td&gt;
&lt;td&gt;目标策略&lt;/td&gt;
&lt;td&gt;被评价和改进的策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;off-policy actor-critic&lt;/td&gt;
&lt;td&gt;异策略 Actor-Critic&lt;/td&gt;
&lt;td&gt;行为策略与目标策略不同的 Actor-Critic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;deterministic policy&lt;/td&gt;
&lt;td&gt;确定性策略&lt;/td&gt;
&lt;td&gt;每个状态直接映射到唯一动作&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;deterministic policy gradient&lt;/td&gt;
&lt;td&gt;确定性策略梯度&lt;/td&gt;
&lt;td&gt;通过 $\nabla_\theta\mu,\nabla_aq$ 更新策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;discounted total probability&lt;/td&gt;
&lt;td&gt;折扣总转移权重&lt;/td&gt;
&lt;td&gt;各步转移概率按 $\gamma^k$ 加权后的总和&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;12. 常见误区&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 1：Actor-Critic 不是与 Policy Gradient 并列的无关类别
Actor-Critic 本质上仍是策略梯度方法，只是用 TD critic 提供价值评价信号。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 2：Critic 不负责直接选择动作
动作由 actor 的策略产生；critic 负责估计价值并影响 actor 的更新方向。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 3：加入基线不是改变优化目标
合法状态基线的期望贡献为零，真实梯度保持不变；改变的是单样本估计的方差。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 4：A2C 的 TD error 不是动作价值本身
$\delta_t=r+\gamma v(s&apos;)-v(s)$ 是优势的单样本近似，可能为正也可能为负。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 5：状态价值基线不是严格的方差最优基线
严格最优基线含 $\lVert\nabla_\theta\ln\pi\rVert^2$ 权重；$v_\pi(s)$ 是去掉该权重后得到的简洁次优选择。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 6：重要性采样不能弥补零覆盖
若 $\pi(a\mid s)&amp;gt;0$ 而 $\beta(a\mid s)=0$，行为策略永远采不到该动作，概率比也无法定义。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 7：Algorithm 10.3 不只校正 actor
教材同时在 actor 和 critic 更新中乘以重要性权重，因为两部分都使用来自行为策略的数据。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 8：确定性策略不是“概率极大的随机策略”的记号替换
$\mu(s,\theta)$ 直接输出动作，梯度定理也从 score-function 形式变成对动作价值的链式求导。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 9：确定性 actor 的梯度不是只对 $q$ 的参数求导
Actor 更新需要先对动作 $a$ 求 $\nabla_aq(s,a,w)$，再通过 $\nabla_\theta\mu(s,\theta)$ 把梯度传回策略参数。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 10：Algorithm 10.4 中的两个下一动作角色不同
$a_t$ 由行为策略产生并与环境交互；$\mu(s_{t+1})$ 只用于 critic 的自举目标。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;13. 自测题&lt;/h2&gt;
&lt;h3&gt;13.1 概念题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;为什么说 Actor-Critic 仍然是 Policy Gradient 方法？&lt;/li&gt;
&lt;li&gt;QAC 与 REINFORCE 对动作价值的估计方式有何不同？&lt;/li&gt;
&lt;li&gt;为什么从 $q_\pi(s,a)$ 中减去只依赖状态的 $b(s)$ 不改变期望梯度？&lt;/li&gt;
&lt;li&gt;优势函数为正、为负分别表示什么？&lt;/li&gt;
&lt;li&gt;A2C 为什么只需维护状态价值函数？&lt;/li&gt;
&lt;li&gt;为什么 Algorithm 10.3 的 actor 和 critic 都要乘重要性权重？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Actor 的更新仍然沿 $\nabla_\theta J(\theta)$ 的随机估计上升；critic 只是提供策略梯度需要的价值评价信号。&lt;/li&gt;
&lt;li&gt;REINFORCE 用完整回合的 Monte Carlo 回报，QAC 用 Sarsa 型 TD 更新在线学习 $q(s,a,w)$。&lt;/li&gt;
&lt;li&gt;固定 $s$ 后，$b(s)$ 可移出动作求和，而 $\sum_a\nabla_\theta\pi(a\mid s,\theta)=\nabla_\theta1=0$。&lt;/li&gt;
&lt;li&gt;正优势表示动作价值高于当前策略在该状态的平均水平；负优势表示低于平均水平。&lt;/li&gt;
&lt;li&gt;$q_\pi-v_\pi$ 可用 $r+\gamma v(s&apos;)-v(s)$ 的 TD 误差近似，因此不用再维护独立动作价值网络。&lt;/li&gt;
&lt;li&gt;行为策略与目标策略不同会同时影响策略梯度样本和价值更新样本；教材用同一概率比校正两部分。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;13.2 判断与计算题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;判断：任意依赖 $(s,a)$ 的基线都能保持策略梯度不变。&lt;/li&gt;
&lt;li&gt;判断：若 $p_0(x)&amp;gt;0$ 但 $p_1(x)=0$，增加样本量最终仍能得到无偏估计。&lt;/li&gt;
&lt;li&gt;已知 $\pi(a_t\mid s_t)=0.3$、$\beta(a_t\mid s_t)=0.6$、$\delta_t=2$，求重要性权重与 actor 中乘在 score function 前的标量。&lt;/li&gt;
&lt;li&gt;已知 $r_{t+1}=1$、$\gamma=0.9$、$v(s_t)=2$、$v(s_{t+1})=3$，计算 A2C 的 TD error。&lt;/li&gt;
&lt;li&gt;教材示例中 $p_0(+1)=p_0(-1)=0.5$，$p_1(+1)=0.8$、$p_1(-1)=0.2$。分别求 $+1$ 与 $-1$ 的重要性权重。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;错。教材的证明要求基线只依赖状态，从而可以移出动作求和。&lt;/li&gt;
&lt;li&gt;错。行为分布没有覆盖该样本，信息永远不会出现，重要性权重也无法定义。&lt;/li&gt;
&lt;li&gt;重要性权重为：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
\omega_t=\frac{0.3}{0.6}=0.5.
$$&lt;/p&gt;
&lt;p&gt;乘在 score function 前的标量为：&lt;/p&gt;
&lt;p&gt;$$
\omega_t\delta_t=0.5\times2=1.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;TD error 为：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
\delta_t=1+0.9\times3-2=1.7.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;两个权重分别为：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
\frac{p_0(+1)}{p_1(+1)}=\frac{0.5}{0.8}=0.625,
$$&lt;/p&gt;
&lt;p&gt;$$
\frac{p_0(-1)}{p_1(-1)}=\frac{0.5}{0.2}=2.5.
$$&lt;/p&gt;
&lt;p&gt;$-1$ 在行为分布中出现得偏少，所以其样本被赋予更大权重。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;13.3 推导题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;从动作概率归一化条件推导基线项的期望为零。&lt;/li&gt;
&lt;li&gt;从 $v_\mu(s)=q_\mu(s,\mu(s))$ 推导式 (10.17) 的两个梯度项。&lt;/li&gt;
&lt;li&gt;说明为什么 $(I-\gamma P_\mu)^{-1}$ 可以解释为折扣总转移权重。&lt;/li&gt;
&lt;li&gt;在 Theorem 10.4 的证明中，为什么左乘 $d_\mu^T\otimes I_m$ 后价值梯度项会抵消？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;使用 $\pi\nabla\ln\pi=\nabla\pi$：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E[\nabla_\theta\ln\pi(A\mid S)b(S)]
&amp;amp;=\sum_s\eta(s)b(s)\sum_a\nabla_\theta\pi(a\mid s)\
&amp;amp;=\sum_s\eta(s)b(s)\nabla_\theta1\
&amp;amp;=0.
\end{aligned}
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;$q_\mu(s,\mu(s))$ 既通过目标策略改变 $q_\mu$，又通过输入动作 $\mu(s)$ 改变，因此链式法则给出：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
\nabla_\theta v_\mu(s)
=\left.\nabla_\theta q_\mu(s,a)\right\rvert_{a=\mu(s)}
+\nabla_\theta\mu(s)
\left.\nabla_aq_\mu(s,a)\right\rvert_{a=\mu(s)}.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;因为：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
(I-\gamma P_\mu)^{-1}
=\sum_{k=0}^{\infty}\gamma^kP_\mu^k,
$$&lt;/p&gt;
&lt;p&gt;而 $[P_\mu^k]_{ss&apos;}$ 是恰好经过 $k$ 步从 $s$ 到达 $s&apos;$ 的概率。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;稳态关系 $d_\mu^TP_\mu=d_\mu^T$ 使：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
(d_\mu^TP_\mu\otimes I_m)\nabla_\theta v_\mu
=(d_\mu^T\otimes I_m)\nabla_\theta v_\mu,
$$&lt;/p&gt;
&lt;p&gt;恰好与式 (10.22) 中的负价值梯度项抵消。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;13.4 算法题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;写出 QAC、A2C、off-policy A2C 与 deterministic actor-critic 的 actor 更新，并指出各自的评价信号。&lt;/li&gt;
&lt;li&gt;在 deterministic actor-critic 中，解释 $a_t$ 与 $\mu(s_{t+1})$ 的不同角色。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;四个 actor 更新分别是：&lt;/li&gt;
&lt;/ol&gt;
&lt;ul&gt;
&lt;li&gt;QAC：&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
\theta_{t+1}=\theta_t
+\alpha_\theta\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t)
q(s_t,a_t,w_t).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;A2C：&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
\theta_{t+1}=\theta_t
+\alpha_\theta\delta_t
\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Off-policy A2C：&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
\theta_{t+1}=\theta_t
+\alpha_\theta\omega_t\delta_t
\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Deterministic actor-critic：&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
\theta_{t+1}=\theta_t
+\alpha_\theta\nabla_\theta\mu(s_t,\theta_t)
\left.\nabla_aq(s_t,a,w_t)\right\rvert_{a=\mu(s_t)}.
$$&lt;/p&gt;
&lt;p&gt;它们的评价信号依次是动作价值、TD error、经重要性权重校正的 TD error，以及动作价值关于动作的梯度。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;$a_t$ 由行为策略产生并真正作用于环境；$\mu(s_{t+1})$ 是目标策略在下一状态给出的动作，只用于构造 critic 的自举目标。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 3 - Optimal State Values and Bellman Optimality Equation</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-3-optimal-state-values-and-bellman-optimality-equation/chapter-3---optimal-state-values-and-bellman-optimality-equation/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-3-optimal-state-values-and-bellman-optimality-equation/chapter-3---optimal-state-values-and-bellman-optimality-equation/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 3 - Optimal State Values and Bellman Optimality Equation&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
强化学习的最终目标是寻找最优策略（optimal policy）。本章先用状态价值定义“一个策略比另一个策略好”的含义，再引入贝尔曼最优方程（Bellman optimality equation, BOE）。BOE 把“选择策略”和“计算价值”统一成非线性不动点方程；借助压缩映射定理，可以证明最优价值存在且唯一、给出迭代求解算法，并证明从该价值贪心导出的策略确实最优。最后，本章分析折扣率和奖励设计如何改变最优行为，以及哪些奖励变换不会改变最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识结构&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-3-1.png&quot; alt=&quot;Figure 3.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; Chapter 3 位于基础工具层，承接 Chapter 2 针对给定策略的 Bellman 方程，并直接通向 Chapter 4 的 Value Iteration 与 Policy Iteration。Chapter 3 建立“最优性方程为何有解、解是否唯一、怎样求解、解为何对应最优策略”的理论基础。&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;flowchart LR
    V[&quot;给定策略的价值 v_π&quot;] --&amp;gt; C[&quot;比较策略&amp;lt;br/&amp;gt;逐状态不劣&quot;]
    C --&amp;gt; O[&quot;最优策略 π*&amp;lt;br/&amp;gt;最优价值 v*&quot;]
    O --&amp;gt; B[&quot;Bellman 最优方程&amp;lt;br/&amp;gt;对策略取最大&quot;]
    B --&amp;gt; F[&quot;不动点 v=f(v)&quot;]
    F --&amp;gt; T[&quot;压缩映射定理&quot;]
    T --&amp;gt; E[&quot;存在性 + 唯一性 + 迭代算法&quot;]
    E --&amp;gt; G[&quot;对 q* 贪心得到最优策略&quot;]
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;本章的推理主线是：&lt;/p&gt;
&lt;p&gt;$$
\text{动作价值改进策略}
\rightarrow \text{定义最优策略}
\rightarrow \text{建立 BOE}
\rightarrow \text{证明 BOE 是压缩映射}
\rightarrow \text{唯一最优价值与迭代求解}
\rightarrow \text{贪心最优策略}.
$$&lt;/p&gt;
&lt;h2&gt;1. 动机示例：怎样改进策略？&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-3-2.png&quot; alt=&quot;Figure 3.2：策略改进示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 橙色 $s_2$ 是禁止格，青色 $s_4$ 是目标格。给定策略在 $s_1$ 向右进入 $s_2$，立即得到 $-1$；直觉上，把 $s_1$ 的动作改为向下、进入 $s_3$，能够避开禁止格。&lt;/p&gt;
&lt;h3&gt;1.1 先评价原策略&lt;/h3&gt;
&lt;p&gt;给定策略 $\pi$ 的 Bellman 方程为&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_\pi(s_1)&amp;amp;=-1+\gamma v_\pi(s_2),\
v_\pi(s_2)&amp;amp;=1+\gamma v_\pi(s_4),\
v_\pi(s_3)&amp;amp;=1+\gamma v_\pi(s_4),\
v_\pi(s_4)&amp;amp;=1+\gamma v_\pi(s_4).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;当 $\gamma=0.9$ 时，解为&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s_4)=v_\pi(s_3)=v_\pi(s_2)=10,
\qquad
v_\pi(s_1)=8.
$$&lt;/p&gt;
&lt;h3&gt;1.2 比较 $s_1$ 的所有动作&lt;/h3&gt;
&lt;p&gt;动作 $a_1,a_2,a_3,a_4,a_5$ 分别表示向上、向右、向下、向左和不动。利用原策略的状态价值计算：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
q_\pi(s_1,a_1)&amp;amp;=-1+\gamma v_\pi(s_1)=6.2,\
q_\pi(s_1,a_2)&amp;amp;=-1+\gamma v_\pi(s_2)=8,\
q_\pi(s_1,a_3)&amp;amp;=0+\gamma v_\pi(s_3)=9,\
q_\pi(s_1,a_4)&amp;amp;=-1+\gamma v_\pi(s_1)=6.2,\
q_\pi(s_1,a_5)&amp;amp;=0+\gamma v_\pi(s_1)=7.2.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;由于&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s_1,a_3)\geq q_\pi(s_1,a_i),\qquad \forall i\neq3,
$$&lt;/p&gt;
&lt;p&gt;可将策略在 $s_1$ 的动作改为 $a_3$。这把“向下更好”的直觉转化为可计算规则：&lt;strong&gt;在一个状态选择动作价值最大的动作，可以改进策略。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;本例只在 $s_1$ 存在明显问题。接下来要回答更一般的问题：所有状态同时需要改进时怎么办？最优策略是否一定存在？它是否唯一？最优策略必须是确定性的吗？&lt;/p&gt;
&lt;h2&gt;2. 最优状态价值与最优策略&lt;/h2&gt;
&lt;p&gt;先定义策略之间的偏序。若对任意状态都有&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_1}(s)\geq v_{\pi_2}(s),\qquad \forall s\in\mathcal S,
$$&lt;/p&gt;
&lt;p&gt;则称 $\pi_1$ 比 $\pi_2$ 更好。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!definition] Definition 3.1 - 最优策略与最优状态价值
若策略 $\pi^&lt;em&gt;$ 对任意其他策略 $\pi$ 和任意状态 $s\in\mathcal S$ 都满足
$$
v_{\pi^&lt;/em&gt;}(s)\geq v_\pi(s),
$$
则 $\pi^&lt;em&gt;$ 是最优策略。$\pi^&lt;/em&gt;$ 的状态价值称为最优状态价值（optimal state value）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;记最优状态价值为&lt;/p&gt;
&lt;p&gt;$$
v^&lt;em&gt;=v_{\pi^&lt;/em&gt;}.
$$&lt;/p&gt;
&lt;p&gt;这个定义要求同一个策略在&lt;strong&gt;每个状态&lt;/strong&gt;都不劣于任何其他策略，而不是只在某个初始状态上表现最好。它立即提出四个必须解决的问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;存在性&lt;/strong&gt;：最优策略是否存在？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;唯一性&lt;/strong&gt;：最优策略是否唯一？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;随机性&lt;/strong&gt;：最优策略是随机策略还是确定性策略？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;算法&lt;/strong&gt;：怎样得到最优策略和最优状态价值？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 教材适用范围说明
教材在本章 Q&amp;amp;A 中强调，上述逐状态比较定义面向表格型强化学习。使用函数近似表示价值或策略时，需要采用其他评价指标；相关内容将在 Chapter 8 和 Chapter 9 展开。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;3. Bellman 最优方程&lt;/h2&gt;
&lt;h3&gt;3.1 逐状态形式&lt;/h3&gt;
&lt;p&gt;对每个 $s\in\mathcal S$，BOE 写为&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v(s)
&amp;amp;=\max_{\pi(s)\in\Pi(s)}
\sum_{a\in\mathcal A}\pi(a\mid s)
\left(
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)v(s&apos;)
\right)\
&amp;amp;=\max_{\pi(s)\in\Pi(s)}
\sum_{a\in\mathcal A}\pi(a\mid s)q(s,a),
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其中&lt;/p&gt;
&lt;p&gt;$$
q(s,a)\triangleq
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)v(s&apos;).
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\pi(s)$：状态 $s$ 上的一个动作概率分布；&lt;/li&gt;
&lt;li&gt;$\Pi(s)$：状态 $s$ 上所有可能策略的集合；&lt;/li&gt;
&lt;li&gt;$v(s),v(s&apos;)$：待求变量；&lt;/li&gt;
&lt;li&gt;$q(s,a)$：用当前候选价值 $v$ 做一步前瞻得到的动作价值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;BOE 与普通 Bellman 方程的区别是：普通 Bellman 方程固定 $\pi$ 并计算 $v_\pi$；BOE 在右侧对策略取最大，策略本身也是待求对象。&lt;/p&gt;
&lt;h3&gt;3.2 怎样处理右侧最大化？&lt;/h3&gt;
&lt;p&gt;BOE 看似用一个方程同时求 $v$ 与 $\pi$。教材的关键思路是：&lt;strong&gt;先在给定候选价值 $v$ 的情况下求右侧最优策略，再求不动点价值。&lt;/strong&gt;&lt;/p&gt;
&lt;h4&gt;Example 3.1：先解最大化变量，再解不动点变量&lt;/h4&gt;
&lt;p&gt;考虑&lt;/p&gt;
&lt;p&gt;$$
x=\max_{y\in\mathbb R}(2x-1-y^2).
$$&lt;/p&gt;
&lt;p&gt;无论 $x$ 是多少，右侧关于 $y$ 的最大值都在 $y=0$ 取得，因此&lt;/p&gt;
&lt;p&gt;$$
\max_y(2x-1-y^2)=2x-1.
$$&lt;/p&gt;
&lt;p&gt;再解 $x=2x-1$，得到 $x=1$。最终解是 $x=1,y=0$。这个例子说明两个未知量可按层次求解。&lt;/p&gt;
&lt;h4&gt;Example 3.2：概率加权平均的最大值&lt;/h4&gt;
&lt;p&gt;给定 $q_1,q_2,q_3\in\mathbb R$，最大化&lt;/p&gt;
&lt;p&gt;$$
\sum_{i=1}^3c_iq_i,
$$&lt;/p&gt;
&lt;p&gt;约束为 $c_1+c_2+c_3=1$ 且 $c_i\geq0$。若 $q_3\geq q_1,q_2$，最优解为 $c_3^&lt;em&gt;=1,c_1^&lt;/em&gt;=c_2^*=0$，因为&lt;/p&gt;
&lt;p&gt;$$
q_3=(c_1+c_2+c_3)q_3
\geq c_1q_1+c_2q_2+c_3q_3.
$$&lt;/p&gt;
&lt;p&gt;同理，由 $\sum_a\pi(a\mid s)=1$，有&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\sum_{a\in\mathcal A}\pi(a\mid s)q(s,a)
&amp;amp;\leq\sum_{a\in\mathcal A}\pi(a\mid s)
\max_{a&apos;\in\mathcal A}q(s,a&apos;)\
&amp;amp;=\max_{a\in\mathcal A}q(s,a).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;等号可由确定性策略取得：&lt;/p&gt;
&lt;p&gt;$$
\pi(a\mid s)=
\begin{cases}
1,&amp;amp;a=a^&lt;em&gt;,\
0,&amp;amp;a\neq a^&lt;/em&gt;,
\end{cases}
\qquad
a^*\in\arg\max_aq(s,a).
$$&lt;/p&gt;
&lt;p&gt;因此，对 BOE 右侧最大化的策略就是选择最大 $q(s,a)$ 的动作。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
若多个动作并列最大，任何只在这些最大动作之间分配概率的策略都能取得相同最大值。这解释了为什么最优价值可以唯一，而最优策略可能不唯一或是随机的。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.3 矩阵—向量形式与不动点&lt;/h3&gt;
&lt;p&gt;把所有状态的方程合并：&lt;/p&gt;
&lt;p&gt;$$
\boxed{
v=\max_{\pi\in\Pi}(r_\pi+\gamma P_\pi v)
}
$$&lt;/p&gt;
&lt;p&gt;其中最大化按元素进行，且&lt;/p&gt;
&lt;p&gt;$$
[r_\pi]&lt;em&gt;s
\triangleq\sum&lt;/em&gt;{a\in\mathcal A}\pi(a\mid s)
\sum_{r\in\mathcal R}p(r\mid s,a)r,
$$&lt;/p&gt;
&lt;p&gt;$$
[P_\pi]&lt;em&gt;{s,s&apos;}
\triangleq p&lt;/em&gt;\pi(s&apos;\mid s)
=\sum_{a\in\mathcal A}\pi(a\mid s)p(s&apos;\mid s,a).
$$&lt;/p&gt;
&lt;p&gt;定义 Bellman 最优算子&lt;/p&gt;
&lt;p&gt;$$
f(v)\triangleq\max_{\pi\in\Pi}(r_\pi+\gamma P_\pi v),
$$&lt;/p&gt;
&lt;p&gt;BOE 就是非线性不动点方程&lt;/p&gt;
&lt;p&gt;$$
\boxed{v=f(v).}
$$&lt;/p&gt;
&lt;p&gt;之所以非线性，是因为取得最大值的策略会随 $v$ 改变。&lt;/p&gt;
&lt;h3&gt;3.4 固定点与压缩映射&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!definition] 固定点（fixed point）
对函数 $f:\mathbb R^d\rightarrow\mathbb R^d$，若 $f(x^&lt;em&gt;)=x^&lt;/em&gt;$，则称 $x^*$ 为 $f$ 的固定点。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!definition] 压缩映射（contraction mapping）
若存在 $\gamma\in(0,1)$，使任意 $x_1,x_2\in\mathbb R^d$ 都满足
$$
\lVert f(x_1)-f(x_2)\rVert
\leq\gamma\lVert x_1-x_2\rVert,
$$
则 $f$ 是压缩映射。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;直观上，压缩映射把任意两点之间的距离至少缩小一个小于 $1$ 的比例。&lt;/p&gt;
&lt;h4&gt;Example 3.3：三个压缩映射&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;$f(x)=0.5x$：固定点为 $0$，且&lt;/p&gt;
&lt;p&gt;$$
\lvert0.5x_1-0.5x_2\rvert
=0.5\lvert x_1-x_2\rvert.
$$&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;$f(x)=Ax$，若 $\lVert A\rVert\leq\gamma&amp;lt;1$，则&lt;/p&gt;
&lt;p&gt;$$
\lVert Ax_1-Ax_2\rVert
\leq\lVert A\rVert\lVert x_1-x_2\rVert
\leq\gamma\lVert x_1-x_2\rVert.
$$&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;$f(x)=0.5\sin x$：由中值定理，某个 $x_3$ 位于 $x_1,x_2$ 之间，并且&lt;/p&gt;
&lt;p&gt;$$
\left\lvert
\frac{0.5\sin x_1-0.5\sin x_2}{x_1-x_2}
\right\rvert
=\lvert0.5\cos x_3\rvert\leq0.5.
$$&lt;/p&gt;
&lt;p&gt;因而 $\lvert0.5\sin x_1-0.5\sin x_2\rvert\leq0.5\lvert x_1-x_2\rvert$。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 3.1 - 压缩映射定理
对实向量方程 $x=f(x)$，若 $f$ 是压缩映射，则：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;固定点 $x^*$ 存在；&lt;/li&gt;
&lt;li&gt;固定点唯一；&lt;/li&gt;
&lt;li&gt;对任意初值 $x_0$，迭代 $x_{k+1}=f(x_k)$ 都收敛到 $x^*$；&lt;/li&gt;
&lt;li&gt;收敛速度为指数级。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Example 3.4：用迭代求固定点&lt;/h4&gt;
&lt;p&gt;上面的三个例子都可以从任意初值迭代：&lt;/p&gt;
&lt;p&gt;$$
x_{k+1}=0.5x_k,
\qquad
x_{k+1}=Ax_k,
\qquad
x_{k+1}=0.5\sin x_k.
$$&lt;/p&gt;
&lt;p&gt;它们都收敛到唯一固定点 $x^*=0$。&lt;/p&gt;
&lt;h3&gt;3.5 Box 3.1：压缩映射定理证明&lt;/h3&gt;
&lt;h4&gt;Part 1：迭代序列收敛&lt;/h4&gt;
&lt;p&gt;令 $x_k=f(x_{k-1})$。由压缩性，&lt;/p&gt;
&lt;p&gt;$$
\lVert x_{k+1}-x_k\rVert
\leq\gamma\lVert x_k-x_{k-1}\rVert
\leq\cdots\leq\gamma^k\lVert x_1-x_0\rVert.
$$&lt;/p&gt;
&lt;p&gt;仅有相邻差趋零还不足以证明序列收敛。例如 $x_n=\sqrt n$ 满足 $x_{n+1}-x_n\rightarrow0$，但序列发散。因此要证明它是 Cauchy 序列。&lt;/p&gt;
&lt;p&gt;对任意 $m&amp;gt;n$，由三角不等式和几何级数，&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\lVert x_m-x_n\rVert
&amp;amp;\leq\lVert x_m-x_{m-1}\rVert+\cdots+\lVert x_{n+1}-x_n\rVert\
&amp;amp;\leq(\gamma^{m-1}+\cdots+\gamma^n)\lVert x_1-x_0\rVert\
&amp;amp;\leq\frac{\gamma^n}{1-\gamma}\lVert x_1-x_0\rVert.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;因为 $\gamma^n\rightarrow0$，对任意 $\varepsilon&amp;gt;0$ 都能找到 $N$，使所有 $m,n&amp;gt;N$ 时 $\lVert x_m-x_n\rVert&amp;lt;\varepsilon$。所以序列是 Cauchy 序列，并收敛到某个 $x^*$。&lt;/p&gt;
&lt;h4&gt;Part 2：极限是固定点&lt;/h4&gt;
&lt;p&gt;$$
\lVert f(x_k)-x_k\rVert
=\lVert x_{k+1}-x_k\rVert
\leq\gamma^k\lVert x_1-x_0\rVert\rightarrow0.
$$&lt;/p&gt;
&lt;p&gt;取极限得到 $f(x^&lt;em&gt;)=x^&lt;/em&gt;$。&lt;/p&gt;
&lt;h4&gt;Part 3：固定点唯一&lt;/h4&gt;
&lt;p&gt;假设还有固定点 $x&apos;$，则&lt;/p&gt;
&lt;p&gt;$$
\lVert x&apos;-x^&lt;em&gt;\rVert
=\lVert f(x&apos;)-f(x^&lt;/em&gt;)\rVert
\leq\gamma\lVert x&apos;-x^*\rVert.
$$&lt;/p&gt;
&lt;p&gt;由于 $\gamma&amp;lt;1$，只能有 $\lVert x&apos;-x^&lt;em&gt;\rVert=0$，即 $x&apos;=x^&lt;/em&gt;$。&lt;/p&gt;
&lt;h4&gt;Part 4：指数收敛&lt;/h4&gt;
&lt;p&gt;让上面的 $m\rightarrow\infty$，可得误差界&lt;/p&gt;
&lt;p&gt;$$
\boxed{
\lVert x^*-x_n\rVert
\leq\frac{\gamma^n}{1-\gamma}\lVert x_1-x_0\rVert.
}
$$&lt;/p&gt;
&lt;p&gt;因此误差按 $\gamma^n$ 指数衰减。&lt;/p&gt;
&lt;h3&gt;3.6 BOE 右侧的压缩性质&lt;/h3&gt;
&lt;p&gt;教材使用最大范数&lt;/p&gt;
&lt;p&gt;$$
\lVert v\rVert_\infty=\max_i\lvert v_i\rvert.
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 3.2 - Bellman 最优算子的压缩性
对任意 $v_1,v_2\in\mathbb R^{\lvert\mathcal S\rvert}$，
$$
\lVert f(v_1)-f(v_2)\rVert_\infty
\leq\gamma\lVert v_1-v_2\rVert_\infty.
$$
因而 $f$ 在最大范数下是压缩映射。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Box 3.2：Theorem 3.2 证明&lt;/h4&gt;
&lt;p&gt;令&lt;/p&gt;
&lt;p&gt;$$
\pi_1^&lt;em&gt;\in\arg\max_\pi(r_\pi+\gamma P_\pi v_1),
\qquad
\pi_2^&lt;/em&gt;\in\arg\max_\pi(r_\pi+\gamma P_\pi v_2).
$$&lt;/p&gt;
&lt;p&gt;由最大值定义，&lt;/p&gt;
&lt;p&gt;$$
f(v_1)=r_{\pi_1^&lt;em&gt;}+\gamma P_{\pi_1^&lt;/em&gt;}v_1
\geq r_{\pi_2^&lt;em&gt;}+\gamma P_{\pi_2^&lt;/em&gt;}v_1,
$$&lt;/p&gt;
&lt;p&gt;$$
f(v_2)=r_{\pi_2^&lt;em&gt;}+\gamma P_{\pi_2^&lt;/em&gt;}v_2
\geq r_{\pi_1^&lt;em&gt;}+\gamma P_{\pi_1^&lt;/em&gt;}v_2.
$$&lt;/p&gt;
&lt;p&gt;于是逐元素有&lt;/p&gt;
&lt;p&gt;$$
\gamma P_{\pi_2^&lt;em&gt;}(v_1-v_2)
\leq f(v_1)-f(v_2)
\leq\gamma P_{\pi_1^&lt;/em&gt;}(v_1-v_2).
$$&lt;/p&gt;
&lt;p&gt;定义逐元素非负向量&lt;/p&gt;
&lt;p&gt;$$
z\triangleq\max\left{
\left\lvert\gamma P_{\pi_2^&lt;em&gt;}(v_1-v_2)\right\rvert,
\left\lvert\gamma P_{\pi_1^&lt;/em&gt;}(v_1-v_2)\right\rvert
\right},
$$&lt;/p&gt;
&lt;p&gt;则 $\lvert f(v_1)-f(v_2)\rvert\leq z$，所以&lt;/p&gt;
&lt;p&gt;$$
\lVert f(v_1)-f(v_2)\rVert_\infty
\leq\lVert z\rVert_\infty.
$$&lt;/p&gt;
&lt;p&gt;对 $P_{\pi_1^&lt;em&gt;}$ 或 $P_{\pi_2^&lt;/em&gt;}$ 的任一行向量 $p_i^T$，其元素非负且和为 $1$，因此&lt;/p&gt;
&lt;p&gt;$$
\left\lvert p_i^T(v_1-v_2)\right\rvert
\leq p_i^T\lvert v_1-v_2\rvert
\leq\lVert v_1-v_2\rVert_\infty.
$$&lt;/p&gt;
&lt;p&gt;从而 $\lVert z\rVert_\infty\leq\gamma\lVert v_1-v_2\rVert_\infty$，合并即得结论。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 证明的核心思想
最大化可能让 $v_1$ 与 $v_2$ 选择不同策略，但每个策略的转移矩阵都是行随机矩阵：它只能对分量做概率加权，不会放大最大范数；真正缩小差异的是 $\gamma&amp;lt;1$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;4. 从 BOE 求最优策略&lt;/h2&gt;
&lt;h3&gt;4.1 最优价值的存在、唯一与算法&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 3.3 - 存在性、唯一性与算法
BOE
$$
v=f(v)=\max_{\pi\in\Pi}(r_\pi+\gamma P_\pi v)
$$
总有唯一解 $v^&lt;em&gt;$。对任意初值 $v_0$，迭代
$$
v_{k+1}=f(v_k)=\max_{\pi\in\Pi}(r_\pi+\gamma P_\pi v_k)
$$
都以指数速度收敛到 $v^&lt;/em&gt;$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;证明直接来自 Theorem 3.1 与 Theorem 3.2。该迭代就是**价值迭代（value iteration）**的理论形式；具体实现放在 Chapter 4。&lt;/p&gt;
&lt;p&gt;得到 $v^*$ 后，通过&lt;/p&gt;
&lt;p&gt;$$
\pi^&lt;em&gt;\in\arg\max_{\pi\in\Pi}
(r_\pi+\gamma P_\pi v^&lt;/em&gt;)
$$&lt;/p&gt;
&lt;p&gt;求策略。将其代回 BOE：&lt;/p&gt;
&lt;p&gt;$$
v^&lt;em&gt;=r_{\pi^&lt;/em&gt;}+\gamma P_{\pi^&lt;em&gt;}v^&lt;/em&gt;.
$$&lt;/p&gt;
&lt;p&gt;所以 BOE 确实是一个特殊 Bellman 方程，其对应策略是 $\pi^&lt;em&gt;$，且 $v^&lt;/em&gt;=v_{\pi^*}$。&lt;/p&gt;
&lt;h3&gt;4.2 为什么 BOE 解出的策略真正最优？&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 3.4 - $v^&lt;em&gt;$ 与 $\pi^&lt;/em&gt;$ 的最优性
BOE 的价值解 $v^&lt;em&gt;$ 是最优状态价值，其对应策略 $\pi^&lt;/em&gt;$ 是最优策略。对任意策略 $\pi$，
$$
v^&lt;em&gt;=v_{\pi^&lt;/em&gt;}\geq v_\pi,
$$
其中不等式为逐元素比较。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Box 3.3：Theorem 3.4 证明&lt;/h4&gt;
&lt;p&gt;任意策略 $\pi$ 的价值满足&lt;/p&gt;
&lt;p&gt;$$
v_\pi=r_\pi+\gamma P_\pi v_\pi.
$$&lt;/p&gt;
&lt;p&gt;而 BOE 的最大化保证&lt;/p&gt;
&lt;p&gt;$$
v^&lt;em&gt;=\max_{\pi&apos;}(r_{\pi&apos;}+\gamma P_{\pi&apos;}v^&lt;/em&gt;)
\geq r_\pi+\gamma P_\pi v^*.
$$&lt;/p&gt;
&lt;p&gt;两式相减：&lt;/p&gt;
&lt;p&gt;$$
v^&lt;em&gt;-v_\pi
\geq\gamma P_\pi(v^&lt;/em&gt;-v_\pi).
$$&lt;/p&gt;
&lt;p&gt;反复应用得&lt;/p&gt;
&lt;p&gt;$$
v^&lt;em&gt;-v_\pi
\geq\gamma^nP_\pi^n(v^&lt;/em&gt;-v_\pi).
$$&lt;/p&gt;
&lt;p&gt;由于 $P_\pi^n$ 非负、元素不超过 $1$，且 $\gamma^n\rightarrow0$，右侧趋于零，因此 $v^&lt;em&gt;-v_\pi\geq0$。这对任意 $\pi$ 成立，故 $v^&lt;/em&gt;$ 最优。&lt;/p&gt;
&lt;h3&gt;4.3 确定性贪心最优策略&lt;/h3&gt;
&lt;p&gt;定义最优动作价值&lt;/p&gt;
&lt;p&gt;$$
q^&lt;em&gt;(s,a)\triangleq
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)v^&lt;/em&gt;(s&apos;).
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 3.5 - 贪心最优策略
对每个 $s\in\mathcal S$，选择
$$
a^&lt;em&gt;(s)\in\arg\max_aq^&lt;/em&gt;(s,a),
$$
并定义
$$
\pi^&lt;em&gt;(a\mid s)=
\begin{cases}
1,&amp;amp;a=a^&lt;/em&gt;(s),\
0,&amp;amp;a\neq a^*(s),
\end{cases}
$$
得到的确定性贪心策略是最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Box 3.4：Theorem 3.5 证明&lt;/h4&gt;
&lt;p&gt;最优策略的逐状态问题是&lt;/p&gt;
&lt;p&gt;$$
\pi^&lt;em&gt;(s)\in\arg\max_{\pi(s)\in\Pi(s)}
\sum_{a\in\mathcal A}\pi(a\mid s)q^&lt;/em&gt;(s,a).
$$&lt;/p&gt;
&lt;p&gt;概率加权平均不可能超过最大分量；把全部概率赋给最大 $q^*(s,a)$ 的动作即可达到上界。因此确定性贪心策略最优。&lt;/p&gt;
&lt;h3&gt;4.4 唯一性与随机性&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-3-3.png&quot; alt=&quot;Figure 3.3：两个不同但同为最优的策略&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 左图在左上状态确定性向右；右图在该状态以 $0.5$ 概率向右、以 $0.5$ 概率向下。两条路线的最优回报相同，所以两个策略虽然不同，却都最优。&lt;/p&gt;
&lt;p&gt;由此得到：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;最优状态价值 $v^*$ 唯一&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;最优策略未必唯一&lt;/strong&gt;，甚至可能有无穷多个；&lt;/li&gt;
&lt;li&gt;最优策略可以是确定性的，也可以是随机的；&lt;/li&gt;
&lt;li&gt;但 Theorem 3.5 保证&lt;strong&gt;至少存在一个确定性贪心最优策略&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;对象&lt;/th&gt;
&lt;th&gt;是否保证存在&lt;/th&gt;
&lt;th&gt;是否唯一&lt;/th&gt;
&lt;th&gt;是否可确定性&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;最优状态价值 $v^*$&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;不适用&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;最优策略 $\pi^*$&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;不一定&lt;/td&gt;
&lt;td&gt;总能找到确定性最优策略&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;5. 影响最优策略的因素&lt;/h2&gt;
&lt;p&gt;从 BOE 可见，最优价值与策略由三类量决定：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;即时奖励 $r$；&lt;/li&gt;
&lt;li&gt;折扣率 $\gamma$；&lt;/li&gt;
&lt;li&gt;系统模型 $p(s&apos;\mid s,a)$ 与 $p(r\mid s,a)$。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;本节固定系统模型，比较折扣率和奖励设置的影响。&lt;/p&gt;
&lt;h3&gt;5.1 基准示例与折扣率&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-3-4.png&quot; alt=&quot;Figure 3.4：不同折扣率和奖励参数下的最优策略与最优价值&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 每组左图是最优策略，右图是相应最优价值；橙色为禁止格，青色为目标格。&lt;/p&gt;
&lt;h4&gt;(a) 基准：$\gamma=0.9$&lt;/h4&gt;
&lt;p&gt;设置&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}=r_{\text{forbidden}}=-1,
\qquad
r_{\text{target}}=1,
\qquad
r_{\text{other}}=0.
$$&lt;/p&gt;
&lt;p&gt;较大的折扣率使策略更“远视”。从第 4 行第 1 列出发，绕开所有禁止格的路线很长，而穿过禁止格虽然立即受罚，却能更快到达目标并获得更大的累计回报。因此最优策略可能选择穿越禁止格。&lt;/p&gt;
&lt;h4&gt;(b) 降至 $\gamma=0.5$&lt;/h4&gt;
&lt;p&gt;未来奖励被更强折扣，策略变得短视，不愿承担当前的禁止格惩罚，转而选择较长但避开禁止格的路线。&lt;/p&gt;
&lt;h4&gt;(c) 极端情形 $\gamma=0$&lt;/h4&gt;
&lt;p&gt;BOE 只剩即时奖励：&lt;/p&gt;
&lt;p&gt;$$
q^*(s,a)=\sum_{r\in\mathcal R}p(r\mid s,a)r.
$$&lt;/p&gt;
&lt;p&gt;策略只选择即时奖励最大的动作，不考虑长期结果，因此可能无法到达目标。&lt;/p&gt;
&lt;p&gt;图中还有一个空间规律：越靠近目标，状态价值通常越大；离目标越远，目标奖励经过的折扣次数越多，状态价值越低。&lt;/p&gt;
&lt;h3&gt;5.2 改变奖励大小&lt;/h3&gt;
&lt;p&gt;在 Figure 3.4(d) 中，将禁止格奖励从 $-1$ 改为 $-10$，严厉惩罚使最优策略完全避开禁止格。这说明改变不同事件之间的&lt;strong&gt;相对奖励&lt;/strong&gt;可以改变策略。&lt;/p&gt;
&lt;p&gt;但并非所有奖励变化都会改变最优策略。教材给出如下不变性。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 3.6 - 最优策略对奖励仿射变换的不变性
将每个奖励按
$$
r\longmapsto\alpha r+\beta,
\qquad \alpha&amp;gt;0,
$$
变换后，新的最优价值为
$$
\boxed{
v&apos;=\alpha v^*+\frac{\beta}{1-\gamma}\mathbf1,
}
$$
其中 $\mathbf1=[1,\ldots,1]^T$。由 $v&apos;$ 导出的最优策略与原策略相同。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Box 3.5：Theorem 3.6 证明&lt;/h4&gt;
&lt;p&gt;对任意策略，奖励向量变为&lt;/p&gt;
&lt;p&gt;$$
r_\pi\longmapsto\alpha r_\pi+\beta\mathbf1.
$$&lt;/p&gt;
&lt;p&gt;新的 BOE 是&lt;/p&gt;
&lt;p&gt;$$
v&apos;=\max_\pi(\alpha r_\pi+\beta\mathbf1+\gamma P_\pi v&apos;).
$$&lt;/p&gt;
&lt;p&gt;令 $c=\beta/(1-\gamma)$，尝试 $v&apos;=\alpha v^*+c\mathbf1$。利用 $P_\pi\mathbf1=\mathbf1$：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\max_\pi(\alpha r_\pi+\beta\mathbf1+\gamma P_\pi v&apos;)
&amp;amp;=\max_\pi(\alpha r_\pi+\beta\mathbf1
+\alpha\gamma P_\pi v^&lt;em&gt;+c\gamma\mathbf1)\
&amp;amp;=\alpha\max_\pi(r_\pi+\gamma P_\pi v^&lt;/em&gt;)
+(\beta+c\gamma)\mathbf1\
&amp;amp;=\alpha v^*+c\mathbf1,
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;因为 $\beta+c\gamma=c$。所以候选 $v&apos;$ 满足新 BOE；BOE 解唯一，故它就是新最优价值。又因 $\alpha&amp;gt;0$ 且所有动作价值都增加相同的常量项，动作之间的相对次序不变，贪心最优策略不变。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 仿射不变性不等于“怎样改奖励都不影响策略”
定理要求对&lt;strong&gt;所有奖励统一&lt;/strong&gt;使用同一个 $\alpha&amp;gt;0$ 和同一个 $\beta$。只改变禁止格奖励（例如从 $-1$ 到 $-10$）不是这种统一仿射变换，完全可能改变最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.3 为什么最优策略不会无意义绕路？&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-3-5.png&quot; alt=&quot;Figure 3.5：最短路线与绕路策略的价值比较&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 两个策略只在 $s_2$ 不同。左侧从 $s_2$ 直接向下到目标 $s_4$；右侧从 $s_2$ 向左，沿 $s_2\rightarrow s_1\rightarrow s_3\rightarrow s_4$ 绕路。虽然普通移动奖励均为 $0$，右侧策略的 $s_2$ 价值仍由 $10$ 降至 $8.1$。&lt;/p&gt;
&lt;p&gt;直接路线的折扣回报为&lt;/p&gt;
&lt;p&gt;$$
1+\gamma+\gamma^2+\cdots
=\frac{1}{1-\gamma}=10
\qquad(\gamma=0.9).
$$&lt;/p&gt;
&lt;p&gt;绕路路线多经历两个零奖励步骤：&lt;/p&gt;
&lt;p&gt;$$
0+\gamma\cdot0+\gamma^2\cdot1+\gamma^3\cdot1+\cdots
=\frac{\gamma^2}{1-\gamma}=8.1.
$$&lt;/p&gt;
&lt;p&gt;即使每个普通移动没有负奖励，越晚获得目标奖励，折扣越严重。因此折扣率本身已经鼓励更短的有效路线。&lt;/p&gt;
&lt;p&gt;给每一步统一再加 $-1$ 并不是改变最优策略所必需的；在教材的持续任务设定下，它属于统一加常数的仿射变换，依据 Theorem 3.6 不改变最优策略。&lt;/p&gt;
&lt;h2&gt;6. 本章总结&lt;/h2&gt;
&lt;p&gt;本章从策略改进的直观规则出发：比较同一状态的动作价值，并选择最大的动作。为了把局部改进提升为全局最优性，教材用逐状态价值比较定义最优策略和唯一的最优状态价值。&lt;/p&gt;
&lt;p&gt;BOE 把“在每个状态选择最优动作”与“价值必须满足递归关系”合并成 $v=f(v)$。其右侧虽因最大化而非线性，却在最大范数下具有系数 $\gamma&amp;lt;1$ 的压缩性。压缩映射定理因此一次性回答了最优价值的存在性、唯一性和算法问题：从任意初值反复应用 Bellman 最优算子，都会指数收敛到唯一 $v^&lt;em&gt;$。再对 $q^&lt;/em&gt;(s,a)$ 贪心，就能得到至少一个确定性最优策略。&lt;/p&gt;
&lt;p&gt;价值的唯一性并不推出策略唯一；并列最优动作可以产生多个确定性或随机最优策略。最后，折扣率控制策略的远视程度，相对奖励改变风险偏好，而统一的正比例缩放与常数平移只对最优价值做仿射变换，不改变最优动作的排序。折扣还会自动惩罚延迟获得目标奖励的无意义绕路。&lt;/p&gt;
&lt;h2&gt;7. 教材 Q&amp;amp;A&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Q1：怎样定义最优策略？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;若一个策略的状态价值对所有状态都不小于任何其他策略，它就是最优策略。教材说明这一特定定义面向表格型强化学习。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q2：为什么 BOE 重要？它是 Bellman 方程吗？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;BOE 同时刻画最优价值和最优策略；求解它即可得到二者。它是对应策略为最优策略的特殊 Bellman 方程。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q3：BOE 的解唯一吗？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;最优价值解 $v^*$ 唯一；对应的最优策略可能不唯一。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q4：分析 BOE 的关键性质是什么？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;其右侧 Bellman 最优算子是压缩映射，因此可用压缩映射定理证明存在性、唯一性和迭代收敛。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q5：最优策略存在吗？唯一吗？是随机还是确定？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;最优策略总存在，但可能有多个甚至无穷多个；它可以是随机的或确定的，而且总能找到确定性贪心最优策略。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q6：怎样获得最优策略？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;用 Theorem 3.3 的迭代算法求解 BOE，再对最终的最优动作价值贪心。具体 Value Iteration 实现见 Chapter 4。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q7：降低折扣率会怎样？若 $\gamma=0$ 呢？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;折扣率越小，策略越短视、越不愿为远期收益承担当前风险；$\gamma=0$ 时只考虑即时奖励。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q8：给所有奖励加同一个常数会怎样？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;最优价值会增加 $\beta/(1-\gamma)$，但最优策略不变。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Q9：为了避免绕路，是否必须给每一步加负奖励？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;不必。统一加常数不改变最优策略；而折扣本身会让更晚获得的目标奖励价值更低，从而抑制无意义绕路。&lt;/p&gt;
&lt;h2&gt;8. 一页式复习&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;策略比较&lt;/strong&gt;：若 $v_{\pi_1}(s)\geq v_{\pi_2}(s)$ 对所有 $s$ 成立，则 $\pi_1$ 不劣于 $\pi_2$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;最优策略&lt;/strong&gt;：$v_{\pi^*}(s)\geq v_\pi(s)$ 对任意 $s,\pi$ 成立。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;BOE&lt;/strong&gt;：$v=\max_\pi(r_\pi+\gamma P_\pi v)=f(v)$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;右侧最大化&lt;/strong&gt;：概率加权平均的最大值由把概率集中到最大动作价值上取得。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;压缩性&lt;/strong&gt;：$\lVert f(v_1)-f(v_2)\rVert_\infty\leq\gamma\lVert v_1-v_2\rVert_\infty$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;唯一最优价值&lt;/strong&gt;：压缩映射定理保证 $v^*$ 存在且唯一。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;价值迭代原型&lt;/strong&gt;：$v_{k+1}=f(v_k)$，任意初值都指数收敛。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;最优动作价值&lt;/strong&gt;：$q^&lt;em&gt;(s,a)=\mathbb E[R_{t+1}+\gamma v^&lt;/em&gt;(S_{t+1})\mid S_t=s,A_t=a]$ 的离散展开。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;贪心策略&lt;/strong&gt;：$a^&lt;em&gt;(s)\in\arg\max_aq^&lt;/em&gt;(s,a)$；总存在确定性贪心最优策略。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;唯一性区别&lt;/strong&gt;：$v^&lt;em&gt;$ 唯一，$\pi^&lt;/em&gt;$ 不一定唯一。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;折扣率&lt;/strong&gt;：较大更远视；较小更短视；$\gamma=0$ 只看即时奖励。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;奖励仿射变换&lt;/strong&gt;：$r\mapsto\alpha r+\beta$（$\alpha&amp;gt;0$）不改变最优策略，价值变为 $\alpha v^*+\beta\mathbf1/(1-\gamma)$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;9. 公式清单&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;公式&lt;/th&gt;
&lt;th&gt;名称&lt;/th&gt;
&lt;th&gt;作用&lt;/th&gt;
&lt;th&gt;使用场景&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$v_{\pi^*}(s)\geq v_\pi(s)$&lt;/td&gt;
&lt;td&gt;最优策略定义&lt;/td&gt;
&lt;td&gt;逐状态比较所有策略&lt;/td&gt;
&lt;td&gt;定义全局最优性&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v=\max_\pi(r_\pi+\gamma P_\pi v)$&lt;/td&gt;
&lt;td&gt;BOE 矩阵形式&lt;/td&gt;
&lt;td&gt;联立最优选择与价值递归&lt;/td&gt;
&lt;td&gt;求最优价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$f(v)=\max_\pi(r_\pi+\gamma P_\pi v)$&lt;/td&gt;
&lt;td&gt;Bellman 最优算子&lt;/td&gt;
&lt;td&gt;把 BOE 写成不动点问题&lt;/td&gt;
&lt;td&gt;压缩映射分析&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\lVert f(v_1)-f(v_2)\rVert_\infty\leq\gamma\lVert v_1-v_2\rVert_\infty$&lt;/td&gt;
&lt;td&gt;BOE 压缩性&lt;/td&gt;
&lt;td&gt;保证唯一固定点和迭代收敛&lt;/td&gt;
&lt;td&gt;理论证明&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{k+1}=f(v_k)$&lt;/td&gt;
&lt;td&gt;价值迭代原型&lt;/td&gt;
&lt;td&gt;从任意初值逼近 $v^*$&lt;/td&gt;
&lt;td&gt;数值求解 BOE&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q^&lt;em&gt;(s,a)=\sum_{r\in\mathcal R}p(r\mid s,a)r+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v^&lt;/em&gt;(s&apos;)$&lt;/td&gt;
&lt;td&gt;最优动作价值&lt;/td&gt;
&lt;td&gt;对动作做一步前瞻&lt;/td&gt;
&lt;td&gt;导出最优策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$a^&lt;em&gt;(s)\in\arg\max_aq^&lt;/em&gt;(s,a)$&lt;/td&gt;
&lt;td&gt;贪心动作&lt;/td&gt;
&lt;td&gt;选择最大最优动作价值&lt;/td&gt;
&lt;td&gt;构造确定性最优策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v&apos;=\alpha v^*+\frac{\beta}{1-\gamma}\mathbf1$&lt;/td&gt;
&lt;td&gt;奖励仿射变换&lt;/td&gt;
&lt;td&gt;描述价值随统一奖励变换的变化&lt;/td&gt;
&lt;td&gt;奖励设计分析&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\lVert x^*-x_n\rVert\leq\frac{\gamma^n}{1-\gamma}\lVert x_1-x_0\rVert$&lt;/td&gt;
&lt;td&gt;压缩迭代误差界&lt;/td&gt;
&lt;td&gt;说明指数收敛速度&lt;/td&gt;
&lt;td&gt;固定点迭代分析&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;10. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$\pi,\pi^*$&lt;/td&gt;
&lt;td&gt;一般策略、最优策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Pi(s),\Pi$&lt;/td&gt;
&lt;td&gt;单个状态上的策略集合、整体策略集合&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi,v^*$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 的状态价值、唯一最优状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi,q^*$&lt;/td&gt;
&lt;td&gt;策略动作价值、最优动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$r_\pi$&lt;/td&gt;
&lt;td&gt;策略诱导的平均即时奖励向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$P_\pi$&lt;/td&gt;
&lt;td&gt;策略诱导的状态转移矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$f$&lt;/td&gt;
&lt;td&gt;Bellman 最优算子&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$x^*$&lt;/td&gt;
&lt;td&gt;一般不动点方程的固定点&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\gamma$&lt;/td&gt;
&lt;td&gt;折扣率，也是本章压缩系数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\lVert\cdot\rVert_\infty$&lt;/td&gt;
&lt;td&gt;最大范数，即最大绝对分量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathbf1$&lt;/td&gt;
&lt;td&gt;全 1 列向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\alpha,\beta$&lt;/td&gt;
&lt;td&gt;奖励仿射变换的缩放和偏移参数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$a^*(s)$&lt;/td&gt;
&lt;td&gt;状态 $s$ 的一个贪心最优动作&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;11. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;English&lt;/th&gt;
&lt;th&gt;中文&lt;/th&gt;
&lt;th&gt;简要解释&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;optimal policy&lt;/td&gt;
&lt;td&gt;最优策略&lt;/td&gt;
&lt;td&gt;在每个状态都不劣于任何其他策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;optimal state value&lt;/td&gt;
&lt;td&gt;最优状态价值&lt;/td&gt;
&lt;td&gt;最优策略对应的唯一价值函数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Bellman optimality equation&lt;/td&gt;
&lt;td&gt;Bellman 最优方程&lt;/td&gt;
&lt;td&gt;对策略最大化的价值递归方程&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;fixed point&lt;/td&gt;
&lt;td&gt;固定点 / 不动点&lt;/td&gt;
&lt;td&gt;满足 $f(x^&lt;em&gt;)=x^&lt;/em&gt;$ 的点&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;contraction mapping&lt;/td&gt;
&lt;td&gt;压缩映射&lt;/td&gt;
&lt;td&gt;把任意两点距离按小于 1 的比例缩小的映射&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;contraction mapping theorem&lt;/td&gt;
&lt;td&gt;压缩映射定理&lt;/td&gt;
&lt;td&gt;保证固定点存在、唯一及迭代收敛的定理&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cauchy sequence&lt;/td&gt;
&lt;td&gt;Cauchy 序列&lt;/td&gt;
&lt;td&gt;尾部任意元素彼此可任意接近的序列&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;maximum norm&lt;/td&gt;
&lt;td&gt;最大范数&lt;/td&gt;
&lt;td&gt;向量分量绝对值的最大值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;value iteration&lt;/td&gt;
&lt;td&gt;价值迭代&lt;/td&gt;
&lt;td&gt;反复应用 Bellman 最优算子的算法&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;greedy policy&lt;/td&gt;
&lt;td&gt;贪心策略&lt;/td&gt;
&lt;td&gt;在每个状态选择当前动作价值最大的动作&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;affine transformation&lt;/td&gt;
&lt;td&gt;仿射变换&lt;/td&gt;
&lt;td&gt;$r\mapsto\alpha r+\beta$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;policy invariance&lt;/td&gt;
&lt;td&gt;策略不变性&lt;/td&gt;
&lt;td&gt;变换后最优策略集合保持不变&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;12. 常见误区&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 最优价值唯一，所以最优策略也唯一
错。$v^&lt;em&gt;$ 唯一，但多个动作可能在某状态并列达到最大 $q^&lt;/em&gt;$，从而产生多个确定性或随机最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 最优策略一定是确定性的
不一定；随机策略也可能最优。但一定存在至少一个确定性贪心最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] BOE 只是把普通 Bellman 方程中的 $\pi$ 换成 $\pi^&lt;em&gt;$
BOE 的关键是右侧最大化，待求策略随候选价值改变，所以它是非线性不动点方程。求出最大化策略后，它才化为对应 $\pi^&lt;/em&gt;$ 的普通 Bellman 方程。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] $\gamma$ 越小越安全，因此策略一定更好
“更安全”只是 Figure 3.4 特定奖励设置下的表现。较小 $\gamma$ 的一般含义是更短视，可能因此错过长期更高回报。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 给每一步加负奖励一定能改变最优策略
若对所有奖励统一加同一常数，在本章设定下只是仿射平移，不改变最优策略。改变某一类事件的相对奖励才可能改变动作排序。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 相邻迭代差 $\lVert x_{k+1}-x_k\rVert\rightarrow0$ 就足以证明收敛
不足。教材用 $x_n=\sqrt n$ 作为反例；必须进一步证明序列是 Cauchy 序列或直接控制到固定点的误差。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;13. 自测题&lt;/h2&gt;
&lt;h3&gt;13.1 概念题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;最优状态价值和最优策略的唯一性分别如何？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$v^*$ 存在且唯一；最优策略存在但不一定唯一，可以有多个确定性或随机最优策略。不过总存在确定性贪心最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;判断：只要某策略在一个常用初始状态上的价值最大，它就是本章定义的最优策略。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;错误。本章定义要求该策略对所有状态的价值都不小于任何其他策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;为什么 BOE 的压缩性要使用最大范数？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;每个转移矩阵的行是概率分布。对任意行做加权平均，其绝对值不超过输入向量的最大绝对分量，因此 $P_\pi$ 在最大范数下不会放大差异，再乘 $\gamma&amp;lt;1$ 就得到压缩。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;若多个动作同时达到最大 $q^*(s,a)$，有哪些最优选择？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;可确定性地选择任意一个并列最大动作，也可只在这些最大动作之间任意随机化；它们在该状态都达到同一最优值。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;13.2 推导与计算题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;给定某状态的动作价值 $q(s,a_1)=2$、$q(s,a_2)=5$、$q(s,a_3)=5$。求 BOE 右侧最大值，并给出两个不同的最优策略分布。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;最大值为 $5$。例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;确定性策略：$\pi(a_2\mid s)=1$；&lt;/li&gt;
&lt;li&gt;随机策略：$\pi(a_2\mid s)=0.4$、$\pi(a_3\mid s)=0.6$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;两者都不给 $a_1$ 概率，因此加权平均都是 $5$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;若压缩系数 $\gamma=0.8$ 且 $\lVert x_1-x_0\rVert=3$，根据教材误差界写出第 $n$ 次迭代到固定点的上界。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
\lVert x^*-x_n\rVert
\leq\frac{0.8^n}{1-0.8}\times3
=15\times0.8^n.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;奖励统一变换为 $r&apos;=2r-3$，$\gamma=0.9$。新的最优价值与原 $v^*$ 有何关系？最优策略是否改变？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;这里 $\alpha=2,\beta=-3$，所以&lt;/p&gt;
&lt;p&gt;$$
v&apos;=2v^&lt;em&gt;+\frac{-3}{1-0.9}\mathbf1
=2v^&lt;/em&gt;-30\mathbf1.
$$&lt;/p&gt;
&lt;p&gt;因为 $\alpha&amp;gt;0$ 且这是统一仿射变换，最优策略不变。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;说明为什么 $\gamma=0$ 时 BOE 只优化即时奖励。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;将 $\gamma=0$ 代入&lt;/p&gt;
&lt;p&gt;$$
q^&lt;em&gt;(s,a)=\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v^&lt;/em&gt;(s&apos;)
$$&lt;/p&gt;
&lt;p&gt;后，未来价值项完全消失。因此每个状态只选择平均即时奖励最大的动作，不考虑其长期后果。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;用一句公式说明 Theorem 3.4 的证明如何从 BOE 比较任意策略 $\pi$。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;关键不等式是&lt;/p&gt;
&lt;p&gt;$$
v^&lt;em&gt;-v_\pi
\geq\gamma P_\pi(v^&lt;/em&gt;-v_\pi)
\geq\cdots\geq\gamma^nP_\pi^n(v^*-v_\pi)
\rightarrow0,
$$&lt;/p&gt;
&lt;p&gt;因此 $v^*\geq v_\pi$。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 4 - Value Iteration and Policy Iteration</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-4-value-iteration-and-policy-iteration/chapter-4---value-iteration-and-policy-iteration/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-4-value-iteration-and-policy-iteration/chapter-4---value-iteration-and-policy-iteration/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 4 - Value Iteration and Policy Iteration&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
前三章建立了马尔可夫决策过程、Bellman 方程与 Bellman 最优方程。本章第一次把这些理论落实为能够寻找最优策略的具体算法。核心有三种：价值迭代（value iteration）、策略迭代（policy iteration）和截断策略迭代（truncated policy iteration）。三者都在“更新价值”和“更新策略”之间循环，只是策略评价的精确程度不同。理解它们之间的连续关系，是把握广义策略迭代（generalized policy iteration）的关键。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识结构&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-4-1.png&quot; alt=&quot;Figure 4.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; Chapter 4 位于“基础工具”与后续“算法/方法”之间。Chapter 3 已证明 Bellman 最优方程的解存在且唯一；本章据此给出第一批寻找最优策略的算法。Chapter 5 以后会把这里依赖系统模型的动态规划思想推广到无模型方法。&lt;/p&gt;
&lt;p&gt;本章的逻辑主线是：&lt;/p&gt;
&lt;p&gt;$$
\text{Bellman 最优方程}
\longrightarrow
\text{价值迭代}
\longrightarrow
\text{策略迭代}
\longrightarrow
\text{截断策略迭代}
\longrightarrow
\text{广义策略迭代}.
$$&lt;/p&gt;
&lt;p&gt;具体来说：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;用压缩映射定理给出的迭代直接求解 Bellman 最优方程，得到价值迭代。&lt;/li&gt;
&lt;li&gt;把“先准确评价当前策略，再贪心改进策略”组织为策略迭代。&lt;/li&gt;
&lt;li&gt;比较两者后发现，它们只是策略评价迭代次数的两个极端。&lt;/li&gt;
&lt;li&gt;在两个极端之间截断策略评价，得到截断策略迭代。&lt;/li&gt;
&lt;li&gt;抽象出“价值与策略相互推动”的广义策略迭代思想。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;1. 动态规划方法的定位&lt;/h2&gt;
&lt;p&gt;本章三种算法都属于动态规划（dynamic programming, DP）算法。它们需要已知系统模型，即对所有状态动作对 $(s,a)$，已知：&lt;/p&gt;
&lt;p&gt;$$
p(r\mid s,a),\qquad p(s&apos;\mid s,a).
$$&lt;/p&gt;
&lt;p&gt;有了模型，算法可以对所有可能奖励和下一状态求和，而不必先与环境采样。它们虽然依赖模型，却是后续无模型强化学习算法的重要基础。例如，Chapter 5 的 Monte Carlo 方法可以看作对策略迭代思想的扩展。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易混概念：需要模型与 model-based RL
本章末尾特别指出：“算法要求系统模型已知”和“model-based reinforcement learning”不是同一个分类标准。后者通常指从数据估计系统模型，并在学习过程中使用该估计模型；model-free 方法则不进行模型估计。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;2. 价值迭代&lt;/h2&gt;
&lt;h3&gt;2.1 从 Bellman 最优方程到迭代算法&lt;/h3&gt;
&lt;p&gt;价值迭代是压缩映射定理为求解 Bellman 最优方程直接建议的算法：&lt;/p&gt;
&lt;p&gt;$$
v_{k+1}
=\max_{\pi\in\Pi}\left(r_\pi+\gamma P_\pi v_k\right),
\qquad k=0,1,2,\ldots
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$v_k$ 是第 $k$ 次迭代的价值向量估计；&lt;/li&gt;
&lt;li&gt;$r_\pi$ 是策略 $\pi$ 下的一步期望奖励向量；&lt;/li&gt;
&lt;li&gt;$P_\pi$ 是策略 $\pi$ 下的状态转移矩阵；&lt;/li&gt;
&lt;li&gt;$\gamma\in[0,1)$ 是折扣率；&lt;/li&gt;
&lt;li&gt;$\Pi$ 是策略集合。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;由 Chapter 3 的 Theorem 3.3，随着 $k\rightarrow\infty$：&lt;/p&gt;
&lt;p&gt;$$
v_k\rightarrow v^&lt;em&gt;,\qquad \pi_k\rightarrow\pi^&lt;/em&gt;,
$$&lt;/p&gt;
&lt;p&gt;其中 $v^&lt;em&gt;$ 是唯一的最优状态价值，$\pi^&lt;/em&gt;$ 是一个最优策略。&lt;/p&gt;
&lt;p&gt;每轮迭代可以拆成两步。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第一步：策略更新（policy update, PU）&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;给定上一轮的 $v_k$，寻找对一步前瞻结果最优的策略：&lt;/p&gt;
&lt;p&gt;$$
\pi_{k+1}
=\arg\max_\pi\left(r_\pi+\gamma P_\pi v_k\right).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第二步：价值更新（value update, VU）&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;用新策略进行一次 Bellman 备份：&lt;/p&gt;
&lt;p&gt;$$
v_{k+1}
=r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_k.
\tag{4.1}
$$&lt;/p&gt;
&lt;p&gt;注意右侧仍然是旧估计 $v_k$，不是新策略的精确状态价值 $v_{\pi_{k+1}}$。&lt;/p&gt;
&lt;h3&gt;2.2 逐元素形式&lt;/h3&gt;
&lt;p&gt;为了实现算法，需要把矩阵形式展开到每个状态和动作。&lt;/p&gt;
&lt;p&gt;先根据 $v_k$ 定义一步前瞻量：&lt;/p&gt;
&lt;p&gt;$$
q_k(s,a)
=\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;\in\mathcal S}p(s&apos;\mid s,a)v_k(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;它把动作 $a$ 的即时奖励与下一状态的当前估计合并起来。&lt;/p&gt;
&lt;p&gt;策略更新问题可写成：&lt;/p&gt;
&lt;p&gt;$$
\pi_{k+1}(s)
=\arg\max_\pi
\sum_{a\in\mathcal A(s)}\pi(a\mid s)q_k(s,a).
$$&lt;/p&gt;
&lt;p&gt;最大值可以由确定性贪心策略取得。令&lt;/p&gt;
&lt;p&gt;$$
a_k^*(s)=\arg\max_{a\in\mathcal A(s)}q_k(s,a),
$$&lt;/p&gt;
&lt;p&gt;则&lt;/p&gt;
&lt;p&gt;$$
\pi_{k+1}(a\mid s)
=\begin{cases}
1, &amp;amp; a=a_k^&lt;em&gt;(s),\
0, &amp;amp; a\neq a_k^&lt;/em&gt;(s).
\end{cases}
\tag{4.2}
$$&lt;/p&gt;
&lt;p&gt;如果最大动作不唯一，可以任取其中一个，不影响算法收敛。由于新策略总选择当前 $q_k(s,a)$ 最大的动作，所以它是关于 $v_k$ 的&lt;strong&gt;贪心策略（greedy policy）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;价值更新的逐元素形式为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_{k+1}(s)
&amp;amp;=\sum_a\pi_{k+1}(a\mid s)
\left[
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_k(s&apos;)
\right]\
&amp;amp;=\max_a q_k(s,a).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;于是一次迭代的完整信息流是：&lt;/p&gt;
&lt;p&gt;$$
v_k(s)
\longrightarrow q_k(s,a)
\longrightarrow \pi_{k+1}
\longrightarrow v_{k+1}(s)=\max_a q_k(s,a).
$$&lt;/p&gt;
&lt;h3&gt;2.3 Algorithm 4.1：价值迭代算法&lt;/h3&gt;
&lt;h4&gt;目标&lt;/h4&gt;
&lt;p&gt;求解 Bellman 最优方程，得到 $v^*$ 和一个最优策略。&lt;/p&gt;
&lt;h4&gt;输入&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;模型 $p(r\mid s,a)$ 与 $p(s&apos;\mid s,a)$；&lt;/li&gt;
&lt;li&gt;折扣率 $\gamma$；&lt;/li&gt;
&lt;li&gt;初值 $v_0$；&lt;/li&gt;
&lt;li&gt;收敛阈值 $\varepsilon&amp;gt;0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;输出&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;收敛的价值估计；&lt;/li&gt;
&lt;li&gt;对最终价值估计贪心的策略。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;步骤&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;对每个状态 $s\in\mathcal S$：&lt;/li&gt;
&lt;li&gt;对每个动作 $a\in\mathcal A(s)$，计算&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
q_k(s,a)
=\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_k(s&apos;).
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;选取&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
a_k^*(s)=\arg\max_a q_k(s,a).
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;更新贪心策略：$\pi_{k+1}(a_k^*(s)\mid s)=1$，其他动作概率为 $0$。&lt;/li&gt;
&lt;li&gt;更新价值：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
v_{k+1}(s)=\max_a q_k(s,a).
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;若 $\lVert v_{k+1}-v_k\rVert$ 仍大于预设阈值，则进入下一轮；否则停止。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;2.4 重要辨析：中间量 $v_k$ 通常不是状态价值&lt;/h3&gt;
&lt;p&gt;尽管 $v_k$ 最终收敛到 $v^*$，但在收敛前，它通常不满足任何策略的 Bellman 方程。一般既不能保证&lt;/p&gt;
&lt;p&gt;$$
v_k=r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_k,
$$&lt;/p&gt;
&lt;p&gt;也不能保证&lt;/p&gt;
&lt;p&gt;$$
v_k=r_{\pi_k}+\gamma P_{\pi_k}v_k.
$$&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$v_k$ 只是算法产生的中间向量，不一定等于某个 $v_\pi$；&lt;/li&gt;
&lt;li&gt;相应的 $q_k(s,a)$ 也不一定是某个策略的真实动作价值；&lt;/li&gt;
&lt;li&gt;只有极限 $v^*$ 才是最优状态价值。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 一句话记忆
价值迭代每轮只做一次 Bellman 最优备份，它“朝状态价值靠近”，但中间估计未必已经是任何策略的状态价值。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.5 Figure 4.2 示例：$2\times2$ 网格&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-4-2.png&quot; alt=&quot;Figure 4.2：价值迭代的逐步实现&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 网格有四个状态。$s_2$ 是禁止区域，$s_4$ 是目标区域。左图只显示环境，中图显示第一次迭代得到的策略 $\pi_1$，右图显示第二次迭代得到的最优策略 $\pi_2$。圆圈代表停留动作，箭头代表移动方向。&lt;/p&gt;
&lt;p&gt;奖励与折扣设置为：&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}=r_{\text{forbidden}}=-1,\qquad
r_{\text{target}}=1,\qquad
\gamma=0.9.
$$&lt;/p&gt;
&lt;h4&gt;Table 4.1：各状态动作对的 $q$ 表达式&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;q-table&lt;/th&gt;
&lt;th&gt;$a_1$&lt;/th&gt;
&lt;th&gt;$a_2$&lt;/th&gt;
&lt;th&gt;$a_3$&lt;/th&gt;
&lt;th&gt;$a_4$&lt;/th&gt;
&lt;th&gt;$a_5$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_1)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_2)$&lt;/td&gt;
&lt;td&gt;$0+\gamma v(s_3)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_1)$&lt;/td&gt;
&lt;td&gt;$0+\gamma v(s_1)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_2)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_2)$&lt;/td&gt;
&lt;td&gt;$1+\gamma v(s_4)$&lt;/td&gt;
&lt;td&gt;$0+\gamma v(s_1)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_2)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$0+\gamma v(s_1)$&lt;/td&gt;
&lt;td&gt;$1+\gamma v(s_4)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_3)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_3)$&lt;/td&gt;
&lt;td&gt;$0+\gamma v(s_3)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_2)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_4)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v(s_4)$&lt;/td&gt;
&lt;td&gt;$0+\gamma v(s_3)$&lt;/td&gt;
&lt;td&gt;$1+\gamma v(s_4)$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这个表把环境的确定性转移与奖励直接代入一步前瞻公式。每个单元格都由“一步奖励 + 下一状态的折扣价值”组成。&lt;/p&gt;
&lt;h4&gt;第 $k=0$ 轮&lt;/h4&gt;
&lt;p&gt;从全零初值开始：&lt;/p&gt;
&lt;p&gt;$$
v_0(s_1)=v_0(s_2)=v_0(s_3)=v_0(s_4)=0.
$$&lt;/p&gt;
&lt;p&gt;代入 Table 4.1 得到 Table 4.2。&lt;/p&gt;
&lt;h4&gt;Table 4.2：$k=0$ 时的 $q_0(s,a)$&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;q-table&lt;/th&gt;
&lt;th&gt;$a_1$&lt;/th&gt;
&lt;th&gt;$a_2$&lt;/th&gt;
&lt;th&gt;$a_3$&lt;/th&gt;
&lt;th&gt;$a_4$&lt;/th&gt;
&lt;th&gt;$a_5$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$1$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$1$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$-1$&lt;/td&gt;
&lt;td&gt;$0$&lt;/td&gt;
&lt;td&gt;$1$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一种合法的贪心选择为：&lt;/p&gt;
&lt;p&gt;$$
\pi_1(a_5\mid s_1)=1,\quad
\pi_1(a_3\mid s_2)=1,\quad
\pi_1(a_2\mid s_3)=1,\quad
\pi_1(a_5\mid s_4)=1.
$$&lt;/p&gt;
&lt;p&gt;在 $s_1$，$a_5$ 与 $a_3$ 的 $q$ 值同为 $0$，教材任选了 $a_5$。这使策略在 $s_1$ 原地停留，所以 $\pi_1$ 还不是最优策略。&lt;/p&gt;
&lt;p&gt;价值更新为各行最大值：&lt;/p&gt;
&lt;p&gt;$$
v_1(s_1)=0,\qquad
v_1(s_2)=v_1(s_3)=v_1(s_4)=1.
$$&lt;/p&gt;
&lt;h4&gt;第 $k=1$ 轮&lt;/h4&gt;
&lt;p&gt;将 $v_1$ 代入 Table 4.1。&lt;/p&gt;
&lt;h4&gt;Table 4.3：$k=1$ 时的 $q_1(s,a)$&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;q-table&lt;/th&gt;
&lt;th&gt;$a_1$&lt;/th&gt;
&lt;th&gt;$a_2$&lt;/th&gt;
&lt;th&gt;$a_3$&lt;/th&gt;
&lt;th&gt;$a_4$&lt;/th&gt;
&lt;th&gt;$a_5$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot0$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$0+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot0$&lt;/td&gt;
&lt;td&gt;$0+\gamma\cdot0$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$0+\gamma\cdot0$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_3$&lt;/td&gt;
&lt;td&gt;$0+\gamma\cdot0$&lt;/td&gt;
&lt;td&gt;$1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$0+\gamma\cdot1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_4$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$0+\gamma\cdot1$&lt;/td&gt;
&lt;td&gt;$1+\gamma\cdot1$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;贪心策略更新为：&lt;/p&gt;
&lt;p&gt;$$
\pi_2(a_3\mid s_1)=1,\quad
\pi_2(a_3\mid s_2)=1,\quad
\pi_2(a_2\mid s_3)=1,\quad
\pi_2(a_5\mid s_4)=1.
$$&lt;/p&gt;
&lt;p&gt;新价值为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_2(s_1)&amp;amp;=\gamma,\
v_2(s_2)&amp;amp;=1+\gamma,\
v_2(s_3)&amp;amp;=1+\gamma,\
v_2(s_4)&amp;amp;=1+\gamma.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;此时 $\pi_2$ 已经是最优策略。这个简单例子只需两轮就找到最优策略；更复杂问题仍需继续迭代，直到 $\lVert v_{k+1}-v_k\rVert$ 小于阈值。&lt;/p&gt;
&lt;h2&gt;3. 策略迭代&lt;/h2&gt;
&lt;h3&gt;3.1 两个交替步骤&lt;/h3&gt;
&lt;p&gt;策略迭代不直接逐次应用 Bellman 最优算子。它从当前策略出发，交替执行：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;策略评价（policy evaluation, PE）&lt;/strong&gt;：精确或近似求出当前策略的状态价值；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;策略改进（policy improvement, PI）&lt;/strong&gt;：对该状态价值做一步贪心，得到不差于当前策略的新策略。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;第 $k$ 轮的策略评价求解：&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_k}=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}.
\tag{4.3}
$$&lt;/p&gt;
&lt;p&gt;随后策略改进为：&lt;/p&gt;
&lt;p&gt;$$
\pi_{k+1}
=\arg\max_\pi
\left(r_\pi+\gamma P_\pi v_{\pi_k}\right).
$$&lt;/p&gt;
&lt;p&gt;这里与价值迭代的关键差别是：策略改进使用的 $v_{\pi_k}$ 是当前策略 Bellman 方程的解，是一个真正的状态价值。&lt;/p&gt;
&lt;h3&gt;3.2 怎样完成策略评价？&lt;/h3&gt;
&lt;p&gt;教材重述了 Chapter 2 的两种方法。&lt;/p&gt;
&lt;h4&gt;方法一：闭式解&lt;/h4&gt;
&lt;p&gt;$$
v_{\pi_k}
=\left(I-\gamma P_{\pi_k}\right)^{-1}r_{\pi_k}.
$$&lt;/p&gt;
&lt;p&gt;闭式解便于理论分析，但计算矩阵逆在实现上通常效率不高。&lt;/p&gt;
&lt;h4&gt;方法二：迭代求解&lt;/h4&gt;
&lt;p&gt;从任意初值 $v_{\pi_k}^{(0)}$ 出发：&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_k}^{(j+1)}
=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}^{(j)},
\qquad j=0,1,2,\ldots
\tag{4.4}
$$&lt;/p&gt;
&lt;p&gt;当 $j\rightarrow\infty$ 时：&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_k}^{(j)}\rightarrow v_{\pi_k}.
$$&lt;/p&gt;
&lt;p&gt;所以策略迭代的外层本身是迭代算法，而每次策略评价内部又嵌套一个迭代过程。理论上要无限次内部更新才能得到精确 $v_{\pi_k}$；实践中通常在以下任一条件满足时停止：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\lVert v_{\pi_k}^{(j+1)}-v_{\pi_k}^{(j)}\rVert$ 小于阈值；&lt;/li&gt;
&lt;li&gt;内部迭代次数达到预设上限。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;有限次评价得到的是近似值。Section 4.3 会说明，即使如此也能形成有效算法。&lt;/p&gt;
&lt;h3&gt;3.3 Lemma 4.1：策略改进&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Lemma 4.1 - Policy improvement
若
$$
\pi_{k+1}=\arg\max_\pi\left(r_\pi+\gamma P_\pi v_{\pi_k}\right),
$$
则
$$
v_{\pi_{k+1}}\geq v_{\pi_k},
$$
其中不等式按状态逐元素成立。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Box 4.1：证明&lt;/h4&gt;
&lt;p&gt;两个策略的真实状态价值分别满足：&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_{k+1}}
=r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_{\pi_{k+1}},
$$&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_k}
=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}.
$$&lt;/p&gt;
&lt;p&gt;由于 $\pi_{k+1}$ 对 $v_{\pi_k}$ 贪心：&lt;/p&gt;
&lt;p&gt;$$
r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_{\pi_k}
\geq
r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}.
$$&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_{\pi_k}-v_{\pi_{k+1}}
&amp;amp;=\left(r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}\right)
-\left(r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_{\pi_{k+1}}\right)\
&amp;amp;\leq
\left(r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_{\pi_k}\right)
-\left(r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_{\pi_{k+1}}\right)\
&amp;amp;=\gamma P_{\pi_{k+1}}
\left(v_{\pi_k}-v_{\pi_{k+1}}\right).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;反复代入得到：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_{\pi_k}-v_{\pi_{k+1}}
&amp;amp;\leq \gamma^2P_{\pi_{k+1}}^2
\left(v_{\pi_k}-v_{\pi_{k+1}}\right)\
&amp;amp;\leq\cdots\
&amp;amp;\leq\gamma^nP_{\pi_{k+1}}^n
\left(v_{\pi_k}-v_{\pi_{k+1}}\right)\
&amp;amp;\longrightarrow0.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;因为 $\gamma^n\rightarrow0$，且 $P_{\pi_{k+1}}^n$ 始终是非负随机矩阵，所以&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_k}-v_{\pi_{k+1}}\leq0,
$$&lt;/p&gt;
&lt;p&gt;即 $v_{\pi_{k+1}}\geq v_{\pi_k}$。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 证明的核心思想
新策略先保证在旧价值 $v_{\pi_k}$ 上的一步前瞻不差，再利用新策略的 Bellman 方程把这个“一步不差”传播到无限未来。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.4 Theorem 4.1：策略迭代收敛&lt;/h3&gt;
&lt;p&gt;策略迭代产生两列对象：&lt;/p&gt;
&lt;p&gt;$$
{\pi_0,\pi_1,\ldots},
\qquad
{v_{\pi_0},v_{\pi_1},\ldots}.
$$&lt;/p&gt;
&lt;p&gt;Lemma 4.1 给出单调性，而最优价值给出上界：&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_0}
\leq v_{\pi_1}
\leq v_{\pi_2}
\leq\cdots
\leq v^*.
$$&lt;/p&gt;
&lt;p&gt;因此状态价值序列单调有界，必收敛。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 4.1 - Convergence of policy iteration
策略迭代生成的状态价值序列 ${v_{\pi_k}}_{k=0}^{\infty}$ 收敛到最优状态价值 $v^*$；相应策略序列收敛到一个最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Box 4.2：证明与价值迭代的比较&lt;/h4&gt;
&lt;p&gt;引入从 $v_0$ 开始的价值迭代序列：&lt;/p&gt;
&lt;p&gt;$$
v_{k+1}=f(v_k)
=\max_\pi\left(r_\pi+\gamma P_\pi v_k\right).
$$&lt;/p&gt;
&lt;p&gt;已知 $v_k\rightarrow v^*$。对任意初始策略 $\pi_0$，总能选择 $v_0$ 使&lt;/p&gt;
&lt;p&gt;$$
v_0\leq v_{\pi_0}.
$$&lt;/p&gt;
&lt;p&gt;下面归纳证明：&lt;/p&gt;
&lt;p&gt;$$
v_k\leq v_{\pi_k}\leq v^*.
$$&lt;/p&gt;
&lt;p&gt;假设 $v_k\leq v_{\pi_k}$。令&lt;/p&gt;
&lt;p&gt;$$
\pi_k&apos;
=\arg\max_\pi\left(r_\pi+\gamma P_\pi v_k\right).
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_{\pi_{k+1}}-v_{k+1}
&amp;amp;=\left(r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_{\pi_{k+1}}\right)
-\max_\pi\left(r_\pi+\gamma P_\pi v_k\right)\
&amp;amp;\geq
\left(r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_{\pi_k}\right)
-\max_\pi\left(r_\pi+\gamma P_\pi v_k\right)\
&amp;amp;\geq
\left(r_{\pi_k&apos;}+\gamma P_{\pi_k&apos;}v_{\pi_k}\right)
-\left(r_{\pi_k&apos;}+\gamma P_{\pi_k&apos;}v_k\right)\
&amp;amp;=\gamma P_{\pi_k&apos;}\left(v_{\pi_k}-v_k\right)\
&amp;amp;\geq0.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;第一处不等式使用 Lemma 4.1 与 $P_{\pi_{k+1}}\geq0$，第二处使用 $\pi_{k+1}$ 对 $v_{\pi_k}$ 贪心。于是 $v_{k+1}\leq v_{\pi_{k+1}}$。又因 $v_{\pi_k}\leq v^*$，归纳成立。&lt;/p&gt;
&lt;p&gt;最后，由&lt;/p&gt;
&lt;p&gt;$$
v_k\leq v_{\pi_k}\leq v^&lt;em&gt;,
\qquad v_k\rightarrow v^&lt;/em&gt;,
$$&lt;/p&gt;
&lt;p&gt;夹逼得到 $v_{\pi_k}\rightarrow v^*$。&lt;/p&gt;
&lt;p&gt;这也解释了教材所说的“策略迭代通常比价值迭代更快”：在相同起点和理论比较条件下，策略迭代的价值序列位于价值迭代序列之上，更快靠近 $v^*$，代价是每轮策略评价更昂贵。&lt;/p&gt;
&lt;h3&gt;3.5 逐元素形式与 Algorithm 4.2&lt;/h3&gt;
&lt;p&gt;策略评价的逐元素迭代为：&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_k}^{(j+1)}(s)
=\sum_a\pi_k(a\mid s)
\left[
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_{\pi_k}^{(j)}(s&apos;)
\right].
$$&lt;/p&gt;
&lt;p&gt;评价完成后，计算当前策略价值的一步动作价值：&lt;/p&gt;
&lt;p&gt;$$
q_{\pi_k}(s,a)
=\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_{\pi_k}(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;令&lt;/p&gt;
&lt;p&gt;$$
a_k^*(s)=\arg\max_a q_{\pi_k}(s,a),
$$&lt;/p&gt;
&lt;p&gt;并更新：&lt;/p&gt;
&lt;p&gt;$$
\pi_{k+1}(a\mid s)
=\begin{cases}
1, &amp;amp; a=a_k^&lt;em&gt;(s),\
0, &amp;amp; a\neq a_k^&lt;/em&gt;(s).
\end{cases}
$$&lt;/p&gt;
&lt;h4&gt;Algorithm 4.2：策略迭代算法&lt;/h4&gt;
&lt;p&gt;&lt;strong&gt;输入：&lt;/strong&gt; 模型 $p(r\mid s,a)$、$p(s&apos;\mid s,a)$，折扣率 $\gamma$，初始策略 $\pi_0$，内外层停止条件。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;目标：&lt;/strong&gt; 求最优状态价值和一个最优策略。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;外层第 $k$ 轮：&lt;/strong&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;策略评价：从任意 $v_{\pi_k}^{(0)}$ 开始，重复 Bellman 期望备份，直到 $v_{\pi_k}^{(j)}$ 收敛。&lt;/li&gt;
&lt;li&gt;策略改进：对每个状态计算 $q_{\pi_k}(s,a)$，选取最大动作，形成确定性贪心策略 $\pi_{k+1}$。&lt;/li&gt;
&lt;li&gt;若策略或其价值不再变化，则停止；否则进入下一轮。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;输出：&lt;/strong&gt; 收敛的状态价值和贪心策略。&lt;/p&gt;
&lt;h3&gt;3.6 Figure 4.3：两状态示例&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-4-3.png&quot; alt=&quot;Figure 4.3：策略迭代的两状态示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 有两个状态和三个动作：&lt;/p&gt;
&lt;p&gt;$$
\mathcal A={a_\ell,a_0,a_r},
$$&lt;/p&gt;
&lt;p&gt;分别表示向左、保持不动、向右。目标在 $s_2$，奖励设置为&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}=-1,\qquad
r_{\text{target}}=1,\qquad
\gamma=0.9.
$$&lt;/p&gt;
&lt;p&gt;Figure 4.3(a) 的初始策略 $\pi_0$ 在两个状态都向左，不会朝目标前进；Figure 4.3(b) 是一次策略改进后的最优策略。&lt;/p&gt;
&lt;h4&gt;第一步：评价 $\pi_0$&lt;/h4&gt;
&lt;p&gt;Bellman 方程为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_{\pi_0}(s_1)&amp;amp;=-1+\gamma v_{\pi_0}(s_1),\
v_{\pi_0}(s_2)&amp;amp;=0+\gamma v_{\pi_0}(s_1).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;直接解得：&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_0}(s_1)=-10,\qquad
v_{\pi_0}(s_2)=-9.
$$&lt;/p&gt;
&lt;p&gt;若从 $v_{\pi_0}^{(0)}(s_1)=v_{\pi_0}^{(0)}(s_2)=0$ 迭代，则：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_{\pi_0}^{(1)}(s_1)&amp;amp;=-1,&amp;amp;
v_{\pi_0}^{(1)}(s_2)&amp;amp;=0,\
v_{\pi_0}^{(2)}(s_1)&amp;amp;=-1.9,&amp;amp;
v_{\pi_0}^{(2)}(s_2)&amp;amp;=-0.9,\
v_{\pi_0}^{(3)}(s_1)&amp;amp;=-2.71,&amp;amp;
v_{\pi_0}^{(3)}(s_2)&amp;amp;=-1.71.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;继续迭代会分别趋于 $-10$ 与 $-9$。&lt;/p&gt;
&lt;h4&gt;第二步：改进策略&lt;/h4&gt;
&lt;h4&gt;Table 4.4：一般 $q_{\pi_k}(s,a)$ 表达式&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;$q_{\pi_k}(s,a)$&lt;/th&gt;
&lt;th&gt;$a_\ell$&lt;/th&gt;
&lt;th&gt;$a_0$&lt;/th&gt;
&lt;th&gt;$a_r$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v_{\pi_k}(s_1)$&lt;/td&gt;
&lt;td&gt;$0+\gamma v_{\pi_k}(s_1)$&lt;/td&gt;
&lt;td&gt;$1+\gamma v_{\pi_k}(s_2)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$0+\gamma v_{\pi_k}(s_1)$&lt;/td&gt;
&lt;td&gt;$1+\gamma v_{\pi_k}(s_2)$&lt;/td&gt;
&lt;td&gt;$-1+\gamma v_{\pi_k}(s_2)$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;把 $v_{\pi_0}(s_1)=-10$、$v_{\pi_0}(s_2)=-9$ 代入：&lt;/p&gt;
&lt;h4&gt;Table 4.5：$k=0$ 时的 $q_{\pi_0}(s,a)$&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;$q_{\pi_0}(s,a)$&lt;/th&gt;
&lt;th&gt;$a_\ell$&lt;/th&gt;
&lt;th&gt;$a_0$&lt;/th&gt;
&lt;th&gt;$a_r$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$-10$&lt;/td&gt;
&lt;td&gt;$-9$&lt;/td&gt;
&lt;td&gt;$-7.1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_2$&lt;/td&gt;
&lt;td&gt;$-9$&lt;/td&gt;
&lt;td&gt;$-7.1$&lt;/td&gt;
&lt;td&gt;$-9.1$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;逐行取最大值得到：&lt;/p&gt;
&lt;p&gt;$$
\pi_1(a_r\mid s_1)=1,\qquad
\pi_1(a_0\mid s_2)=1.
$$&lt;/p&gt;
&lt;p&gt;这就是 Figure 4.3(b) 的最优策略。本例一次外层迭代即可完成策略改进。&lt;/p&gt;
&lt;h3&gt;3.7 Figure 4.4：复杂网格中的演化&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-4-4.png&quot; alt=&quot;Figure 4.4：策略迭代中策略与价值的演化&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 每个编号子图同时给出策略和对应的真实状态价值。橙色是禁止区域，青色是目标区域。奖励为&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}=-1,\qquad
r_{\text{forbidden}}=-10,\qquad
r_{\text{target}}=1,\qquad
\gamma=0.9.
$$&lt;/p&gt;
&lt;p&gt;从随机策略 $\pi_0$ 出发，算法最终在 $\pi_{10}$ 达到最优。图中有两个重要现象：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;策略从目标附近向外改善。&lt;/strong&gt; 靠近目标的状态较早找到通往目标的正确动作；更远状态随后通过这些已改善状态形成更长的最优路径。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;价值随离目标的距离下降。&lt;/strong&gt; 距离越远，需要越多步才能获得正奖励，折扣使该奖励的当前价值更小。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;4. 截断策略迭代&lt;/h2&gt;
&lt;h3&gt;4.1 为什么需要统一视角？&lt;/h3&gt;
&lt;p&gt;价值迭代和策略迭代都包含“价值步骤”和“策略步骤”，但价值步骤的计算量不同。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;策略迭代：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
\pi_0
\xrightarrow{\mathrm{PE}}v_{\pi_0}
\xrightarrow{\mathrm{PI}}\pi_1
\xrightarrow{\mathrm{PE}}v_{\pi_1}
\xrightarrow{\mathrm{PI}}\cdots
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;价值迭代：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
v_0
\xrightarrow{\mathrm{PU}}\pi_1&apos;
\xrightarrow{\mathrm{VU}}v_1
\xrightarrow{\mathrm{PU}}\pi_2&apos;
\xrightarrow{\mathrm{VU}}v_2
\longrightarrow\cdots
$$&lt;/p&gt;
&lt;p&gt;为了公平比较，教材令两者从相同条件开始：&lt;/p&gt;
&lt;p&gt;$$
v_0=v_{\pi_0}.
$$&lt;/p&gt;
&lt;h4&gt;Table 4.6：策略迭代与价值迭代的步骤比较&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;步骤&lt;/th&gt;
&lt;th&gt;策略迭代&lt;/th&gt;
&lt;th&gt;价值迭代&lt;/th&gt;
&lt;th&gt;说明&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;1 策略&lt;/td&gt;
&lt;td&gt;$\pi_0$&lt;/td&gt;
&lt;td&gt;N/A&lt;/td&gt;
&lt;td&gt;策略迭代从策略开始&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2 价值&lt;/td&gt;
&lt;td&gt;$v_{\pi_0}=r_{\pi_0}+\gamma P_{\pi_0}v_{\pi_0}$&lt;/td&gt;
&lt;td&gt;$v_0=v_{\pi_0}$&lt;/td&gt;
&lt;td&gt;设定相同起点&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3 策略&lt;/td&gt;
&lt;td&gt;$\pi_1=\arg\max_\pi(r_\pi+\gamma P_\pi v_{\pi_0})$&lt;/td&gt;
&lt;td&gt;$\pi_1&apos;=\arg\max_\pi(r_\pi+\gamma P_\pi v_0)$&lt;/td&gt;
&lt;td&gt;两个策略相同&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;4 价值&lt;/td&gt;
&lt;td&gt;$v_{\pi_1}=r_{\pi_1}+\gamma P_{\pi_1}v_{\pi_1}$&lt;/td&gt;
&lt;td&gt;$v_1=r_{\pi_1}+\gamma P_{\pi_1}v_0$&lt;/td&gt;
&lt;td&gt;$v_{\pi_1}\geq v_1$，因为 $v_{\pi_1}\geq v_{\pi_0}$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;5 策略&lt;/td&gt;
&lt;td&gt;$\pi_2=\arg\max_\pi(r_\pi+\gamma P_\pi v_{\pi_1})$&lt;/td&gt;
&lt;td&gt;$\pi_2&apos;=\arg\max_\pi(r_\pi+\gamma P_\pi v_1)$&lt;/td&gt;
&lt;td&gt;此后可能不同&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;前 3 步相同，差异在第 4 步：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;价值迭代只对 $\pi_1$ 做一次 Bellman 备份；&lt;/li&gt;
&lt;li&gt;策略迭代把 $\pi_1$ 的 Bellman 方程一直迭代到收敛。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;显式写出这一评价过程。令&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_1}^{(0)}=v_0,
$$&lt;/p&gt;
&lt;p&gt;并迭代：&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_1}^{(j)}
=r_{\pi_1}+\gamma P_{\pi_1}v_{\pi_1}^{(j-1)}.
$$&lt;/p&gt;
&lt;p&gt;那么：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;只迭代 $1$ 次，$v_{\pi_1}^{(1)}=v_1$，对应价值迭代；&lt;/li&gt;
&lt;li&gt;迭代有限次 $j_{\text{truncate}}$，得到截断策略迭代；&lt;/li&gt;
&lt;li&gt;迭代到 $j\rightarrow\infty$，得到 $v_{\pi_1}$，对应策略迭代。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;p&gt;$$
\text{价值迭代}
\quad\Longleftrightarrow\quad
j_{\text{truncate}}=1,
$$&lt;/p&gt;
&lt;p&gt;$$
\text{策略迭代}
\quad\Longleftrightarrow\quad
j_{\text{truncate}}=\infty.
$$&lt;/p&gt;
&lt;p&gt;教材强调，这个直接比较依赖相同初始条件 $v_{\pi_1}^{(0)}=v_0=v_{\pi_0}$；没有该条件，不能直接按上述方式比较两条序列。&lt;/p&gt;
&lt;h3&gt;4.2 Algorithm 4.3：截断策略迭代&lt;/h3&gt;
&lt;p&gt;截断策略迭代与策略迭代的区别只有一个：策略评价只运行有限次。&lt;/p&gt;
&lt;h4&gt;输入&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;模型 $p(r\mid s,a)$ 与 $p(s&apos;\mid s,a)$；&lt;/li&gt;
&lt;li&gt;折扣率 $\gamma$；&lt;/li&gt;
&lt;li&gt;初始策略 $\pi_0$；&lt;/li&gt;
&lt;li&gt;策略评价最大次数 $j_{\text{truncate}}$；&lt;/li&gt;
&lt;li&gt;外层停止条件。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;第 $k$ 轮&lt;/h4&gt;
&lt;ol&gt;
&lt;li&gt;以先前外层价值估计初始化：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
v_k^{(0)}=v_{k-1}.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;固定当前策略 $\pi_k$，做 $j_{\text{truncate}}$ 次评价更新：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
v_k^{(j+1)}(s)
=\sum_a\pi_k(a\mid s)
\left[
\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_k^{(j)}(s&apos;)
\right].
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;令&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
v_k=v_k^{(j_{\text{truncate}})}.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;用 $v_k$ 计算：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
q_k(s,a)
=\sum_{r\in\mathcal R}p(r\mid s,a)r
+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_k(s&apos;).
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;令 $\pi_{k+1}$ 对 $q_k$ 贪心。&lt;/li&gt;
&lt;li&gt;若 $v_k$ 尚未收敛，则继续外层迭代。&lt;/li&gt;
&lt;/ol&gt;
&lt;h4&gt;输出&lt;/h4&gt;
&lt;p&gt;收敛的价值估计和对应的贪心策略。&lt;/p&gt;
&lt;p&gt;由于策略评价未完成，$v_k^{(j)}$ 与 $v_k$ 通常不是真实状态价值，只是 $v_{\pi_k}$ 的近似。&lt;/p&gt;
&lt;h3&gt;4.3 Figure 4.5：三种算法的连续关系&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-4-5.png&quot; alt=&quot;Figure 4.5：价值迭代、截断策略迭代与策略迭代的关系&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 横轴是外层迭代次数 $k$，红线是最优状态价值 $v^*$。在教材的示意比较中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;价值迭代每轮评价最少，单轮便宜，但外层靠近 $v^*$ 较慢；&lt;/li&gt;
&lt;li&gt;策略迭代把每轮策略评价做充分，外层靠近 $v^*$ 较快，但单轮昂贵；&lt;/li&gt;
&lt;li&gt;截断策略迭代位于两者之间，以有限的额外评价计算换取更快的外层收敛。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
这幅图表达的是算法关系与典型趋势，不是对所有问题逐点速度的无条件保证。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.4 Proposition 4.1：策略评价中的价值改进&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Proposition 4.1 - Value improvement
考虑固定策略 $\pi_k$ 的评价迭代
$$
v_{\pi_k}^{(j+1)}
=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}^{(j)}.
$$
若初值选择为
$$
v_{\pi_k}^{(0)}=v_{\pi_{k-1}},
$$
则对所有 $j=0,1,2,\ldots$，有
$$
v_{\pi_k}^{(j+1)}\geq v_{\pi_k}^{(j)}.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Box 4.3：证明&lt;/h4&gt;
&lt;p&gt;相邻两次评价估计之差满足：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_{\pi_k}^{(j+1)}-v_{\pi_k}^{(j)}
&amp;amp;=\gamma P_{\pi_k}
\left(v_{\pi_k}^{(j)}-v_{\pi_k}^{(j-1)}\right)\
&amp;amp;=\cdots\
&amp;amp;=\gamma^jP_{\pi_k}^j
\left(v_{\pi_k}^{(1)}-v_{\pi_k}^{(0)}\right).
\end{aligned}
\tag{4.5}
$$&lt;/p&gt;
&lt;p&gt;先证明第一步非负。因为 $v_{\pi_k}^{(0)}=v_{\pi_{k-1}}$：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
v_{\pi_k}^{(1)}
&amp;amp;=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}^{(0)}\
&amp;amp;=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_{k-1}}\
&amp;amp;\geq r_{\pi_{k-1}}+\gamma P_{\pi_{k-1}}v_{\pi_{k-1}}\
&amp;amp;=v_{\pi_{k-1}}\
&amp;amp;=v_{\pi_k}^{(0)}.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;不等式来自 $\pi_k$ 对 $v_{\pi_{k-1}}$ 的贪心改进。再由 $P_{\pi_k}$ 非负，把&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_k}^{(1)}-v_{\pi_k}^{(0)}\geq0
$$&lt;/p&gt;
&lt;p&gt;代入式 (4.5)，即可得到每一步都非减。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] Proposition 4.1 的适用限制
该命题假定评价初值是真实的 $v_{\pi_{k-1}}$。实践中通常只有上一轮近似 $v_{k-1}$，并不能直接获得精确 $v_{\pi_{k-1}}$。因此这个命题为收敛直觉提供支持，但教材明确指出，更深入的严格讨论需要额外分析。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.5 怎样选择截断次数？&lt;/h3&gt;
&lt;p&gt;教材给出的总体原则是：运行少量评价迭代，但不要过多。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;次数太少：接近价值迭代，单轮便宜，但外层可能需要更多轮；&lt;/li&gt;
&lt;li&gt;次数适中：常能显著改善外层收敛速度；&lt;/li&gt;
&lt;li&gt;次数过多：越来越接近完整策略迭代，额外计算未必继续带来显著收益。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以 $j_{\text{truncate}}$ 体现了“单轮计算量”和“外层收敛速度”的折中。&lt;/p&gt;
&lt;h2&gt;5. 三种算法与广义策略迭代&lt;/h2&gt;
&lt;p&gt;三种算法的共同点是，每轮都有一个价值相关步骤和一个策略相关步骤。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;价值步骤&lt;/th&gt;
&lt;th&gt;策略步骤&lt;/th&gt;
&lt;th&gt;中间价值是否一定是真实状态价值&lt;/th&gt;
&lt;th&gt;两个极端中的位置&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;价值迭代&lt;/td&gt;
&lt;td&gt;对贪心策略做一次备份&lt;/td&gt;
&lt;td&gt;根据 $v_k$ 更新贪心策略&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;$j_{\text{truncate}}=1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;截断策略迭代&lt;/td&gt;
&lt;td&gt;固定策略做有限次评价&lt;/td&gt;
&lt;td&gt;根据近似价值改进策略&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;$1&amp;lt;j_{\text{truncate}}&amp;lt;\infty$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;策略迭代&lt;/td&gt;
&lt;td&gt;把当前策略评价到收敛&lt;/td&gt;
&lt;td&gt;根据 $v_{\pi_k}$ 改进策略&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;$j_{\text{truncate}}=\infty$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这种价值更新与策略更新相互作用的通用思想称为&lt;strong&gt;广义策略迭代（generalized policy iteration, GPI）&lt;/strong&gt;。GPI 不是某一个固定算法，而是一个算法设计框架：&lt;/p&gt;
&lt;p&gt;$$
\text{价值估计更准确}
\longrightarrow
\text{策略变得更贪心}
\longrightarrow
\text{新的策略价值}
\longrightarrow
\text{继续评价与改进}.
$$&lt;/p&gt;
&lt;p&gt;策略推动价值估计改变，价值估计又推动策略变得更优。教材后续的大多数强化学习算法都可纳入这一框架。&lt;/p&gt;
&lt;h2&gt;6. 本章总结&lt;/h2&gt;
&lt;p&gt;本章从“怎样把 Bellman 理论变成寻找最优策略的算法”出发。&lt;/p&gt;
&lt;p&gt;首先，Bellman 最优算子的压缩性质直接产生价值迭代。它每轮根据当前价值构造贪心策略，再做一次价值备份，因而实现简单且保证收敛，但中间 $v_k$ 通常不属于任何策略。&lt;/p&gt;
&lt;p&gt;随后，策略迭代把问题拆成完整的策略评价和策略改进。策略改进引理保证每次贪心更新都不会降低状态价值；通过与价值迭代序列比较，可以证明策略价值收敛到 $v^*$。&lt;/p&gt;
&lt;p&gt;最后，教材发现两种算法的本质差异只是策略评价的迭代次数。评价一次得到价值迭代，评价到无穷得到策略迭代，评价有限多次得到截断策略迭代。这一连续谱揭示了广义策略迭代的核心：价值与策略彼此促进，共同逼近最优解。&lt;/p&gt;
&lt;h2&gt;7. 教材 Q&amp;amp;A&lt;/h2&gt;
&lt;h3&gt;Q1：价值迭代保证找到最优策略吗？&lt;/h3&gt;
&lt;p&gt;是。价值迭代正是压缩映射定理建议的 Bellman 最优方程求解算法，其收敛由该定理保证。&lt;/p&gt;
&lt;h3&gt;Q2：价值迭代的中间 $v_k$ 是状态价值吗？&lt;/h3&gt;
&lt;p&gt;通常不是，因为它不保证满足任何策略的 Bellman 方程。&lt;/p&gt;
&lt;h3&gt;Q3：策略迭代包含哪些步骤？&lt;/h3&gt;
&lt;p&gt;每轮包含策略评价和策略改进。前者求当前策略的状态价值，后者根据该价值构造更优策略。&lt;/p&gt;
&lt;h3&gt;Q4：策略迭代中是否嵌套了另一个迭代算法？&lt;/h3&gt;
&lt;p&gt;是。策略评价通常通过式 (4.4) 的迭代算法求解当前策略的 Bellman 方程。&lt;/p&gt;
&lt;h3&gt;Q5：策略迭代的中间价值是状态价值吗？&lt;/h3&gt;
&lt;p&gt;在完整策略评价的理论算法中是，因为每个 $v_{\pi_k}$ 都是当前策略 Bellman 方程的解。&lt;/p&gt;
&lt;h3&gt;Q6：策略迭代保证找到最优策略吗？&lt;/h3&gt;
&lt;p&gt;是。Lemma 4.1 与 Theorem 4.1 给出了改进性和收敛性证明。&lt;/p&gt;
&lt;h3&gt;Q7：截断策略迭代与策略迭代有什么关系？&lt;/h3&gt;
&lt;p&gt;截断策略迭代只执行有限次策略评价，而完整策略迭代把策略评价执行到收敛。&lt;/p&gt;
&lt;h3&gt;Q8：截断策略迭代与价值迭代有什么关系？&lt;/h3&gt;
&lt;p&gt;价值迭代是截断策略迭代只做一次策略评价更新的极端情形。&lt;/p&gt;
&lt;h3&gt;Q9：截断策略迭代的中间价值是状态价值吗？&lt;/h3&gt;
&lt;p&gt;通常不是。有限次评价只能得到真实策略价值的近似；只有评价到收敛才得到 $v_{\pi_k}$。&lt;/p&gt;
&lt;h3&gt;Q10：策略评价应截断在多少次？&lt;/h3&gt;
&lt;p&gt;一般做少量迭代，但不宜过多。少量额外评价可以加快总体收敛，过多评价的边际收益可能很小。&lt;/p&gt;
&lt;h3&gt;Q11：什么是广义策略迭代？&lt;/h3&gt;
&lt;p&gt;它不是单个算法，而是价值更新与策略更新相互作用的通用思想。教材后续大多数算法都属于这一范畴。&lt;/p&gt;
&lt;h3&gt;Q12：model-based 与 model-free 强化学习怎样区分？&lt;/h3&gt;
&lt;p&gt;model-based 方法从数据估计模型并在学习过程中使用它；model-free 方法不进行模型估计。本章 DP 算法直接要求系统模型已知，因此教材通常把它们称为动态规划算法，而不是强化学习算法。&lt;/p&gt;
&lt;h2&gt;8. 一页式复习&lt;/h2&gt;
&lt;h3&gt;三个核心更新&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;价值迭代：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
v_{k+1}=\max_\pi(r_\pi+\gamma P_\pi v_k).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;策略评价：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
v_{\pi_k}^{(j+1)}
=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}^{(j)}.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;策略改进：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
\pi_{k+1}=\arg\max_\pi(r_\pi+\gamma P_\pi v_{\pi_k}).
$$&lt;/p&gt;
&lt;h3&gt;三种方法的关系&lt;/h3&gt;
&lt;p&gt;$$
j_{\text{truncate}}=1
\Rightarrow\text{价值迭代},
$$&lt;/p&gt;
&lt;p&gt;$$
1&amp;lt;j_{\text{truncate}}&amp;lt;\infty
\Rightarrow\text{截断策略迭代},
$$&lt;/p&gt;
&lt;p&gt;$$
j_{\text{truncate}}=\infty
\Rightarrow\text{策略迭代}.
$$&lt;/p&gt;
&lt;h3&gt;必记结论&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;价值迭代直接求解 Bellman 最优方程，收敛由压缩映射定理保证。&lt;/li&gt;
&lt;li&gt;价值迭代中间 $v_k$ 和 $q_k$ 通常不是真实策略价值。&lt;/li&gt;
&lt;li&gt;完整策略迭代的 $v_{\pi_k}$ 是真实状态价值。&lt;/li&gt;
&lt;li&gt;贪心策略改进保证 $v_{\pi_{k+1}}\geq v_{\pi_k}$。&lt;/li&gt;
&lt;li&gt;策略迭代的状态价值序列收敛到 $v^*$。&lt;/li&gt;
&lt;li&gt;截断策略迭代用评价精度换取计算效率。&lt;/li&gt;
&lt;li&gt;GPI 指价值和策略相互推动，不是某个特定算法。&lt;/li&gt;
&lt;li&gt;本章算法要求已知系统模型。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;9. 公式清单&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;公式&lt;/th&gt;
&lt;th&gt;名称&lt;/th&gt;
&lt;th&gt;作用&lt;/th&gt;
&lt;th&gt;使用场景&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$v_{k+1}=\max_\pi(r_\pi+\gamma P_\pi v_k)$&lt;/td&gt;
&lt;td&gt;价值迭代&lt;/td&gt;
&lt;td&gt;应用 Bellman 最优备份&lt;/td&gt;
&lt;td&gt;求 $v^*$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_k(s,a)=\sum_{r\in\mathcal R}p(r\mid s,a)r+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_k(s&apos;)$&lt;/td&gt;
&lt;td&gt;一步前瞻&lt;/td&gt;
&lt;td&gt;比较当前价值下的动作&lt;/td&gt;
&lt;td&gt;贪心更新&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{k+1}(s)=\max_a q_k(s,a)$&lt;/td&gt;
&lt;td&gt;逐状态价值更新&lt;/td&gt;
&lt;td&gt;取最优动作备份&lt;/td&gt;
&lt;td&gt;Algorithm 4.1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{\pi_k}=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}$&lt;/td&gt;
&lt;td&gt;策略 Bellman 方程&lt;/td&gt;
&lt;td&gt;定义当前策略的真实价值&lt;/td&gt;
&lt;td&gt;策略评价&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{\pi_k}=(I-\gamma P_{\pi_k})^{-1}r_{\pi_k}$&lt;/td&gt;
&lt;td&gt;策略评价闭式解&lt;/td&gt;
&lt;td&gt;理论求解当前策略价值&lt;/td&gt;
&lt;td&gt;理论分析&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{\pi_k}^{(j+1)}=r_{\pi_k}+\gamma P_{\pi_k}v_{\pi_k}^{(j)}$&lt;/td&gt;
&lt;td&gt;迭代策略评价&lt;/td&gt;
&lt;td&gt;逐步逼近 $v_{\pi_k}$&lt;/td&gt;
&lt;td&gt;策略迭代、截断策略迭代&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_{k+1}=\arg\max_\pi(r_\pi+\gamma P_\pi v_{\pi_k})$&lt;/td&gt;
&lt;td&gt;策略改进&lt;/td&gt;
&lt;td&gt;对当前策略价值贪心&lt;/td&gt;
&lt;td&gt;Policy improvement&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{\pi_{k+1}}\geq v_{\pi_k}$&lt;/td&gt;
&lt;td&gt;策略改进引理&lt;/td&gt;
&lt;td&gt;保证策略不会变差&lt;/td&gt;
&lt;td&gt;收敛证明&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{\pi_k}^{(j+1)}-v_{\pi_k}^{(j)}=\gamma^jP_{\pi_k}^j(v_{\pi_k}^{(1)}-v_{\pi_k}^{(0)})$&lt;/td&gt;
&lt;td&gt;评价增量传播&lt;/td&gt;
&lt;td&gt;证明评价序列单调&lt;/td&gt;
&lt;td&gt;Proposition 4.1&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;10. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$\mathcal S$&lt;/td&gt;
&lt;td&gt;状态集合&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathcal A(s)$&lt;/td&gt;
&lt;td&gt;状态 $s$ 下的可行动作集合&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Pi$&lt;/td&gt;
&lt;td&gt;策略集合&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_k$&lt;/td&gt;
&lt;td&gt;外层第 $k$ 轮的策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_k$&lt;/td&gt;
&lt;td&gt;价值迭代或截断算法的中间价值估计&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{\pi_k}$&lt;/td&gt;
&lt;td&gt;策略 $\pi_k$ 的真实状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_{\pi_k}^{(j)}$&lt;/td&gt;
&lt;td&gt;评价策略 $\pi_k$ 时第 $j$ 次内部估计&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_k(s,a)$&lt;/td&gt;
&lt;td&gt;由中间估计 $v_k$ 构造的一步前瞻量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_{\pi_k}(s,a)$&lt;/td&gt;
&lt;td&gt;策略 $\pi_k$ 的动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$r_\pi$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 下的一步期望奖励向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$P_\pi$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 下的状态转移矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\gamma$&lt;/td&gt;
&lt;td&gt;折扣率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$k$&lt;/td&gt;
&lt;td&gt;外层策略或价值迭代索引&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$j$&lt;/td&gt;
&lt;td&gt;策略评价的内层迭代索引&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$j_{\text{truncate}}$&lt;/td&gt;
&lt;td&gt;截断策略评价的最大迭代次数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v^*$&lt;/td&gt;
&lt;td&gt;唯一最优状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi^*$&lt;/td&gt;
&lt;td&gt;一个最优策略&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;11. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;English&lt;/th&gt;
&lt;th&gt;中文&lt;/th&gt;
&lt;th&gt;简单解释&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;dynamic programming&lt;/td&gt;
&lt;td&gt;动态规划&lt;/td&gt;
&lt;td&gt;已知模型时通过递推关系求解控制问题的方法&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;value iteration&lt;/td&gt;
&lt;td&gt;价值迭代&lt;/td&gt;
&lt;td&gt;反复应用 Bellman 最优备份&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;policy update&lt;/td&gt;
&lt;td&gt;策略更新&lt;/td&gt;
&lt;td&gt;根据中间价值构造贪心策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;value update&lt;/td&gt;
&lt;td&gt;价值更新&lt;/td&gt;
&lt;td&gt;用新贪心策略执行一次备份&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;policy iteration&lt;/td&gt;
&lt;td&gt;策略迭代&lt;/td&gt;
&lt;td&gt;完整评价当前策略后再改进策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;policy evaluation&lt;/td&gt;
&lt;td&gt;策略评价&lt;/td&gt;
&lt;td&gt;求固定策略的状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;policy improvement&lt;/td&gt;
&lt;td&gt;策略改进&lt;/td&gt;
&lt;td&gt;对当前策略价值贪心得到更优策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;greedy policy&lt;/td&gt;
&lt;td&gt;贪心策略&lt;/td&gt;
&lt;td&gt;在每个状态选择当前估计下最大动作的策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;truncated policy iteration&lt;/td&gt;
&lt;td&gt;截断策略迭代&lt;/td&gt;
&lt;td&gt;每轮只做有限次策略评价的策略迭代&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;generalized policy iteration&lt;/td&gt;
&lt;td&gt;广义策略迭代&lt;/td&gt;
&lt;td&gt;价值更新与策略更新相互作用的通用框架&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;model-based reinforcement learning&lt;/td&gt;
&lt;td&gt;基于模型的强化学习&lt;/td&gt;
&lt;td&gt;从数据估计模型并在学习中使用模型&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;model-free reinforcement learning&lt;/td&gt;
&lt;td&gt;无模型强化学习&lt;/td&gt;
&lt;td&gt;学习过程中不进行模型估计&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;12. 常见误区&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 1：把 $v_k$ 都叫作“某个策略的状态价值”
价值迭代和截断策略迭代的中间 $v_k$ 通常不满足任何策略的 Bellman 方程。只有完整策略评价得到的 $v_{\pi_k}$ 才必然是当前策略的状态价值。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 2：认为策略迭代直接求解 Bellman 最优方程
直接应用 Bellman 最优算子的是价值迭代。策略迭代通过“评价当前策略 + 贪心改进”间接到达最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 3：策略评价只做一次仍叫完整策略迭代
只做一次时已经落在价值迭代这一极端；有限次属于截断策略迭代；评价到收敛才是理论上的完整策略迭代。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 4：外层更快等于总计算一定更少
策略迭代可能需要更少外层轮数，但每轮包含昂贵的策略评价。总成本取决于问题规模、评价方法与停止条件。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 5：贪心策略必须唯一
若多个动作达到相同最大值，可以任选一个形成确定性策略，也可以在最大动作之间随机化；最优性不因此消失。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 6：要求已知模型就等于 model-based RL
本章 DP 方法直接使用给定模型；model-based RL 强调从数据估计模型并用于学习，两者语境不同。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 7：Figure 4.5 是无条件的精确速度定理
它用于说明三种方法的关系和典型权衡。教材的直接序列比较依赖相同初始条件，不能脱离条件机械比较所有问题的运行时间。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;13. 自测题&lt;/h2&gt;
&lt;h3&gt;13.1 概念题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;价值迭代每轮的两个步骤是什么？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;先根据 $v_k$ 对一步前瞻量贪心，得到 $\pi_{k+1}$；再用该策略对 $v_k$ 做一次价值备份，得到 $v_{k+1}$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;为什么价值迭代中的 $v_k$ 通常不是状态价值？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;因为它通常不满足任何固定策略的 Bellman 方程。它只是 Bellman 最优算子迭代产生的中间向量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;策略评价与策略改进分别解决什么问题？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;策略评价求当前策略 $\pi_k$ 的真实状态价值 $v_{\pi_k}$；策略改进以该价值为基准，对动作一步前瞻并构造贪心新策略 $\pi_{k+1}$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;为什么 Lemma 4.1 能保证策略价值序列单调不减？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;新策略对旧策略价值 $v_{\pi_k}$ 贪心，因此一步前瞻不差于旧策略；利用新策略的 Bellman 方程和非负转移矩阵，可把这个不等式传播到无限未来，得到 $v_{\pi_{k+1}}\geq v_{\pi_k}$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;截断策略迭代怎样统一价值迭代和策略迭代？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;统一参数是每轮策略评价的次数。做一次对应价值迭代，做有限多次对应截断策略迭代，做到收敛或理论上的无限次对应策略迭代。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;广义策略迭代是不是一个固定伪代码？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;不是。它是价值估计与策略改进相互作用的通用思想，许多具体算法都可以实现这种思想。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;13.2 判断与推导题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;判断：若 $q_k(s,a)$ 有两个并列最大动作，价值迭代无法继续。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;错误。任选一个最大动作即可形成确定性贪心策略，不影响收敛。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;判断：策略迭代每轮外层计算一定比价值迭代便宜。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;错误。完整策略评价需要多次内层迭代或求解线性方程，单轮通常更昂贵；它的优势是外层可能更快靠近最优价值。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;从&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
v_{\pi_k}-v_{\pi_{k+1}}
\leq\gamma P_{\pi_{k+1}}
\left(v_{\pi_k}-v_{\pi_{k+1}}\right)
$$&lt;/p&gt;
&lt;p&gt;说明为什么能推出 $v_{\pi_{k+1}}\geq v_{\pi_k}$。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;反复代入右侧得到上界&lt;/p&gt;
&lt;p&gt;$$
\gamma^nP_{\pi_{k+1}}^n
\left(v_{\pi_k}-v_{\pi_{k+1}}\right).
$$&lt;/p&gt;
&lt;p&gt;由于 $0\leq\gamma&amp;lt;1$，$\gamma^n\rightarrow0$；而 $P_{\pi_{k+1}}^n$ 是非负随机矩阵，不会使向量无界增长。因此右侧趋于零，得到 $v_{\pi_k}-v_{\pi_{k+1}}\leq0$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;在 Figure 4.3 的两状态例子中，验证 $s_1$ 下动作 $a_r$ 的值为 $-7.1$。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;向右获得目标奖励 $1$，下一状态是 $s_2$，且 $v_{\pi_0}(s_2)=-9$、$\gamma=0.9$。所以&lt;/p&gt;
&lt;p&gt;$$
q_{\pi_0}(s_1,a_r)
=1+0.9\times(-9)
=-7.1.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;若截断次数设为 $j_{\text{truncate}}=1$，写出对应价值更新并说明它为什么就是价值迭代。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;固定贪心策略 $\pi_{k+1}$ 后只做一次评价：&lt;/p&gt;
&lt;p&gt;$$
v_{k+1}=r_{\pi_{k+1}}+\gamma P_{\pi_{k+1}}v_k.
$$&lt;/p&gt;
&lt;p&gt;而 $\pi_{k+1}$ 是关于 $v_k$ 的最大化策略，因此合并后正是&lt;/p&gt;
&lt;p&gt;$$
v_{k+1}=\max_\pi(r_\pi+\gamma P_\pi v_k).
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol&gt;
&lt;li&gt;Proposition 4.1 为什么不能直接当作实际截断策略迭代的完整收敛证明？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;命题假设内层初值是上一策略的真实状态价值 $v_{\pi_{k-1}}$，但实践中通常只有近似值 $v_{k-1}$。该假设不一定满足，因此命题主要提供价值改进直觉，完整收敛还需要更深入分析。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 5 - Monte Carlo Methods</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-5-monte-carlo-methods/chapter-5---monte-carlo-methods/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-5-monte-carlo-methods/chapter-5---monte-carlo-methods/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 5 - Monte Carlo Methods&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
前一章的价值迭代和策略迭代依赖已知环境模型。本章第一次进入无模型强化学习：不知道奖励分布和状态转移概率时，直接把完整 episode 的实际回报当作样本，用样本均值估计动作价值，再据此改进策略。全章依次建立 MC Basic、MC Exploring Starts 和 MC $\epsilon$-Greedy，并用它们说明样本利用率、充分探索以及探索-利用权衡。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识结构&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-5-1-book-roadmap.png&quot; alt=&quot;Figure 5.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; Chapter 5 把 Chapter 4 中“依赖模型的策略迭代”改造成“依赖经验数据的策略迭代”。它仍然属于非增量方法：通常等 episode 结束后才得到完整回报并更新。Chapter 7 的时序差分方法会进一步走向增量更新。&lt;/p&gt;
&lt;p&gt;本章主线为：&lt;/p&gt;
&lt;p&gt;$$
\text{期望的样本均值估计}
\longrightarrow
\text{用回报估计 }q_\pi
\longrightarrow
\text{MC Basic}
\longrightarrow
\text{MC Exploring Starts}
\longrightarrow
\text{MC }\epsilon\text{-Greedy}.
$$&lt;/p&gt;
&lt;p&gt;三个算法逐步解决三个问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;没有模型时如何评价策略？&lt;/strong&gt; 用完整 episode 的折扣回报估计 $q_\pi(s,a)$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;一条 episode 如何产生更多训练样本？&lt;/strong&gt; 使用 first-visit 或 every-visit，把访问过的状态动作对都用于更新。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;无法人为指定每条 episode 的起点怎么办？&lt;/strong&gt; 使用 soft policy，特别是 $\epsilon$-greedy，让普通轨迹也能持续探索。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 一句话总览
Monte Carlo 控制就是“采样完整回报做策略评价，再按当前动作价值改进策略”的无模型策略迭代。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;1. 从均值估计理解 Monte Carlo&lt;/h2&gt;
&lt;h3&gt;1.1 两种计算期望的路线&lt;/h3&gt;
&lt;p&gt;设离散随机变量 $X$ 的取值集合为 $\mathcal X$。若概率模型 $p(x)$ 已知，可直接按定义计算：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[X]
=\sum_{x\in\mathcal X}p(x)x.
$$&lt;/p&gt;
&lt;p&gt;这是 &lt;strong&gt;model-based&lt;/strong&gt; 路线，因为它需要完整概率分布。&lt;/p&gt;
&lt;p&gt;若分布未知，但能获得样本 $x_1,x_2,\ldots,x_n$，则以样本均值近似期望：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[X]
\approx
\bar x_n
=\frac{1}{n}\sum_{i=1}^{n}x_i.
$$&lt;/p&gt;
&lt;p&gt;这是 &lt;strong&gt;model-free Monte Carlo estimation&lt;/strong&gt;：不恢复概率模型，而是直接用随机样本解决期望计算问题。&lt;/p&gt;
&lt;h3&gt;1.2 抛硬币例子&lt;/h3&gt;
&lt;p&gt;令&lt;/p&gt;
&lt;p&gt;$$
X=
\begin{cases}
+1, &amp;amp; \text{正面},\
-1, &amp;amp; \text{反面},
\end{cases}
\qquad
p(X=1)=p(X=-1)=0.5.
$$&lt;/p&gt;
&lt;p&gt;已知模型时：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[X]
=0.5\times 1+0.5\times(-1)
=0.
$$&lt;/p&gt;
&lt;p&gt;未知模型时，反复抛硬币并计算运行均值：&lt;/p&gt;
&lt;p&gt;$$
\bar x_n
=\frac{x_1+x_2+\cdots+x_n}{n}.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-5-2-law-of-large-numbers.png&quot; alt=&quot;Figure 5.2：大数定律示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 单个样本始终是 $+1$ 或 $-1$，并不会趋近于 $0$；趋近于真实期望的是累计样本均值。样本较少时曲线波动很大，样本增多后逐渐稳定。&lt;/p&gt;
&lt;h3&gt;1.3 Box 5.1 - 大数定律背后的均值与方差&lt;/h3&gt;
&lt;p&gt;设 $x_1,\ldots,x_n$ 独立同分布，均服从随机变量 $X$ 的分布，并定义&lt;/p&gt;
&lt;p&gt;$$
\bar x_n=\frac{1}{n}\sum_{i=1}^{n}x_i.
$$&lt;/p&gt;
&lt;p&gt;样本均值是无偏的：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\bar x_n]
=\frac{1}{n}\sum_{i=1}^{n}\mathbb E[x_i]
=\mathbb E[X].
$$&lt;/p&gt;
&lt;p&gt;利用独立性，样本均值的方差为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\operatorname{Var}(\bar x_n)
&amp;amp;=\operatorname{Var}\left(
\frac{1}{n}\sum_{i=1}^{n}x_i
\right)\
&amp;amp;=\frac{1}{n^2}\sum_{i=1}^{n}\operatorname{Var}(x_i)\
&amp;amp;=\frac{1}{n}\operatorname{Var}(X).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;p&gt;$$
\operatorname{Var}(\bar x_n)\rightarrow 0
\qquad (n\rightarrow\infty).
$$&lt;/p&gt;
&lt;p&gt;关键逻辑是：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;同分布&lt;/strong&gt;保证每个样本有相同均值和方差；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;独立&lt;/strong&gt;保证和的方差等于方差之和，没有额外协方差项；&lt;/li&gt;
&lt;li&gt;样本量增加使估计方差按 $1/n$ 衰减。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 独立同分布条件不能随意忽略
若所有样本都复制第一个样本，则无论样本数多大，样本均值都等于 $x_1$，不会可靠逼近真实期望。强化学习轨迹内的样本通常相关，因此不能把 i.i.d. 结论不加说明地照搬到所有 MC 更新；教材在 every-visit 方法中也专门指出了相关性问题。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;1.4 为什么均值估计是强化学习的核心&lt;/h3&gt;
&lt;p&gt;状态价值和动作价值本身就是回报的条件期望：&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s)
=\mathbb E_\pi[G_t\mid S_t=s],
$$&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s,a)
=\mathbb E_\pi[G_t\mid S_t=s,A_t=a].
$$&lt;/p&gt;
&lt;p&gt;所以“学习价值函数”本质上就是“从经验回报中估计条件均值”。Monte Carlo 方法的对象不是任意数值，而是随机回报 $G_t$。&lt;/p&gt;
&lt;h2&gt;2. MC Basic：最简单的 MC 控制&lt;/h2&gt;
&lt;h3&gt;2.1 把策略迭代改造成无模型算法&lt;/h3&gt;
&lt;p&gt;策略迭代包含：&lt;/p&gt;
&lt;p&gt;$$
\text{策略评价}
\longleftrightarrow
\text{策略改进}.
$$&lt;/p&gt;
&lt;p&gt;已知模型时，可由一步奖励和状态转移计算动作价值：&lt;/p&gt;
&lt;h1&gt;$$
q_{\pi_k}(s,a)&lt;/h1&gt;
&lt;p&gt;\sum_{r\in\mathcal R}p(r\mid s,a)r
+
\gamma
\sum_{s&apos;\in\mathcal S}
p(s&apos;\mid s,a)v_{\pi_k}(s&apos;).
\tag{5.1}
$$&lt;/p&gt;
&lt;p&gt;这里必须知道 $p(r\mid s,a)$ 和 $p(s&apos;\mid s,a)$，所以是 model-based 计算。&lt;/p&gt;
&lt;p&gt;但动作价值也可直接按定义写成：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
q_{\pi_k}(s,a)
&amp;amp;=\mathbb E_{\pi_k}[G_t\mid S_t=s,A_t=a]\
&amp;amp;=\mathbb E_{\pi_k}\left[
R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots
\mid S_t=s,A_t=a
\right].
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;若从 $(s,a)$ 出发并随后遵循 $\pi_k$，收集 $n$ 条 episode，其回报分别为
$g_{\pi_k}^{(1)}(s,a),\ldots,g_{\pi_k}^{(n)}(s,a)$，则：&lt;/p&gt;
&lt;p&gt;$$
q_{\pi_k}(s,a)
\approx
\frac{1}{n}
\sum_{i=1}^{n}
g_{\pi_k}^{(i)}(s,a).
\tag{5.2}
$$&lt;/p&gt;
&lt;p&gt;这一步不需要显式知道环境模型，只需要与环境交互获得数据。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 为什么直接估计动作价值
若只估计 $v_\pi(s)$，策略改进时仍需借助模型比较各动作的一步后果，如式 (5.1)。直接估计 $q_\pi(s,a)$ 后，可以单纯按 $\arg\max_a q_\pi(s,a)$ 攉选动作，从而保持整个控制算法无模型。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.2 Algorithm 5.1 - MC Basic&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;输入与初始化&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;任意初始策略 $\pi_0$；&lt;/li&gt;
&lt;li&gt;外层迭代编号 $k=0,1,2,\ldots$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;第 $k$ 轮&lt;/strong&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;对每个 $s\in\mathcal S$ 和 $a\in\mathcal A(s)$，收集许多从 $(s,a)$ 开始、之后遵循 $\pi_k$ 的 episode。&lt;/li&gt;
&lt;li&gt;计算这些 episode 回报的平均值：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
q_k(s,a)
\leftarrow
\operatorname{average\ return}(s,a).
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;对每个状态作贪心策略改进：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
\pi_{k+1}(s)
\in
\arg\max_{a\in\mathcal A(s)}q_k(s,a).
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;重复，直到策略稳定。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;MC Basic 仍保留完整策略迭代的结构，只把精确的模型式策略评价换成 MC 样本均值评价。&lt;/p&gt;
&lt;h3&gt;2.3 为什么不必每轮都得到极精确的价值&lt;/h3&gt;
&lt;p&gt;理论上，样本充分时：&lt;/p&gt;
&lt;p&gt;$$
q_k(s,a)\rightarrow q_{\pi_k}(s,a),
$$&lt;/p&gt;
&lt;p&gt;因此算法能复现策略迭代并收敛到最优策略。实际中常不必等待每轮价值完全收敛，因为策略评价与策略改进可以交替推动彼此，这与截断策略迭代和广义策略迭代的思想一致。&lt;/p&gt;
&lt;p&gt;但 MC Basic 的代价明显：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每个状态动作对都要作为 episode 起点；&lt;/li&gt;
&lt;li&gt;每轮要收集许多 episode；&lt;/li&gt;
&lt;li&gt;一条 episode 只评价其初始状态动作对；&lt;/li&gt;
&lt;li&gt;必须等完整 episode 回报可得后才能更新。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此它适合展示核心思想，却不是样本利用率最高的实现。&lt;/p&gt;
&lt;h3&gt;2.4 3 x 3 网格世界的逐步计算&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-5-3-mc-basic-gridworld.png&quot; alt=&quot;Figure 5.3：MC Basic 的 3 x 3 网格例子&quot; /&gt;&lt;/p&gt;
&lt;p&gt;环境设置：&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}
=r_{\text{forbidden}}
=-1,
\qquad
r_{\text{target}}=1,
\qquad
\gamma=0.9.
$$&lt;/p&gt;
&lt;p&gt;在 $s_1$ 有五个动作。由于环境和策略都是确定性的，每个起始动作只需一条 episode 就能得到对应回报：&lt;/p&gt;
&lt;p&gt;$$
q_{\pi_0}(s_1,a_1)
=-1+\gamma(-1)+\gamma^2(-1)+\cdots
=-\frac{1}{1-\gamma},
$$&lt;/p&gt;
&lt;p&gt;$$
q_{\pi_0}(s_1,a_2)
=0+\gamma 0+\gamma^2 0+\gamma^3(1)+\gamma^4(1)+\cdots
=\frac{\gamma^3}{1-\gamma},
$$&lt;/p&gt;
&lt;p&gt;$$
q_{\pi_0}(s_1,a_3)
=\frac{\gamma^3}{1-\gamma},
$$&lt;/p&gt;
&lt;p&gt;$$
q_{\pi_0}(s_1,a_4)
=-\frac{1}{1-\gamma},
$$&lt;/p&gt;
&lt;p&gt;$$
q_{\pi_0}(s_1,a_5)
=-\frac{\gamma}{1-\gamma}.
$$&lt;/p&gt;
&lt;p&gt;最大值由 $a_2$ 与 $a_3$ 取得，因此新策略在 $s_1$ 可选择其中任一动作。这个例子的初始策略只有 $s_1$ 和 $s_3$ 非最优，完成一次评价和贪心改进后即可得到最优策略。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
“确定性环境中一条轨迹足够”只意味着重复相同起点和策略会得到相同回报，不意味着轨迹可以很短。若 episode 被过早截断，远处奖励仍无法传播到起始状态。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.5 Episode 长度与稀疏奖励&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-5-4-episode-length-effects.png&quot; alt=&quot;Figure 5.4：不同 episode 长度的 MC Basic 结果&quot; /&gt;&lt;/p&gt;
&lt;p&gt;图 5.4 使用 5 x 5 网格说明：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;长度为 1 至 4 时，只有目标附近能看到正回报，远处状态的估计大多仍为 $0$；&lt;/li&gt;
&lt;li&gt;长度为 14 时，左下角起点还不能到达目标；&lt;/li&gt;
&lt;li&gt;长度达到 15 后，所有状态至少有机会在 episode 内到达目标，策略开始正确；&lt;/li&gt;
&lt;li&gt;长度为 30 时，策略已经最优，但价值估计仍未完全收敛；&lt;/li&gt;
&lt;li&gt;长度为 100 时，状态价值更接近真实最优值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这揭示两个不同要求：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;正确改进策略&lt;/strong&gt;只需要各动作价值的相对次序足够可靠；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;准确估计价值&lt;/strong&gt;要求回报尾部的影响也被充分包含。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;若奖励稀疏，短 episode 中大量轨迹都只得到 $0$，学习信号无法传播到远处。可行思路包括延长 episode，或在不改变任务本质的前提下设计更密集的奖励信号。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 截断回报的偏差
把固定长度 $T$ 之后的奖励直接视为零，得到的是截断回报。除非尾部奖励确实为零或其折扣影响可忽略，否则它与无限时域的真实回报不同。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;3. MC Exploring Starts：更充分地利用 episode&lt;/h2&gt;
&lt;h3&gt;3.1 一条 episode 中有许多“访问”&lt;/h3&gt;
&lt;p&gt;考虑：&lt;/p&gt;
&lt;p&gt;$$
s_1
\xrightarrow{a_2}
s_2
\xrightarrow{a_4}
s_1
\xrightarrow{a_2}
s_2
\xrightarrow{a_3}
s_5
\xrightarrow{a_1}
\cdots
\tag{5.3}
$$&lt;/p&gt;
&lt;p&gt;每次出现 $(S_t,A_t)=(s,a)$，称为状态动作对 $(s,a)$ 的一次 visit。从任一次访问开始，剩余轨迹都构成一条子 episode，并给出一个回报样本：&lt;/p&gt;
&lt;p&gt;$$
G_t
=R_{t+1}+\gamma R_{t+2}+\cdots.
$$&lt;/p&gt;
&lt;p&gt;因此一条完整 episode 不只提供一个样本，而能为其中访问过的多个状态动作对提供样本。&lt;/p&gt;
&lt;h3&gt;3.2 Initial-visit、first-visit 与 every-visit&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;策略&lt;/th&gt;
&lt;th&gt;一条 episode 中用于更新的访问&lt;/th&gt;
&lt;th&gt;优点&lt;/th&gt;
&lt;th&gt;代价或注意点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Initial-visit&lt;/td&gt;
&lt;td&gt;只使用初始 $(S_0,A_0)$&lt;/td&gt;
&lt;td&gt;概念最简单，对应 MC Basic&lt;/td&gt;
&lt;td&gt;大量中间经验被丢弃&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;First-visit&lt;/td&gt;
&lt;td&gt;每个 $(s,a)$ 只使用首次访问后的回报&lt;/td&gt;
&lt;td&gt;同一 episode 内每对最多一个样本&lt;/td&gt;
&lt;td&gt;忽略后续重复访问&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Every-visit&lt;/td&gt;
&lt;td&gt;每次访问 $(s,a)$ 都使用对应回报&lt;/td&gt;
&lt;td&gt;样本利用率最高&lt;/td&gt;
&lt;td&gt;同一 episode 的多个回报相关&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;式 (5.3) 中 $(s_1,a_2)$ 出现两次：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;first-visit 只使用第一次出现后的回报；&lt;/li&gt;
&lt;li&gt;every-visit 使用两次出现后的两个回报；&lt;/li&gt;
&lt;li&gt;initial-visit 仅当它恰好是起始状态动作对时才使用。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] Every-visit 的样本并非独立
同一 episode 中较晚回报的奖励序列是较早回报的一部分，因此多个回报相关。访问间隔越远，相关性通常越弱。教材仍采用 every-visit，因为它能最大限度复用经验，但不能把这些回报简单当作严格 i.i.d. 样本。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.3 从批量更新变为逐 episode 更新&lt;/h3&gt;
&lt;p&gt;MC Basic 的策略是：&lt;/p&gt;
&lt;p&gt;$$
\text{收集许多 episode}
\rightarrow
\text{求均值}
\rightarrow
\text{改进策略}.
$$&lt;/p&gt;
&lt;p&gt;MC Exploring Starts 则可在每条 episode 结束后：&lt;/p&gt;
&lt;p&gt;$$
\text{更新所有访问过的 }q(s,a)
\rightarrow
\text{立即改进相关状态的策略}.
$$&lt;/p&gt;
&lt;p&gt;这种更新得到的价值暂时不精确，但广义策略迭代允许评价与改进交错进行。新策略又会改变以后收集的数据，从而形成持续反馈。&lt;/p&gt;
&lt;h3&gt;3.4 Algorithm 5.2 - MC Exploring Starts&lt;/h3&gt;
&lt;p&gt;初始化：&lt;/p&gt;
&lt;p&gt;$$
\pi_0(a\mid s),\qquad
q(s,a),\qquad
\operatorname{Returns}(s,a)=0,\qquad
\operatorname{Num}(s,a)=0.
$$&lt;/p&gt;
&lt;p&gt;对每条 episode：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;选择起始状态动作对 $(S_0,A_0)$，并保证所有 $(s,a)$ 都有可能被选为起点。这就是 &lt;strong&gt;exploring starts&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;先执行 $A_0$，之后遵循当前策略，生成长度为 $T$ 的 episode：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
S_0,A_0,R_1,S_1,A_1,\ldots,S_{T-1},A_{T-1},R_T.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;令 $g\leftarrow 0$，从 $t=T-1$ 反向遍历到 $0$：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
g\leftarrow \gamma g+R_{t+1}.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;对每次访问的 $(S_t,A_t)$ 累积回报并计数：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
\operatorname{Returns}(S_t,A_t)
\leftarrow
\operatorname{Returns}(S_t,A_t)+g,
$$&lt;/p&gt;
&lt;p&gt;$$
\operatorname{Num}(S_t,A_t)
\leftarrow
\operatorname{Num}(S_t,A_t)+1.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;更新动作价值：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
q(S_t,A_t)
\leftarrow
\frac{
\operatorname{Returns}(S_t,A_t)
}{
\operatorname{Num}(S_t,A_t)
}.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;对当前状态作贪心改进：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
a^*(S_t)
\in
\arg\max_{a\in\mathcal A(S_t)}q(S_t,a),
$$&lt;/p&gt;
&lt;h1&gt;$$
\pi(a\mid S_t)&lt;/h1&gt;
&lt;p&gt;\begin{cases}
1, &amp;amp; a=a^&lt;em&gt;(S_t),\
0, &amp;amp; a\ne a^&lt;/em&gt;(S_t).
\end{cases}
$$&lt;/p&gt;
&lt;p&gt;教材算法采用 every-visit；若只在每个状态动作对首次出现时执行步骤 4 至 6，就得到 first-visit 版本。&lt;/p&gt;
&lt;h3&gt;3.5 为什么反向计算回报&lt;/h3&gt;
&lt;p&gt;直接为每个 $t$ 重新求和需要重复计算。利用递推：&lt;/p&gt;
&lt;p&gt;$$
G_t=R_{t+1}+\gamma G_{t+1},
$$&lt;/p&gt;
&lt;p&gt;一次从后向前扫描即可得到全部回报，计算量与 episode 长度 $T$ 成正比。&lt;/p&gt;
&lt;h3&gt;3.6 Exploring starts 的意义与局限&lt;/h3&gt;
&lt;p&gt;Exploring starts 要求每个状态动作对都能作为起点被充分多次选择。它保证：&lt;/p&gt;
&lt;p&gt;$$
\forall(s,a),\quad
\operatorname{Num}(s,a)\rightarrow\infty
$$&lt;/p&gt;
&lt;p&gt;在理论上使每个动作都得到充分评价，否则未探索动作可能被永久低估，贪心改进也就可能遗漏真正的最优动作。&lt;/p&gt;
&lt;p&gt;局限在于很多现实系统无法任意重置到指定状态，更无法强迫起始时执行任意动作。因此需要一种不依赖特殊起点、却仍能覆盖各种动作的策略。&lt;/p&gt;
&lt;h2&gt;4. MC $\epsilon$-Greedy：不依赖 exploring starts&lt;/h2&gt;
&lt;h3&gt;4.1 Soft policy&lt;/h3&gt;
&lt;p&gt;若策略在每个状态下给每个可行动作正概率，则称它为 soft policy：&lt;/p&gt;
&lt;p&gt;$$
\pi(a\mid s)&amp;gt;0,
\qquad
\forall s,\ \forall a\in\mathcal A(s).
$$&lt;/p&gt;
&lt;p&gt;Soft policy 生成足够长的 episode 时，可以在轨迹中访问大量状态动作对，从而把探索任务从“指定特殊起点”转移到“全过程随机选动作”。&lt;/p&gt;
&lt;h3&gt;4.2 $\epsilon$-greedy 的精确定义&lt;/h3&gt;
&lt;p&gt;设&lt;/p&gt;
&lt;p&gt;$$
a^*(s)\in\arg\max_{a\in\mathcal A(s)}q(s,a).
$$&lt;/p&gt;
&lt;p&gt;在状态 $s$ 有 $\lvert\mathcal A(s)\rvert$ 个动作时：&lt;/p&gt;
&lt;h1&gt;$$
\pi_\epsilon(a\mid s)&lt;/h1&gt;
&lt;p&gt;\begin{cases}
1-\epsilon+\dfrac{\epsilon}{\lvert\mathcal A(s)\rvert},
&amp;amp; a=a^&lt;em&gt;(s),\
\dfrac{\epsilon}{\lvert\mathcal A(s)\rvert},
&amp;amp; a\ne a^&lt;/em&gt;(s).
\end{cases}
$$&lt;/p&gt;
&lt;p&gt;等价地，贪心动作的概率为：&lt;/p&gt;
&lt;h1&gt;$$
1-
\frac{\epsilon}{\lvert\mathcal A(s)\rvert}
\left(\lvert\mathcal A(s)\rvert-1\right)&lt;/h1&gt;
&lt;p&gt;1-\epsilon+\frac{\epsilon}{\lvert\mathcal A(s)\rvert}.
$$&lt;/p&gt;
&lt;p&gt;实现时可这样采样：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;以概率 $1-\epsilon$ 选择贪心动作；&lt;/li&gt;
&lt;li&gt;以概率 $\epsilon$ 在所有动作中均匀随机选择。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;注意第二步也可能再次选到贪心动作，所以贪心动作总概率不是 $1-\epsilon$，而是
$1-\epsilon+\epsilon/\lvert\mathcal A(s)\rvert$。&lt;/p&gt;
&lt;p&gt;边界情况：&lt;/p&gt;
&lt;p&gt;$$
\epsilon=0
\Rightarrow
\text{纯贪心策略},
$$&lt;/p&gt;
&lt;p&gt;$$
\epsilon=1
\Rightarrow
\text{所有动作均匀随机}.
$$&lt;/p&gt;
&lt;h3&gt;4.3 策略改进的搜索空间发生了变化&lt;/h3&gt;
&lt;p&gt;在全部策略集合 $\Pi$ 中改进：&lt;/p&gt;
&lt;p&gt;$$
\pi_{k+1}
\in
\arg\max_{\pi\in\Pi}
\sum_{a\in\mathcal A(s)}
\pi(a\mid s)q_k(s,a).
\tag{5.4}
$$&lt;/p&gt;
&lt;p&gt;最优解是把全部概率放在贪心动作上的确定性策略。&lt;/p&gt;
&lt;p&gt;MC $\epsilon$-Greedy 则把搜索限制在同一 $\epsilon$ 的 $\epsilon$-greedy 策略集合 $\Pi_\epsilon$：&lt;/p&gt;
&lt;p&gt;$$
\pi_{k+1}
\in
\arg\max_{\pi\in\Pi_\epsilon}
\sum_{a\in\mathcal A(s)}
\pi(a\mid s)q_k(s,a).
\tag{5.5}
$$&lt;/p&gt;
&lt;p&gt;所得策略在 $\Pi_\epsilon$ 中最优，但当 $\epsilon&amp;gt;0$ 时，一般不等于整个 $\Pi$ 中的最优策略。&lt;/p&gt;
&lt;h3&gt;4.4 Algorithm 5.3 - MC $\epsilon$-Greedy&lt;/h3&gt;
&lt;p&gt;初始化：&lt;/p&gt;
&lt;p&gt;$$
\pi_0(a\mid s),\qquad
q(s,a),\qquad
\operatorname{Returns}(s,a)=0,\qquad
\operatorname{Num}(s,a)=0,
$$&lt;/p&gt;
&lt;p&gt;并选择：&lt;/p&gt;
&lt;p&gt;$$
\epsilon\in(0,1].
$$&lt;/p&gt;
&lt;p&gt;每条 episode：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从普通允许的起点开始，不要求 exploring starts；&lt;/li&gt;
&lt;li&gt;按当前 $\epsilon$-greedy 策略生成完整 episode；&lt;/li&gt;
&lt;li&gt;反向计算 $g\leftarrow\gamma g+R_{t+1}$；&lt;/li&gt;
&lt;li&gt;用 every-visit 规则累加回报、计数并更新 $q(S_t,A_t)$；&lt;/li&gt;
&lt;li&gt;对每个访问状态，把策略更新成关于最新 $q$ 的 $\epsilon$-greedy 策略。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;策略更新写成：&lt;/p&gt;
&lt;h1&gt;$$
\pi(a\mid S_t)&lt;/h1&gt;
&lt;p&gt;\begin{cases}
1-\epsilon+\dfrac{\epsilon}{\lvert\mathcal A(S_t)\rvert},
&amp;amp; a\in\arg\max_b q(S_t,b),\
\dfrac{\epsilon}{\lvert\mathcal A(S_t)\rvert},
&amp;amp; \text{其他动作}.
\end{cases}
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 并列贪心动作
教材伪代码可通过固定规则选一个 $\arg\max$ 动作。若希望在多个并列最大动作之间均分“利用”概率，也可以定义相应策略，但必须在实现和分析中保持一致。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.5 示例：两轮得到最优 $\epsilon$-greedy 策略&lt;/h3&gt;
&lt;p&gt;实验使用 5 x 5 网格：&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}
=r_{\text{forbidden}}
=-1,
\qquad
r_{\text{target}}=1,
\qquad
\gamma=0.9.
$$&lt;/p&gt;
&lt;p&gt;初始策略在五个动作上均为 $0.2$，取 $\epsilon=0.5$。每轮只生成一条长度为一百万步的 episode，并利用 every-visit 更新所有访问。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-5-5-mc-epsilon-greedy-evolution.png&quot; alt=&quot;Figure 5.5：MC epsilon-Greedy 的策略演化&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 初始策略完全随机；第一轮后已明显朝高价值区域偏移；第二轮后得到 $\Pi_{0.5}$ 中的最优策略。这个结果说明，一条足够长且探索性强的 episode 可以反复访问大量状态动作对。&lt;/p&gt;
&lt;h2&gt;5. 探索与利用&lt;/h2&gt;
&lt;h3&gt;5.1 两个目标为何冲突&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;探索（exploration）&lt;/strong&gt;：尝试更多动作，发现当前估计遗漏的高价值选择；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;利用（exploitation）&lt;/strong&gt;：选择当前估计中价值最高的动作，获得已知收益。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;若只利用，早期估计误差可能使策略永久锁定在次优动作；若只探索，策略又不会稳定执行已知好动作。$\epsilon$ 是两者之间的控制旋钮：&lt;/p&gt;
&lt;p&gt;$$
\epsilon\uparrow
\Rightarrow
\text{探索增强、利用减弱},
$$&lt;/p&gt;
&lt;p&gt;$$
\epsilon\downarrow
\Rightarrow
\text{利用增强、探索减弱}.
$$&lt;/p&gt;
&lt;h3&gt;5.2 固定贪心方向时，增大 $\epsilon$ 会降低价值&lt;/h3&gt;
&lt;p&gt;图 5.6 的环境设置为：&lt;/p&gt;
&lt;p&gt;$$
r_{\text{boundary}}=-1,
\qquad
r_{\text{forbidden}}=-10,
\qquad
r_{\text{target}}=1,
\qquad
\gamma=0.9.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-5-6-consistent-epsilon-greedy-values.png&quot; alt=&quot;Figure 5.6：一致的 epsilon-Greedy 策略及其价值&quot; /&gt;&lt;/p&gt;
&lt;p&gt;这里不同 $\epsilon$ 下的策略是 &lt;strong&gt;consistent&lt;/strong&gt; 的：每个状态中概率最大的动作相同。随着
$\epsilon$ 从 $0$ 增加到 $0.1,0.2,0.5$：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;随机动作概率增加；&lt;/li&gt;
&lt;li&gt;进入禁区并获得 $-10$ 的概率增加；&lt;/li&gt;
&lt;li&gt;全局状态价值下降；&lt;/li&gt;
&lt;li&gt;当 $\epsilon=0.5$ 时，连目标状态价值也变为最小，因为留在目标附近时很容易随机走入周围禁区。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以即使“主要方向”不变，更多随机动作也会损害期望回报。&lt;/p&gt;
&lt;h3&gt;5.3 最优 $\epsilon$-greedy 策略也可能改变贪心方向&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-5-7-optimal-epsilon-greedy-policies.png&quot; alt=&quot;Figure 5.7：不同 epsilon 下的最优 epsilon-Greedy 策略&quot; /&gt;&lt;/p&gt;
&lt;p&gt;图中每个策略都在其对应的 $\Pi_\epsilon$ 中最优：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\epsilon=0$ 时得到全体策略中的贪心最优策略；&lt;/li&gt;
&lt;li&gt;$\epsilon=0.1$ 时，最优 $\epsilon$-greedy 策略仍与贪心最优策略一致；&lt;/li&gt;
&lt;li&gt;$\epsilon=0.2$ 或 $0.5$ 时，部分状态的最大概率动作发生变化。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;原因可由目标状态理解。纯贪心时，停留在目标状态可持续获得正奖励；当 $\epsilon$ 较大时，即使主要动作是停留，也有较高概率随机进入周围禁区。此时在受限策略集合中，“逃离高风险区域”可能比“以最高概率停留”有更高期望回报。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 两种“最优”要区分
$\pi_\epsilon^&lt;em&gt;$ 表示在固定 $\epsilon$ 的策略集合 $\Pi_\epsilon$ 中最优，不保证等于全体策略集合 $\Pi$ 中的 $\pi^&lt;/em&gt;$。$\epsilon$ 越大，这两个最优概念的差异可能越明显。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.4 $\epsilon$ 对访问覆盖的影响&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-5-8-exploration-ability.png&quot; alt=&quot;Figure 5.8：不同 epsilon 的探索能力&quot; /&gt;&lt;/p&gt;
&lt;p&gt;图 5.8 比较 $\epsilon=1$ 与 $\epsilon=0.5$：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;当 $\epsilon=1$&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;五个动作在每个状态都以 $0.2$ 概率选择；&lt;/li&gt;
&lt;li&gt;100 步轨迹已覆盖不少区域；&lt;/li&gt;
&lt;li&gt;1,000 和 10,000 步后轨迹广泛覆盖网格；&lt;/li&gt;
&lt;li&gt;一百万步中各状态动作对的访问次数约为 $8,000$，分布相对均匀。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;当 $\epsilon=0.5$&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;足够长的轨迹仍有机会访问所有动作；&lt;/li&gt;
&lt;li&gt;但访问分布极不均衡；&lt;/li&gt;
&lt;li&gt;一百万步中，少数动作访问超过 $250,000$ 次，多数动作只有数百甚至数十次。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此“每个动作概率都大于零”只保证长期可探索，不保证有限样本内均匀探索。实际常用策略是：&lt;/p&gt;
&lt;p&gt;$$
\text{训练初期使用较大 }\epsilon
\quad\longrightarrow\quad
\text{随后逐渐减小 }\epsilon.
$$&lt;/p&gt;
&lt;p&gt;早期优先收集覆盖面广的数据，后期提高利用和最终策略的近似最优性。&lt;/p&gt;
&lt;h2&gt;6. 三种 MC 算法的关系&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;维度&lt;/th&gt;
&lt;th&gt;MC Basic&lt;/th&gt;
&lt;th&gt;MC Exploring Starts&lt;/th&gt;
&lt;th&gt;MC $\epsilon$-Greedy&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;策略评价依据&lt;/td&gt;
&lt;td&gt;完整回报均值&lt;/td&gt;
&lt;td&gt;完整回报均值&lt;/td&gt;
&lt;td&gt;完整回报均值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;一条 episode 的利用&lt;/td&gt;
&lt;td&gt;仅初始对&lt;/td&gt;
&lt;td&gt;first-visit 或 every-visit&lt;/td&gt;
&lt;td&gt;通常 every-visit&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;策略改进&lt;/td&gt;
&lt;td&gt;贪心&lt;/td&gt;
&lt;td&gt;贪心&lt;/td&gt;
&lt;td&gt;在 $\Pi_\epsilon$ 中改进&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;探索保证&lt;/td&gt;
&lt;td&gt;每对作为起点&lt;/td&gt;
&lt;td&gt;exploring starts&lt;/td&gt;
&lt;td&gt;soft policy 持续随机探索&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;特殊起点要求&lt;/td&gt;
&lt;td&gt;强&lt;/td&gt;
&lt;td&gt;强&lt;/td&gt;
&lt;td&gt;无&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;主要优点&lt;/td&gt;
&lt;td&gt;揭示核心思想&lt;/td&gt;
&lt;td&gt;样本利用率更高&lt;/td&gt;
&lt;td&gt;更贴近无法任意重置的环境&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;主要局限&lt;/td&gt;
&lt;td&gt;样本浪费&lt;/td&gt;
&lt;td&gt;起点条件难满足&lt;/td&gt;
&lt;td&gt;固定 $\epsilon&amp;gt;0$ 会牺牲全局最优性&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;演化关系：&lt;/p&gt;
&lt;p&gt;$$
\text{MC Basic}
\xrightarrow{\text{复用中间访问}}
\text{MC Exploring Starts}
\xrightarrow{\text{soft policy 代替特殊起点}}
\text{MC }\epsilon\text{-Greedy}.
$$&lt;/p&gt;
&lt;p&gt;三者都属于 on-policy 控制思想：用于生成数据的当前策略，也是正在被评价和改进的策略。&lt;/p&gt;
&lt;h2&gt;7. 本章总结&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Monte Carlo 估计用随机样本均值近似期望。&lt;/li&gt;
&lt;li&gt;状态价值和动作价值是回报的条件期望，因此可用 episode 回报直接估计。&lt;/li&gt;
&lt;li&gt;MC Basic 把模型式策略评价换成回报样本均值，是最直接的无模型策略迭代。&lt;/li&gt;
&lt;li&gt;First-visit 和 every-visit 让一条 episode 为多个状态动作对提供训练样本。&lt;/li&gt;
&lt;li&gt;MC Exploring Starts 通过充分覆盖所有起始状态动作对支持贪心控制，但该条件在现实中常难满足。&lt;/li&gt;
&lt;li&gt;MC $\epsilon$-Greedy 用 soft policy 在轨迹内部持续探索，取消 exploring starts 条件。&lt;/li&gt;
&lt;li&gt;固定 $\epsilon&amp;gt;0$ 时，算法寻找的是 $\Pi_\epsilon$ 中的最优策略，而非必然是全体策略中的最优策略。&lt;/li&gt;
&lt;li&gt;$\epsilon$ 越大，探索越强但利用与策略价值通常越弱；逐渐衰减 $\epsilon$ 是常见折中。&lt;/li&gt;
&lt;li&gt;MC 必须等到 episode 结束才能获得完整回报，并可能受长 episode、稀疏奖励与高方差影响。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;8. 教材 Q&amp;amp;A&lt;/h2&gt;
&lt;h3&gt;Q1. 什么是 Monte Carlo 估计？&lt;/h3&gt;
&lt;p&gt;Monte Carlo 估计是一大类使用随机样本解决近似计算问题的方法。本章具体使用样本回报的平均值估计价值函数。&lt;/p&gt;
&lt;h3&gt;Q2. 什么是均值估计问题？&lt;/h3&gt;
&lt;p&gt;均值估计是根据随机样本计算或近似随机变量期望的问题。&lt;/p&gt;
&lt;h3&gt;Q3. 如何解决均值估计问题？&lt;/h3&gt;
&lt;p&gt;有两条路线：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;已知概率分布时，按期望定义直接计算；&lt;/li&gt;
&lt;li&gt;概率分布未知时，用 Monte Carlo 样本均值近似，样本充分多时估计更准确。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;Q4. 为什么均值估计对强化学习重要？&lt;/h3&gt;
&lt;p&gt;因为状态价值与动作价值都是回报的期望。估计价值函数，本质上就是估计随机回报的条件均值。&lt;/p&gt;
&lt;h3&gt;Q5. 无模型 MC 强化学习的核心思想是什么？&lt;/h3&gt;
&lt;p&gt;把策略迭代改造成无模型形式：用 MC 样本评价替代基于环境模型的策略评价，策略改进结构保持不变。&lt;/p&gt;
&lt;h3&gt;Q6. Initial-visit、first-visit 和 every-visit 是什么？&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;initial-visit 只用初始状态动作对的整条 episode 回报；&lt;/li&gt;
&lt;li&gt;first-visit 对每个状态动作对只用本 episode 中首次访问后的回报；&lt;/li&gt;
&lt;li&gt;every-visit 对每次访问都使用对应的后续回报。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;后两者比 initial-visit 更充分利用一条 episode。&lt;/p&gt;
&lt;h3&gt;Q7. 什么是 exploring starts？为什么重要？&lt;/h3&gt;
&lt;p&gt;Exploring starts 要求每个状态动作对都能作为大量 episode 的起点。只有充分探索每个动作，动作价值比较才可靠，策略改进才不容易遗漏最优动作。&lt;/p&gt;
&lt;h3&gt;Q8. 如何避免 exploring starts？&lt;/h3&gt;
&lt;p&gt;让策略保持 soft，例如采用 $\epsilon$-greedy。这样一条足够长的 episode 就可能访问许多状态动作对，无需为每一对单独构造大量起始轨迹。&lt;/p&gt;
&lt;h3&gt;Q9. $\epsilon$-greedy 策略可以是最优的吗？&lt;/h3&gt;
&lt;p&gt;答案取决于“最优”的范围：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;可以在固定 $\epsilon$ 的集合 $\Pi_\epsilon$ 中最优；&lt;/li&gt;
&lt;li&gt;当 $\epsilon&amp;gt;0$ 时，一般不能保证在全部策略集合 $\Pi$ 中最优。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;Q10. 一条 episode 可以访问所有状态动作对吗？&lt;/h3&gt;
&lt;p&gt;可以。若策略是 soft 的且 episode 足够长，一条轨迹可能访问所有状态动作对；但有限样本中的访问频次可能非常不均匀。&lt;/p&gt;
&lt;h3&gt;Q11. MC Basic、MC Exploring Starts 与 MC $\epsilon$-Greedy 的关系是什么？&lt;/h3&gt;
&lt;p&gt;MC Basic 展示“样本回报替代模型评价”的核心；MC Exploring Starts 改进一条 episode 的样本利用方式；MC $\epsilon$-Greedy 再以 soft policy 去除 exploring starts 的现实限制。复杂性来自性能和可实施性要求，而不是 MC 核心思想本身。&lt;/p&gt;
&lt;h2&gt;9. 一页式复习&lt;/h2&gt;
&lt;h3&gt;9.1 最小知识链&lt;/h3&gt;
&lt;p&gt;$$
q_\pi(s,a)
=\mathbb E_\pi[G_t\mid S_t=s,A_t=a]
\approx
\frac{1}{N(s,a)}
\sum_{i=1}^{N(s,a)}G^{(i)}(s,a).
$$&lt;/p&gt;
&lt;p&gt;$$
G_t=R_{t+1}+\gamma G_{t+1}.
$$&lt;/p&gt;
&lt;p&gt;$$
\text{估计 }q
\rightarrow
\text{对 }q\text{ 贪心或 }\epsilon\text{-greedy 改进}
\rightarrow
\text{产生新数据}
\rightarrow
\text{继续估计}.
$$&lt;/p&gt;
&lt;h3&gt;9.2 做题时的识别信号&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;题目说“未知转移概率，但有完整 episode”：“MC 估计”。&lt;/li&gt;
&lt;li&gt;问为什么估计 $q$ 而不是只估计 $v$：“无模型策略改进要直接比较动作”。&lt;/li&gt;
&lt;li&gt;一条轨迹中状态动作对重复出现：“区分 first-visit 与 every-visit”。&lt;/li&gt;
&lt;li&gt;能任意指定起始状态动作对：“exploring starts”。&lt;/li&gt;
&lt;li&gt;不能任意指定起点但要持续探索：“soft 或 $\epsilon$-greedy”。&lt;/li&gt;
&lt;li&gt;问贪心动作实际概率：“$1-\epsilon+\epsilon/\lvert\mathcal A(s)\rvert$”。&lt;/li&gt;
&lt;li&gt;问固定 $\epsilon$ 下收敛到哪里：“$\Pi_\epsilon$ 中的最优策略”。&lt;/li&gt;
&lt;li&gt;问短轨迹为何失败：“尾部回报丢失，稀疏奖励无法传播”。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;9.3 三个最容易混淆的区别&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;完整回报与即时奖励&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
G_t
=R_{t+1}+\gamma R_{t+2}+\cdots
\ne R_{t+1}.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;贪心动作概率与利用分支概率&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
\Pr(\text{greedy action})
=1-\epsilon+\frac{\epsilon}{\lvert\mathcal A(s)\rvert}
\ne 1-\epsilon.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;受限最优与全局最优&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
\pi_\epsilon^*
\in\arg\max_{\pi\in\Pi_\epsilon}v_\pi
\quad\not\Rightarrow\quad
\pi_\epsilon^*
\in\arg\max_{\pi\in\Pi}v_\pi.
$$&lt;/p&gt;
&lt;h2&gt;10. 公式清单&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;样本均值&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
\bar x_n=\frac{1}{n}\sum_{i=1}^{n}x_i.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;样本均值的期望与方差&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\bar x_n]=\mathbb E[X],
\qquad
\operatorname{Var}(\bar x_n)
=\frac{1}{n}\operatorname{Var}(X).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;动作价值的 MC 估计&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s,a)
\approx
\frac{1}{N(s,a)}
\sum_{i=1}^{N(s,a)}
G^{(i)}(s,a).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;回报反向递推&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
G_t=R_{t+1}+\gamma G_{t+1}.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;贪心策略改进&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
\pi(s)\in\arg\max_{a\in\mathcal A(s)}q(s,a).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;$\epsilon$-greedy&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;$$
\pi_\epsilon(a\mid s)&lt;/h1&gt;
&lt;p&gt;\begin{cases}
1-\epsilon+\dfrac{\epsilon}{\lvert\mathcal A(s)\rvert},
&amp;amp; a=a^&lt;em&gt;(s),\
\dfrac{\epsilon}{\lvert\mathcal A(s)\rvert},
&amp;amp; a\ne a^&lt;/em&gt;(s).
\end{cases}
$$&lt;/p&gt;
&lt;h2&gt;11. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$X$&lt;/td&gt;
&lt;td&gt;随机变量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$x_i$&lt;/td&gt;
&lt;td&gt;第 $i$ 个随机样本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\bar x_n$&lt;/td&gt;
&lt;td&gt;前 $n$ 个样本的均值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$S_t,A_t,R_{t+1}$&lt;/td&gt;
&lt;td&gt;时刻 $t$ 的状态、动作与下一奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$G_t$&lt;/td&gt;
&lt;td&gt;从时刻 $t$ 开始的折扣回报&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi(s)$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 下的状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi(s,a)$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 下的动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\operatorname{Returns}(s,a)$&lt;/td&gt;
&lt;td&gt;已收集的 $(s,a)$ 回报总和&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\operatorname{Num}(s,a)$&lt;/td&gt;
&lt;td&gt;$(s,a)$ 的有效访问计数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\gamma$&lt;/td&gt;
&lt;td&gt;折扣率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\epsilon$&lt;/td&gt;
&lt;td&gt;随机探索强度&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Pi$&lt;/td&gt;
&lt;td&gt;全部策略的集合&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Pi_\epsilon$&lt;/td&gt;
&lt;td&gt;固定 $\epsilon$ 的 $\epsilon$-greedy 策略集合&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathcal A(s)$&lt;/td&gt;
&lt;td&gt;状态 $s$ 的可行动作集合&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;12. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文&lt;/th&gt;
&lt;th&gt;中文&lt;/th&gt;
&lt;th&gt;核心含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Monte Carlo estimation&lt;/td&gt;
&lt;td&gt;蒙特卡洛估计&lt;/td&gt;
&lt;td&gt;用随机样本近似期望或其他量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;model-free&lt;/td&gt;
&lt;td&gt;无模型&lt;/td&gt;
&lt;td&gt;不需要已知或显式估计环境转移与奖励模型&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;episode&lt;/td&gt;
&lt;td&gt;回合、轨迹&lt;/td&gt;
&lt;td&gt;从起点到终止或规定截断点的交互序列&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;return&lt;/td&gt;
&lt;td&gt;回报&lt;/td&gt;
&lt;td&gt;未来奖励的折扣和&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;initial-visit&lt;/td&gt;
&lt;td&gt;初始访问&lt;/td&gt;
&lt;td&gt;只利用 episode 初始状态动作对&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;first-visit&lt;/td&gt;
&lt;td&gt;首次访问&lt;/td&gt;
&lt;td&gt;每个状态动作对在一条 episode 中只计第一次&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;every-visit&lt;/td&gt;
&lt;td&gt;每次访问&lt;/td&gt;
&lt;td&gt;每次出现状态动作对都计入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;exploring starts&lt;/td&gt;
&lt;td&gt;探索性起点&lt;/td&gt;
&lt;td&gt;所有状态动作对均可被充分选作 episode 起点&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;soft policy&lt;/td&gt;
&lt;td&gt;软策略&lt;/td&gt;
&lt;td&gt;每个可行动作都有正概率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\epsilon$-greedy&lt;/td&gt;
&lt;td&gt;$\epsilon$-贪心&lt;/td&gt;
&lt;td&gt;大概率利用贪心动作，小概率随机探索&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;exploration&lt;/td&gt;
&lt;td&gt;探索&lt;/td&gt;
&lt;td&gt;尝试未充分评价的动作&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;exploitation&lt;/td&gt;
&lt;td&gt;利用&lt;/td&gt;
&lt;td&gt;选择当前估计最优的动作&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;13. 常见误区&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 1：MC 必须知道环境模型
恰好相反，MC 的主要价值就是用样本回报替代对 $p(r\mid s,a)$ 和 $p(s&apos;\mid s,a)$ 的依赖。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 2：单个样本会趋近期望
单个样本仍服从原分布；趋近期望的是越来越多样本的平均值。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 3：一条 episode 只能更新一个状态动作对
这是 initial-visit 的低效用法。First-visit 和 every-visit 可更新轨迹中访问过的许多状态动作对。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 4：Every-visit 回报都是独立样本
同一轨迹内的回报共享后续奖励，通常相关。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 5：Episode 越短更新越快，因此一定更好
过短 episode 会漏掉重要尾部奖励，特别是在稀疏奖励任务中造成严重偏差。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 6：Exploring starts 就是随机选择普通初始状态
它要求所有状态动作对都能作为起点被充分覆盖，比普通随机初始状态更强。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 7：$\epsilon$-greedy 中贪心动作概率是 $1-\epsilon$
随机分支也可能选到贪心动作，总概率是 $1-\epsilon+\epsilon/\lvert\mathcal A(s)\rvert$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 8：固定 $\epsilon&amp;gt;0$ 仍保证全局最优
算法保证的对象是受限集合 $\Pi_\epsilon$ 中的最优策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 9：Soft policy 会在有限时间均匀访问所有动作
Soft 只给每个动作正概率。有限轨迹的访问次数可能极不均匀，如图 5.8 所示。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 10：策略价值准确后才能做策略改进
广义策略迭代允许不完整评价与策略改进交替进行；动作排序足够可靠时就可能改进策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;14. 自测题&lt;/h2&gt;
&lt;h3&gt;14.1 概念题&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;1. MC 方法为什么是 model-free？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;因为它直接从与环境交互得到的完整回报估计动作价值，不需要环境的奖励分布和状态转移概率。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;2. 为什么策略控制更倾向直接估计动作价值？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;在未知模型时，若只有状态价值，就无法通过一步前瞻比较动作；已有 $q(s,a)$ 时，可直接选择使其最大的动作。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;3. First-visit 和 every-visit 的差别是什么？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;First-visit 对每个状态动作对每条 episode 只取第一次访问后的回报；every-visit 对每次访问都取对应回报。后者复用更多数据，但同一 episode 内样本相关。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;4. 为什么 exploring starts 难以用于真实系统？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;真实系统通常不能任意重置到所有状态，也不能任意强制起始动作，因此无法保证所有状态动作对都被大量选作起点。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;5. 固定 epsilon 的 MC epsilon-Greedy 最终优化什么？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;它优化固定 $\epsilon$ 的策略集合 $\Pi_\epsilon$，即寻找该受限集合中的最优 $\epsilon$-greedy 策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;14.2 计算题&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;6. 某状态有 5 个动作，epsilon=0.2。贪心与非贪心动作各自概率是多少？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;贪心动作：&lt;/p&gt;
&lt;p&gt;$$
1-0.2+\frac{0.2}{5}=0.84.
$$&lt;/p&gt;
&lt;p&gt;每个非贪心动作：&lt;/p&gt;
&lt;p&gt;$$
\frac{0.2}{5}=0.04.
$$&lt;/p&gt;
&lt;p&gt;总和为 $0.84+4\times0.04=1$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;7. 已知轨迹末端奖励依次为 2、-1、3，gamma=0.5，反向计算三个回报。&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;从末端开始：&lt;/p&gt;
&lt;p&gt;$$
G_2=3,
$$&lt;/p&gt;
&lt;p&gt;$$
G_1=-1+0.5\times3=0.5,
$$&lt;/p&gt;
&lt;p&gt;$$
G_0=2+0.5\times0.5=2.25.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;8. 一个状态动作对已有 Returns=18、Num=6，新样本回报为 3，更新后的估计是多少？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
\operatorname{Returns}\leftarrow18+3=21,
$$&lt;/p&gt;
&lt;p&gt;$$
\operatorname{Num}\leftarrow6+1=7,
$$&lt;/p&gt;
&lt;p&gt;$$
q=\frac{21}{7}=3.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;14.3 思考题&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;9. 为什么策略可能已经最优，而价值估计仍不准确？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;策略改进只依赖各动作价值的相对排序。即使数值都有误差，只要最优动作仍排第一，贪心策略就可能已正确；准确价值则要求回报均值本身充分收敛。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;10. 为什么训练时常让 epsilon 逐渐衰减？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;较大的早期 $\epsilon$ 提高覆盖率，减少遗漏好动作的风险；较小的后期 $\epsilon$ 增强利用，使策略更接近全局贪心最优。若衰减过快，可能探索不足；若始终很大，则最终性能受随机动作拖累。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;11. 一条很长的 soft-policy episode 是否等价于 exploring starts？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;不完全等价。它可能访问所有状态动作对，但不能保证有限时间内访问均匀，也不保证每对都从 episode 起点出现。它通过轨迹内访问来替代特殊起点，实践上更可行，但覆盖质量仍取决于策略和环境可达性。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 6 - Stochastic Approximation</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-6-stochastic-approximation/chapter-6---stochastic-approximation/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-6-stochastic-approximation/chapter-6---stochastic-approximation/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 6 - Stochastic Approximation&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
Chapter 5 的 Monte Carlo 方法通常先收集完整数据，再进行非增量式计算；后续时序差分方法则会在样本到达时立刻更新。本章填补二者之间的知识缺口：从均值的增量估计出发，建立 Robbins-Monro 随机逼近、Dvoretzky 收敛定理和随机梯度下降。核心问题是：当函数未知、梯度只能通过带噪样本观测时，为什么一个简单的随机迭代仍能收敛？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识结构&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-6-1-book-roadmap.png&quot; alt=&quot;Figure 6.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; Chapter 6 位于非增量 Monte Carlo 方法与增量时序差分方法之间。它不直接给出新的强化学习算法，而是提供后续算法设计和收敛分析所依赖的数学工具。随机梯度下降（stochastic gradient descent, SGD）是 Robbins-Monro（RM）算法的特例，均值增量估计又是 SGD 的特例。&lt;/p&gt;
&lt;p&gt;逻辑主线：&lt;/p&gt;
&lt;p&gt;$$
\text{批量样本均值}
\longrightarrow
\text{增量均值更新}
\longrightarrow
\text{Robbins-Monro 求根}
\longrightarrow
\text{Dvoretzky 收敛定理}
\longrightarrow
\text{随机梯度下降}.
$$&lt;/p&gt;
&lt;p&gt;三个层次之间的包含关系：&lt;/p&gt;
&lt;p&gt;$$
\text{增量均值估计}
\subset
\text{SGD}
\subset
\text{Robbins-Monro 随机逼近}.
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 一句话总览
随机逼近用“逐渐减小但总作用量无限”的步长，把无偏且方差受控的观测噪声平均掉，同时持续推动估计量走向目标。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;1. 从非增量均值到增量均值&lt;/h2&gt;
&lt;h3&gt;1.1 非增量 Monte Carlo 均值&lt;/h3&gt;
&lt;p&gt;设随机变量 $X$ 在有限集合 $\mathcal X$ 上取值，目标是估计 $\mathbb E[X]$。给定
$n$ 个独立同分布样本 ${x_i}_{i=1}^n$：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[X]
\approx
\bar x
\doteq
\frac{1}{n}\sum_{i=1}^{n}x_i.
\tag{6.1}
$$&lt;/p&gt;
&lt;p&gt;大数定律保证：&lt;/p&gt;
&lt;p&gt;$$
\bar x\rightarrow\mathbb E[X]
\qquad (n\rightarrow\infty).
$$&lt;/p&gt;
&lt;p&gt;这种方法要先保存或等待所有样本，属于非增量（non-incremental）计算。&lt;/p&gt;
&lt;h3&gt;1.2 增量公式的推导&lt;/h3&gt;
&lt;p&gt;令前 $k$ 个样本的均值为：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
\doteq
\frac{1}{k}\sum_{i=1}^{k}x_i,
$$&lt;/p&gt;
&lt;p&gt;前 $k-1$ 个样本的均值为：&lt;/p&gt;
&lt;h1&gt;$$
w_k&lt;/h1&gt;
&lt;p&gt;\frac{1}{k-1}\sum_{i=1}^{k-1}x_i.
$$&lt;/p&gt;
&lt;p&gt;把旧样本和新样本拆开：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
w_{k+1}
&amp;amp;=\frac{1}{k}\sum_{i=1}^{k}x_i\
&amp;amp;=\frac{1}{k}
\left(
\sum_{i=1}^{k-1}x_i+x_k
\right)\
&amp;amp;=\frac{1}{k}\left((k-1)w_k+x_k\right)\
&amp;amp;=w_k-\frac{1}{k}(w_k-x_k).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;于是得到增量均值算法：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
=w_k-\frac{1}{k}(w_k-x_k).
\tag{6.2}
$$&lt;/p&gt;
&lt;p&gt;它只需要：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;当前估计 $w_k$；&lt;/li&gt;
&lt;li&gt;新样本 $x_k$；&lt;/li&gt;
&lt;li&gt;当前计数 $k$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;不需要重新扫描历史样本。&lt;/p&gt;
&lt;h3&gt;1.3 增量公式确实等价于样本均值&lt;/h3&gt;
&lt;p&gt;取 $w_1=x_1$，依次展开：&lt;/p&gt;
&lt;p&gt;$$
w_2=x_1,
$$&lt;/p&gt;
&lt;p&gt;$$
w_3
=w_2-\frac{1}{2}(w_2-x_2)
=\frac{1}{2}(x_1+x_2),
$$&lt;/p&gt;
&lt;p&gt;$$
w_4
=w_3-\frac{1}{3}(w_3-x_3)
=\frac{1}{3}(x_1+x_2+x_3).
$$&lt;/p&gt;
&lt;p&gt;一般地：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
=\frac{1}{k}\sum_{i=1}^{k}x_i.
\tag{6.3}
$$&lt;/p&gt;
&lt;p&gt;因此式 (6.2) 不是近似实现，而是式 (6.3) 的递推实现。&lt;/p&gt;
&lt;h3&gt;1.4 一般步长形式&lt;/h3&gt;
&lt;p&gt;把 $1/k$ 换成一般正步长 $\alpha_k$：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
=w_k-\alpha_k(w_k-x_k)
=w_k+\alpha_k(x_k-w_k).
\tag{6.4}
$$&lt;/p&gt;
&lt;p&gt;该式可以读成：&lt;/p&gt;
&lt;h1&gt;$$
\text{新估计}&lt;/h1&gt;
&lt;p&gt;\text{旧估计}
+
\text{步长}
\times
\text{样本误差}.
$$&lt;/p&gt;
&lt;p&gt;其中 $x_k-w_k$ 是新观测相对当前估计的误差。$\alpha_k$ 决定新样本能把估计拉动多远。&lt;/p&gt;
&lt;p&gt;当 $\alpha_k=1/k$ 时可恢复精确样本均值；一般 $\alpha_k$ 下通常没有类似式 (6.3) 的简单闭式，但在合适条件下仍可证明：&lt;/p&gt;
&lt;p&gt;$$
w_k\rightarrow\mathbb E[X].
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
增量并不等于近似得更差。式 (6.2) 与批量均值完全等价，只是计算组织方式不同。真正改变统计权重的是把 $1/k$ 换成其他 $\alpha_k$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;2. Robbins-Monro 随机逼近&lt;/h2&gt;
&lt;h3&gt;2.1 随机逼近解决什么问题&lt;/h3&gt;
&lt;p&gt;随机逼近（stochastic approximation）是一类用随机迭代求解根或优化问题的方法。考虑：&lt;/p&gt;
&lt;p&gt;$$
g(w)=0,
$$&lt;/p&gt;
&lt;p&gt;其中 $w\in\mathbb R$ 未知，$g:\mathbb R\rightarrow\mathbb R$。&lt;/p&gt;
&lt;p&gt;许多优化问题也能化为求根。若目标是最小化 $J(w)$，可令：&lt;/p&gt;
&lt;p&gt;$$
g(w)\doteq\nabla_w J(w),
$$&lt;/p&gt;
&lt;p&gt;再求：&lt;/p&gt;
&lt;p&gt;$$
g(w)=0.
$$&lt;/p&gt;
&lt;p&gt;困难在于本章假设：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;不知道 $g$ 的解析表达式；&lt;/li&gt;
&lt;li&gt;不知道 $g$ 的导数；&lt;/li&gt;
&lt;li&gt;对输入 $w$ 只能得到带噪输出。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;带噪观测为：&lt;/p&gt;
&lt;p&gt;$$
\widetilde g(w,\eta)
=g(w)+\eta,
$$&lt;/p&gt;
&lt;p&gt;其中 $\eta$ 是观测误差，不要求一定服从高斯分布。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-6-2-noisy-black-box.png&quot; alt=&quot;Figure 6.2：只能访问带噪黑箱输出的求根问题&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 输入 $w$ 经过未知黑箱 $g(w)$，再叠加噪声 $\eta$，最终只能观察
$\widetilde g(w,\eta)$。算法要仅凭输入和带噪输出找到 $g(w)=0$ 的根。&lt;/p&gt;
&lt;h3&gt;2.2 Robbins-Monro 更新&lt;/h3&gt;
&lt;p&gt;Robbins-Monro 算法为：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
=w_k-a_k\widetilde g(w_k,\eta_k),
\qquad
k=1,2,3,\ldots
\tag{6.5}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$w_k$：第 $k$ 次根估计；&lt;/li&gt;
&lt;li&gt;$\widetilde g(w_k,\eta_k)$：在 $w_k$ 处的第 $k$ 次带噪观测；&lt;/li&gt;
&lt;li&gt;$a_k&amp;gt;0$：步长。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;若 $g$ 在根 $w^*$ 附近单调递增：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;当 $w_k&amp;gt;w^*$ 时，$g(w_k)&amp;gt;0$，减去正数使 $w_{k+1}$ 向左移动；&lt;/li&gt;
&lt;li&gt;当 $w_k&amp;lt;w^*$ 时，$g(w_k)&amp;lt;0$，减去负数使 $w_{k+1}$ 向右移动。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;只要移动量不过大，两侧更新都会把估计推向根。&lt;/p&gt;
&lt;h3&gt;2.3 带噪求根示例&lt;/h3&gt;
&lt;p&gt;教材取：&lt;/p&gt;
&lt;p&gt;$$
g(w)=w^3-5,
\qquad
w^*=5^{1/3}\approx1.71.
$$&lt;/p&gt;
&lt;p&gt;观测：&lt;/p&gt;
&lt;p&gt;$$
\widetilde g(w)=g(w)+\eta,
\qquad
\eta\sim\mathcal N(0,1),
$$&lt;/p&gt;
&lt;p&gt;并设：&lt;/p&gt;
&lt;p&gt;$$
w_1=0,
\qquad
a_k=\frac{1}{k}.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-6-3-rm-noisy-convergence.png&quot; alt=&quot;Figure 6.3：带噪 Robbins-Monro 迭代&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 下图中的观测噪声持续剧烈波动，上图中的根估计仍逐渐稳定在约 $1.71$。初期步长较大，估计跳动明显；后期 $a_k$ 变小，噪声影响被削弱。&lt;/p&gt;
&lt;p&gt;该例的 $g(w)=w^3-5$ 不满足后面定理要求的全局导数上界，因此必须适当选择初值，不能据此宣称任意初值都收敛。&lt;/p&gt;
&lt;h3&gt;2.4 无噪声时的几何直觉&lt;/h3&gt;
&lt;p&gt;教材再取：&lt;/p&gt;
&lt;p&gt;$$
g(w)=\tanh(w-1),
\qquad
w^*=1,
\qquad
w_1=3,
\qquad
a_k=\frac{1}{k},
\qquad
\eta_k=0.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-6-4-rm-root-convergence.png&quot; alt=&quot;Figure 6.4：Robbins-Monro 向根移动的几何过程&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; 每次从横轴上的 $w_k$ 读出曲线高度 $g(w_k)$，再按
$w_{k+1}=w_k-a_kg(w_k)$ 沿横轴移动。估计从根右侧逐步向 $w^*=1$ 靠近，步长也逐渐缩短。&lt;/p&gt;
&lt;h2&gt;3. Robbins-Monro 收敛定理&lt;/h2&gt;
&lt;h3&gt;3.1 Theorem 6.1 - Robbins-Monro theorem&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 6.1 - Robbins-Monro theorem
对式 (6.5)，若满足：&lt;/p&gt;
&lt;p&gt;$$
0&amp;lt;c_1
\leq
\nabla_w g(w)
\leq
c_2,
\qquad
\forall w,
$$&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}a_k=\infty,
\qquad
\sum_{k=1}^{\infty}a_k^2&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\eta_k\mid\mathcal H_k]=0,
\qquad
\mathbb E[\eta_k^2\mid\mathcal H_k]&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;其中历史信息&lt;/p&gt;
&lt;p&gt;$$
\mathcal H_k={w_k,w_{k-1},\ldots},
$$&lt;/p&gt;
&lt;p&gt;则 $w_k$ 几乎必然收敛到满足 $g(w^&lt;em&gt;)=0$ 的根 $w^&lt;/em&gt;$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这里的“几乎必然”（almost surely）是概率意义上的收敛。&lt;/p&gt;
&lt;h3&gt;3.2 条件一：方向正确且斜率有界&lt;/h3&gt;
&lt;p&gt;$$
0&amp;lt;c_1\leq\nabla_wg(w)
$$&lt;/p&gt;
&lt;p&gt;表示 $g$ 严格单调递增，使根在定理语境下具有唯一性。若函数单调递减，可把
$-g(w)$ 视为新函数。&lt;/p&gt;
&lt;p&gt;上界：&lt;/p&gt;
&lt;p&gt;$$
\nabla_wg(w)\leq c_2
$$&lt;/p&gt;
&lt;p&gt;限制函数不能陡峭到失控。$g(w)=\tanh(w-1)$ 满足有界导数，而
$g(w)=w^3-5$ 的导数 $3w^2$ 没有全局上界。&lt;/p&gt;
&lt;p&gt;在优化中若：&lt;/p&gt;
&lt;p&gt;$$
g(w)=\nabla_wJ(w),
$$&lt;/p&gt;
&lt;p&gt;则 $g$ 单调递增对应 $J$ 的凸性，导数上下界对应曲率受控。&lt;/p&gt;
&lt;h3&gt;3.3 条件二：步长既要消失，又不能消失太快&lt;/h3&gt;
&lt;p&gt;两个条件缺一不可：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}a_k^2&amp;lt;\infty
\quad\Rightarrow\quad
a_k\rightarrow0.
$$&lt;/p&gt;
&lt;p&gt;若带噪观测有界，则：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}-w_k
=-a_k\widetilde g(w_k,\eta_k)
\rightarrow0,
$$&lt;/p&gt;
&lt;p&gt;从而后期不会一直大幅振荡。&lt;/p&gt;
&lt;p&gt;另一方面：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}a_k=\infty
$$&lt;/p&gt;
&lt;p&gt;表示总移动能力无限，步长不能消失得太快。由迭代式求和：&lt;/p&gt;
&lt;h1&gt;$$
w_1-w_\infty&lt;/h1&gt;
&lt;p&gt;\sum_{k=1}^{\infty}
a_k\widetilde g(w_k,\eta_k).
$$&lt;/p&gt;
&lt;p&gt;若 $\sum_k a_k&amp;lt;\infty$ 且观测有界，则总移动距离有有限上界 $b$。当初值满足：&lt;/p&gt;
&lt;p&gt;$$
\lvert w_1-w^*\rvert&amp;gt;b,
\tag{6.6}
$$&lt;/p&gt;
&lt;p&gt;算法无论如何也到不了 $w^*$。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 步长条件的直觉
$\sum a_k=\infty$ 保证“还有足够力量走到目标”；$\sum a_k^2&amp;lt;\infty$ 保证“噪声造成的累计能量有限”。前者负责不早停，后者负责不永远抖动。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.4 为什么 $a_k=1/k$ 是典型选择&lt;/h3&gt;
&lt;p&gt;调和级数发散：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}\frac{1}{k}
=\infty.
$$&lt;/p&gt;
&lt;p&gt;更精确地：&lt;/p&gt;
&lt;p&gt;$$
\lim_{n\rightarrow\infty}
\left(
\sum_{k=1}^{n}\frac{1}{k}-\ln n
\right)
=\kappa,
$$&lt;/p&gt;
&lt;p&gt;其中 $\kappa\approx0.577$ 是 Euler-Mascheroni 常数。&lt;/p&gt;
&lt;p&gt;平方和收敛：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}\frac{1}{k^2}
=\frac{\pi^2}{6}
&amp;lt;\infty.
$$&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;p&gt;$$
a_k=\frac{1}{k}
$$&lt;/p&gt;
&lt;p&gt;同时满足两个要求。$1/(k+1)$ 也满足。教材还提到 $a_k=c_k/k$ 在相应有界条件下可保持这种性质。&lt;/p&gt;
&lt;h3&gt;3.5 条件三：噪声无偏且二阶矩有限&lt;/h3&gt;
&lt;p&gt;$$
\mathbb E[\eta_k\mid\mathcal H_k]=0
$$&lt;/p&gt;
&lt;p&gt;表示在已知历史后，下一次噪声仍没有系统性偏移。&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\eta_k^2\mid\mathcal H_k]&amp;lt;\infty
$$&lt;/p&gt;
&lt;p&gt;限制噪声能量。噪声不必是高斯分布。一个常见充分情形是 ${\eta_k}$ i.i.d.，且：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\eta_k]=0,
\qquad
\mathbb E[\eta_k^2]&amp;lt;\infty.
$$&lt;/p&gt;
&lt;h3&gt;3.6 常数步长的地位&lt;/h3&gt;
&lt;p&gt;实践中常取小常数 $a_k=a$。此时：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}a_k^2
=\infty,
$$&lt;/p&gt;
&lt;p&gt;所以不满足 Theorem 6.1。教材指出算法仍可能在某种意义上收敛，但不能直接套用该定理得到几乎必然收敛到单一点的结论。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 定理条件是充分条件，不是所有成功运行的必要条件
图 6.3 的 $g(w)=w^3-5$ 不满足导数全局有界，常数步长也不满足平方可和条件；算法仍可能在适当初值或较弱收敛意义下工作，但这些情形不能由 Theorem 6.1 直接保证。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;4. 均值估计是 Robbins-Monro 的特例&lt;/h2&gt;
&lt;p&gt;把均值问题改写成求根：&lt;/p&gt;
&lt;p&gt;$$
g(w)
\doteq
w-\mathbb E[X].
$$&lt;/p&gt;
&lt;p&gt;目标 $\mathbb E[X]$ 恰是：&lt;/p&gt;
&lt;p&gt;$$
g(w)=0
$$&lt;/p&gt;
&lt;p&gt;的根。&lt;/p&gt;
&lt;p&gt;给定样本 $x$，可观测：&lt;/p&gt;
&lt;p&gt;$$
\widetilde g(w,\eta)=w-x.
$$&lt;/p&gt;
&lt;p&gt;分解为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\widetilde g(w,\eta)
&amp;amp;=w-x\
&amp;amp;=w-x+\mathbb E[X]-\mathbb E[X]\
&amp;amp;=(w-\mathbb E[X])+(\mathbb E[X]-x)\
&amp;amp;=g(w)+\eta,
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;p&gt;$$
\eta\doteq\mathbb E[X]-x.
$$&lt;/p&gt;
&lt;p&gt;代入 RM 更新：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
w_{k+1}
&amp;amp;=w_k-\alpha_k\widetilde g(w_k,\eta_k)\
&amp;amp;=w_k-\alpha_k(w_k-x_k)\
&amp;amp;=w_k+\alpha_k(x_k-w_k),
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;正是式 (6.4)。&lt;/p&gt;
&lt;p&gt;只要 ${x_k}$ i.i.d.、相应二阶矩有限，且：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}\alpha_k=\infty,
\qquad
\sum_{k=1}^{\infty}\alpha_k^2&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;就有：&lt;/p&gt;
&lt;p&gt;$$
w_k\rightarrow\mathbb E[X]
\quad\text{almost surely}.
$$&lt;/p&gt;
&lt;p&gt;该结论不要求 $X$ 服从特定分布。&lt;/p&gt;
&lt;h2&gt;5. Dvoretzky 收敛定理&lt;/h2&gt;
&lt;h3&gt;5.1 为什么还需要一个更一般的定理&lt;/h3&gt;
&lt;p&gt;Theorem 6.1 给出 RM 的结论，但尚未证明。Dvoretzky 定理提供一个更抽象的随机递推收敛模板，不仅能证明 RM，也能用于分析许多强化学习算法。&lt;/p&gt;
&lt;h3&gt;5.2 Theorem 6.2 - Dvoretzky&apos;s theorem&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 6.2 - Dvoretzky&apos;s theorem
考虑随机过程：&lt;/p&gt;
&lt;p&gt;$$
\Delta_{k+1}
=(1-\alpha_k)\Delta_k+\beta_k\eta_k,
$$&lt;/p&gt;
&lt;p&gt;其中 $\alpha_k\geq0$、$\beta_k\geq0$，并允许它们依赖历史。若：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}\alpha_k=\infty,
\qquad
\sum_{k=1}^{\infty}\alpha_k^2&amp;lt;\infty,
\qquad
\sum_{k=1}^{\infty}\beta_k^2&amp;lt;\infty
$$&lt;/p&gt;
&lt;p&gt;一致地几乎必然成立，并且：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\eta_k\mid\mathcal H_k]=0,
\qquad
\mathbb E[\eta_k^2\mid\mathcal H_k]\leq C
$$&lt;/p&gt;
&lt;p&gt;几乎必然成立，则：&lt;/p&gt;
&lt;p&gt;$$
\Delta_k\rightarrow0
\quad\text{almost surely}.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;历史信息可写为：&lt;/p&gt;
&lt;h1&gt;$$
\mathcal H_k&lt;/h1&gt;
&lt;p&gt;{
\Delta_k,\Delta_{k-1},\ldots,
\eta_{k-1},\ldots,
\alpha_{k-1},\ldots,
\beta_{k-1},\ldots
}.
$$&lt;/p&gt;
&lt;p&gt;与 RM 相比，该定理允许 $\alpha_k$ 和 $\beta_k$ 是依赖历史的随机变量。它也不要求
$\sum_k\beta_k=\infty$；极端地，若所有 $\beta_k=0$，序列仍可收敛。&lt;/p&gt;
&lt;h3&gt;5.3 证明第一步：研究平方误差&lt;/h3&gt;
&lt;p&gt;令：&lt;/p&gt;
&lt;p&gt;$$
h_k\doteq\Delta_k^2.
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
h_{k+1}-h_k
&amp;amp;=\Delta_{k+1}^2-\Delta_k^2\
&amp;amp;=(\Delta_{k+1}-\Delta_k)(\Delta_{k+1}+\Delta_k)\
&amp;amp;=(-\alpha_k\Delta_k+\beta_k\eta_k)
\left((2-\alpha_k)\Delta_k+\beta_k\eta_k\right)\
&amp;amp;=-\alpha_k(2-\alpha_k)\Delta_k^2
+\beta_k^2\eta_k^2
+2(1-\alpha_k)\beta_k\eta_k\Delta_k.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;对历史取条件期望：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E[h_{k+1}-h_k\mid\mathcal H_k]
={}&amp;amp;
\mathbb E[-\alpha_k(2-\alpha_k)\Delta_k^2\mid\mathcal H_k]\
&amp;amp;+\mathbb E[\beta_k^2\eta_k^2\mid\mathcal H_k]\
&amp;amp;+\mathbb E[
2(1-\alpha_k)\beta_k\eta_k\Delta_k
\mid\mathcal H_k
].
\end{aligned}
\tag{6.7}
$$&lt;/p&gt;
&lt;p&gt;在 $\alpha_k,\beta_k$ 由历史决定或为确定序列的情形，可把它们连同 $\Delta_k$ 提出条件期望：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E[h_{k+1}-h_k\mid\mathcal H_k]
={}&amp;amp;
-\alpha_k(2-\alpha_k)\Delta_k^2\
&amp;amp;+\beta_k^2\mathbb E[\eta_k^2\mid\mathcal H_k]\
&amp;amp;+2(1-\alpha_k)\beta_k\Delta_k
\mathbb E[\eta_k\mid\mathcal H_k].
\end{aligned}
\tag{6.8}
$$&lt;/p&gt;
&lt;h3&gt;5.4 证明第二步：噪声交叉项消失&lt;/h3&gt;
&lt;p&gt;由：&lt;/p&gt;
&lt;p&gt;$$
\sum_k\alpha_k^2&amp;lt;\infty
$$&lt;/p&gt;
&lt;p&gt;可知 $\alpha_k\rightarrow0$，故充分大的 $k$ 满足 $\alpha_k\leq1$。于是：&lt;/p&gt;
&lt;p&gt;$$
-\alpha_k(2-\alpha_k)\Delta_k^2\leq0.
$$&lt;/p&gt;
&lt;p&gt;再利用：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\eta_k\mid\mathcal H_k]=0,
$$&lt;/p&gt;
&lt;p&gt;交叉项为零；利用二阶矩上界：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\eta_k^2\mid\mathcal H_k]\leq C,
$$&lt;/p&gt;
&lt;p&gt;得到：&lt;/p&gt;
&lt;h1&gt;$$
\mathbb E[h_{k+1}-h_k\mid\mathcal H_k]&lt;/h1&gt;
&lt;p&gt;-\alpha_k(2-\alpha_k)\Delta_k^2
+\beta_k^2\mathbb E[\eta_k^2\mid\mathcal H_k]
\leq
\beta_k^2C.
\tag{6.9}
$$&lt;/p&gt;
&lt;p&gt;由于 $\sum_k\beta_k^2&amp;lt;\infty$，由教材引用的拟鞅收敛定理可知 $h_k$ 几乎必然收敛。&lt;/p&gt;
&lt;h3&gt;5.5 证明第三步：极限只能是零&lt;/h3&gt;
&lt;p&gt;从式 (6.9) 整理并求和，可知：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}
\alpha_k(2-\alpha_k)\Delta_k^2
&amp;lt;\infty.
$$&lt;/p&gt;
&lt;p&gt;当 $\alpha_k\leq1$ 时：&lt;/p&gt;
&lt;p&gt;$$
\alpha_k(2-\alpha_k)\Delta_k^2
\geq
\alpha_k\Delta_k^2
\geq0.
$$&lt;/p&gt;
&lt;p&gt;所以：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}
\alpha_k\Delta_k^2
&amp;lt;\infty.
$$&lt;/p&gt;
&lt;p&gt;但：&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}\alpha_k=\infty.
$$&lt;/p&gt;
&lt;p&gt;因此不可能让 $\Delta_k^2$ 的极限保持为正，只能有：&lt;/p&gt;
&lt;p&gt;$$
\Delta_k\rightarrow0
\quad\text{almost surely}.
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 证明的核心思想
先证明平方误差不会因噪声无限累积，再利用“步长总和发散”排除正误差极限。平方可和抑制噪声，和发散消灭残余偏差。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;6. Dvoretzky 定理的两个应用&lt;/h2&gt;
&lt;h3&gt;6.1 直接证明增量均值收敛&lt;/h3&gt;
&lt;p&gt;令：&lt;/p&gt;
&lt;p&gt;$$
w^&lt;em&gt;=\mathbb E[X],
\qquad
\Delta_k\doteq w_k-w^&lt;/em&gt;.
$$&lt;/p&gt;
&lt;p&gt;由均值更新：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
=w_k+\alpha_k(x_k-w_k),
$$&lt;/p&gt;
&lt;p&gt;得：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\Delta_{k+1}
&amp;amp;=\Delta_k+\alpha_k(x_k-w^&lt;em&gt;-\Delta_k)\
&amp;amp;=(1-\alpha_k)\Delta_k
+\alpha_k(x_k-w^&lt;/em&gt;).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;对应 Dvoretzky 形式：&lt;/p&gt;
&lt;p&gt;$$
\beta_k=\alpha_k,
\qquad
\eta_k=x_k-w^*.
$$&lt;/p&gt;
&lt;p&gt;若 $x_k$ i.i.d.：&lt;/p&gt;
&lt;h1&gt;$$
\mathbb E[\eta_k\mid\mathcal H_k]&lt;/h1&gt;
&lt;p&gt;\mathbb E[x_k]-w^*
=0,
$$&lt;/p&gt;
&lt;p&gt;且有限方差保证条件二阶矩有界。因此：&lt;/p&gt;
&lt;p&gt;$$
\Delta_k\rightarrow0,
\qquad
w_k\rightarrow\mathbb E[X]
$$&lt;/p&gt;
&lt;p&gt;几乎必然成立。&lt;/p&gt;
&lt;h3&gt;6.2 用 Dvoretzky 证明 Robbins-Monro 定理&lt;/h3&gt;
&lt;p&gt;设 $g(w^*)=0$，并令：&lt;/p&gt;
&lt;p&gt;$$
\Delta_k\doteq w_k-w^*.
$$&lt;/p&gt;
&lt;p&gt;RM 更新给出：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}-w^*&lt;/h1&gt;
&lt;p&gt;w_k-w^*
-a_k[g(w_k)-g(w^*)+\eta_k].
$$&lt;/p&gt;
&lt;p&gt;由中值定理，存在 $w_k&apos;\in[w_k,w^*]$，使：&lt;/p&gt;
&lt;h1&gt;$$
g(w_k)-g(w^*)&lt;/h1&gt;
&lt;p&gt;\nabla_wg(w_k&apos;)(w_k-w^*).
$$&lt;/p&gt;
&lt;p&gt;于是：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\Delta_{k+1}
&amp;amp;=
\left[
1-a_k\nabla_wg(w_k&apos;)
\right]\Delta_k
+a_k(-\eta_k)\
&amp;amp;=
(1-\alpha_k)\Delta_k+\beta_k\widetilde\eta_k,
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;p&gt;$$
\alpha_k
=a_k\nabla_wg(w_k&apos;),
\qquad
\beta_k=a_k,
\qquad
\widetilde\eta_k=-\eta_k.
$$&lt;/p&gt;
&lt;p&gt;由：&lt;/p&gt;
&lt;p&gt;$$
0&amp;lt;c_1\leq\nabla_wg(w)\leq c_2
$$&lt;/p&gt;
&lt;p&gt;以及 RM 步长条件，可验证 Dvoretzky 的 $\alpha_k,\beta_k$ 条件；噪声条件也保持。因此：&lt;/p&gt;
&lt;p&gt;$$
\Delta_k\rightarrow0
\quad\Rightarrow\quad
w_k\rightarrow w^*
$$&lt;/p&gt;
&lt;p&gt;几乎必然成立。&lt;/p&gt;
&lt;h2&gt;7. 多变量扩展&lt;/h2&gt;
&lt;h3&gt;7.1 Theorem 6.3&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 6.3 - Dvoretzky 定理的多变量扩展
对有限索引集 $\mathcal S$，考虑：&lt;/p&gt;
&lt;h1&gt;$$
\Delta_{k+1}(s)&lt;/h1&gt;
&lt;p&gt;(1-\alpha_k(s))\Delta_k(s)
+
\beta_k(s)\eta_k(s).
$$&lt;/p&gt;
&lt;p&gt;若对每个 $s\in\mathcal S$：&lt;/p&gt;
&lt;p&gt;$$
\sum_k\alpha_k(s)=\infty,
\qquad
\sum_k\alpha_k^2(s)&amp;lt;\infty,
\qquad
\sum_k\beta_k^2(s)&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\beta_k(s)\mid\mathcal H_k]
\leq
\mathbb E[\alpha_k(s)\mid\mathcal H_k]
$$&lt;/p&gt;
&lt;p&gt;一致地几乎必然成立，并且：&lt;/p&gt;
&lt;p&gt;$$
\left\lVert
\mathbb E[\eta_k(s)\mid\mathcal H_k]
\right\rVert_\infty
\leq
\gamma
\left\lVert\Delta_k\right\rVert_\infty,
\qquad
\gamma\in(0,1),
$$&lt;/p&gt;
&lt;p&gt;$$
\operatorname{Var}[\eta_k(s)\mid\mathcal H_k]
\leq
C
\left(
1+\left\lVert\Delta_k(s)\right\rVert_\infty
\right)^2,
$$&lt;/p&gt;
&lt;p&gt;则所有 $s\in\mathcal S$ 都满足：&lt;/p&gt;
&lt;p&gt;$$
\Delta_k(s)\rightarrow0
\quad\text{almost surely}.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;最大范数按索引集合定义：&lt;/p&gt;
&lt;p&gt;$$
\left\lVert\Delta_k\right\rVert_\infty
\doteq
\max_{s\in\mathcal S}\lvert\Delta_k(s)\rvert.
$$&lt;/p&gt;
&lt;p&gt;在强化学习中，$s$ 可代表状态或状态动作对。该扩展重要之处在于：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;能同时处理多个状态对应的误差；&lt;/li&gt;
&lt;li&gt;噪声条件均值不必严格为零，只需被整体误差按系数 $\gamma&amp;lt;1$ 控制；&lt;/li&gt;
&lt;li&gt;方差允许随误差增大，但增长必须受给定上界控制；&lt;/li&gt;
&lt;li&gt;若要所有分量收敛，条件必须对每个状态或状态动作对成立。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;教材省略了该扩展定理的证明，并指出它可用于后续 Q-learning 的收敛分析。&lt;/p&gt;
&lt;h2&gt;8. 随机梯度下降&lt;/h2&gt;
&lt;h3&gt;8.1 从期望优化到真实梯度&lt;/h3&gt;
&lt;p&gt;考虑：&lt;/p&gt;
&lt;h1&gt;$$
\min_w
J(w)&lt;/h1&gt;
&lt;p&gt;\mathbb E[f(w,X)],
\tag{6.10}
$$&lt;/p&gt;
&lt;p&gt;其中 $w$ 是待优化参数，$X$ 是随机变量，$f$ 输出标量。&lt;/p&gt;
&lt;p&gt;若可交换梯度与期望：&lt;/p&gt;
&lt;h1&gt;$$
\nabla_wJ(w)&lt;/h1&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w,X)].
$$&lt;/p&gt;
&lt;p&gt;普通梯度下降为：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;h1&gt;w_k
-\alpha_k\nabla_wJ(w_k)&lt;/h1&gt;
&lt;p&gt;w_k
-\alpha_k
\mathbb E[\nabla_wf(w_k,X)].
\tag{6.11}
$$&lt;/p&gt;
&lt;p&gt;但实际中 $X$ 的分布往往未知，真实期望梯度无法直接计算。&lt;/p&gt;
&lt;h3&gt;8.2 批量样本近似&lt;/h3&gt;
&lt;p&gt;用 $n$ 个 i.i.d. 样本近似：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\nabla_wf(w_k,X)]
\approx
\frac{1}{n}
\sum_{i=1}^{n}
\nabla_wf(w_k,x_i).
$$&lt;/p&gt;
&lt;p&gt;得到：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;h2&gt;w_k&lt;/h2&gt;
&lt;p&gt;\frac{\alpha_k}{n}
\sum_{i=1}^{n}
\nabla_wf(w_k,x_i).
\tag{6.12}
$$&lt;/p&gt;
&lt;p&gt;其问题是每次迭代都要使用全部样本。&lt;/p&gt;
&lt;h3&gt;8.3 单样本 SGD&lt;/h3&gt;
&lt;p&gt;每到达一个新样本 $x_k$ 就更新：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k
-\alpha_k\nabla_wf(w_k,x_k).
\tag{6.13}
$$&lt;/p&gt;
&lt;p&gt;这就是 SGD。它用随机梯度：&lt;/p&gt;
&lt;p&gt;$$
\nabla_wf(w_k,x_k)
$$&lt;/p&gt;
&lt;p&gt;替代真实梯度：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\nabla_wf(w_k,X)].
$$&lt;/p&gt;
&lt;h3&gt;8.4 SGD 是带零均值扰动的梯度下降&lt;/h3&gt;
&lt;p&gt;定义：&lt;/p&gt;
&lt;h2&gt;$$
\eta_k
\doteq
\nabla_wf(w_k,x_k)&lt;/h2&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w_k,X)].
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;h1&gt;$$
\nabla_wf(w_k,x_k)&lt;/h1&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w_k,X)]
+\eta_k.
$$&lt;/p&gt;
&lt;p&gt;SGD 可写成：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k
-\alpha_k\mathbb E[\nabla_wf(w_k,X)]
-\alpha_k\eta_k.
$$&lt;/p&gt;
&lt;p&gt;若 ${x_k}$ i.i.d.：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\eta_k]=0.
$$&lt;/p&gt;
&lt;p&gt;所以 SGD 是普通梯度下降加上经步长缩放的无偏随机扰动。步长递减时，扰动影响也逐渐减弱。&lt;/p&gt;
&lt;h2&gt;9. 均值估计是 SGD 的特例&lt;/h2&gt;
&lt;p&gt;把均值估计写成最小二乘：&lt;/p&gt;
&lt;h1&gt;$$
\min_w
J(w)&lt;/h1&gt;
&lt;p&gt;\mathbb E
\left[
\frac{1}{2}
\left\lVert w-X\right\rVert^2
\right]
\doteq
\mathbb E[f(w,X)].
\tag{6.14}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;h1&gt;$$
f(w,X)&lt;/h1&gt;
&lt;p&gt;\frac{1}{2}\left\lVert w-X\right\rVert^2,
\qquad
\nabla_wf(w,X)=w-X.
$$&lt;/p&gt;
&lt;p&gt;真实梯度为：&lt;/p&gt;
&lt;p&gt;$$
\nabla_wJ(w)
=w-\mathbb E[X].
$$&lt;/p&gt;
&lt;p&gt;令其为零得：&lt;/p&gt;
&lt;p&gt;$$
w^*=\mathbb E[X].
$$&lt;/p&gt;
&lt;p&gt;普通梯度下降需要未知的 $\mathbb E[X]$，无法直接实施；SGD 用样本 $x_k$：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
w_{k+1}
&amp;amp;=w_k-\alpha_k\nabla_wf(w_k,x_k)\
&amp;amp;=w_k-\alpha_k(w_k-x_k),
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;正好是式 (6.4)。&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;p&gt;$$
\text{均值增量估计}
\subset
\text{SGD}
\subset
\text{RM}.
$$&lt;/p&gt;
&lt;h2&gt;10. SGD 的收敛模式&lt;/h2&gt;
&lt;h3&gt;10.1 随机梯度的相对误差&lt;/h3&gt;
&lt;p&gt;教材用随机梯度相对真实梯度的误差衡量随机性：&lt;/p&gt;
&lt;h2&gt;$$
\delta_k
\doteq
\frac{
\left\lvert
\nabla_wf(w_k,x_k)&lt;/h2&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w_k,X)]
\right\rvert
}{
\left\lvert
\mathbb E[\nabla_wf(w_k,X)]
\right\rvert
}.
$$&lt;/p&gt;
&lt;p&gt;为简化分析，教材考虑标量 $w$。在最优解 $w^*$：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\nabla_wf(w^*,X)]=0.
$$&lt;/p&gt;
&lt;p&gt;由中值定理，存在 $\widetilde w_k\in[w_k,w^*]$：&lt;/p&gt;
&lt;h2&gt;$$
\begin{aligned}
\delta_k
&amp;amp;=
\frac{
\left\lvert
\nabla_wf(w_k,x_k)&lt;/h2&gt;
&lt;h2&gt;\mathbb E[\nabla_wf(w_k,X)]
\right\rvert
}{
\left\lvert
\mathbb E[\nabla_wf(w_k,X)]&lt;/h2&gt;
&lt;h2&gt;\mathbb E[\nabla_wf(w^*,X)]
\right\rvert
}\
&amp;amp;=
\frac{
\left\lvert
\nabla_wf(w_k,x_k)&lt;/h2&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w_k,X)]
\right\rvert
}{
\left\lvert
\mathbb E[
\nabla_w^2f(\widetilde w_k,X)(w_k-w^*)
]
\right\rvert
}.
\end{aligned}
\tag{6.15}
$$&lt;/p&gt;
&lt;p&gt;若严格凸且：&lt;/p&gt;
&lt;p&gt;$$
\nabla_w^2f(w,X)\geq c&amp;gt;0,
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;p&gt;$$
\left\lvert
\mathbb E[
\nabla_w^2f(\widetilde w_k,X)(w_k-w^&lt;em&gt;)
]
\right\rvert
\geq
c\lvert w_k-w^&lt;/em&gt;\rvert.
$$&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;h2&gt;$$
\delta_k
\leq
\frac{
\left\lvert
\nabla_wf(w_k,x_k)&lt;/h2&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w_k,X)]
\right\rvert
}{
c\lvert w_k-w^*\rvert
}.
$$&lt;/p&gt;
&lt;h3&gt;10.2 远处快、近处抖&lt;/h3&gt;
&lt;p&gt;上述不等式说明：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;当 $\lvert w_k-w^*\rvert$ 大时，真实梯度信号相对强，$\delta_k$ 小，SGD 像普通梯度下降，前进较快；&lt;/li&gt;
&lt;li&gt;当 $w_k$ 接近 $w^*$ 时，真实梯度趋近于零，单样本噪声相对突出，$\delta_k$ 可能很大，轨迹表现得更随机。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;均值估计中：&lt;/p&gt;
&lt;p&gt;$$
\nabla_wf(w_k,x_k)=w_k-x_k,
$$&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\nabla_wf(w_k,X)]
=w_k-\mathbb E[X]
=w_k-w^*.
$$&lt;/p&gt;
&lt;p&gt;所以：&lt;/p&gt;
&lt;h1&gt;$$
\delta_k&lt;/h1&gt;
&lt;p&gt;\frac{
\lvert\mathbb E[X]-x_k\rvert
}{
\lvert w_k-w^*\rvert
}.
$$&lt;/p&gt;
&lt;p&gt;该式直接展示相对误差与到最优点距离成反比，也表明样本分布方差越大，随机波动越明显。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-6-5-sgd-mini-batch-comparison.png&quot; alt=&quot;Figure 6.5：SGD 与不同 mini-batch 大小的收敛比较&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$X\in\mathbb R^2$，在以原点为中心、边长为 20 的正方形内均匀分布；&lt;/li&gt;
&lt;li&gt;真均值为 $\mathbb E[X]=0$，共使用 100 个 i.i.d. 样本；&lt;/li&gt;
&lt;li&gt;三种方法都从远离原点的位置出发，早期快速接近均值；&lt;/li&gt;
&lt;li&gt;靠近原点后，$m=1$ 的 SGD 波动最大；&lt;/li&gt;
&lt;li&gt;$m=5$ 的 MBGD 更平稳；&lt;/li&gt;
&lt;li&gt;$m=50$ 的 MBGD 最快且最稳定。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;11. 确定性有限数据集中的 SGD&lt;/h2&gt;
&lt;h3&gt;11.1 经验风险形式&lt;/h3&gt;
&lt;p&gt;给定有限数据集 ${x_i}_{i=1}^n$，即使不把它们预先解释为随机样本，也可定义：&lt;/p&gt;
&lt;h1&gt;$$
\min_w
J(w)&lt;/h1&gt;
&lt;p&gt;\frac{1}{n}
\sum_{i=1}^{n}
f(w,x_i).
$$&lt;/p&gt;
&lt;p&gt;全梯度为：&lt;/p&gt;
&lt;h1&gt;$$
\nabla_wJ(w)&lt;/h1&gt;
&lt;p&gt;\frac{1}{n}
\sum_{i=1}^{n}\nabla_wf(w,x_i).
$$&lt;/p&gt;
&lt;p&gt;逐样本更新写成：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k
-\alpha_k\nabla_wf(w_k,x_k).
\tag{6.16}
$$&lt;/p&gt;
&lt;p&gt;这里 $x_k$ 表示第 $k$ 次迭代抽到的数据，不一定是数据集中的第 $k$ 个元素。&lt;/p&gt;
&lt;h3&gt;11.2 把确定性有限和严格改写成期望&lt;/h3&gt;
&lt;p&gt;在有限数据集上定义随机变量 $X$：&lt;/p&gt;
&lt;p&gt;$$
p(X=x_i)=\frac{1}{n}.
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;h1&gt;$$
\frac{1}{n}
\sum_{i=1}^{n}f(w,x_i)&lt;/h1&gt;
&lt;p&gt;\mathbb E[f(w,X)].
$$&lt;/p&gt;
&lt;p&gt;这里是严格等号，不是 Monte Carlo 近似。若每次从数据集中独立均匀抽取 $x_k$，式 (6.16) 就是标准随机形式的 SGD。由于有放回抽样，同一样本可能被重复选中。&lt;/p&gt;
&lt;h2&gt;12. BGD、MBGD 与 SGD&lt;/h2&gt;
&lt;h3&gt;12.1 三种更新&lt;/h3&gt;
&lt;p&gt;给定样本 ${x_i}_{i=1}^n$。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Batch gradient descent, BGD&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;h2&gt;w_k&lt;/h2&gt;
&lt;p&gt;\alpha_k
\frac{1}{n}
\sum_{i=1}^{n}
\nabla_wf(w_k,x_i).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mini-batch gradient descent, MBGD&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;h2&gt;w_k&lt;/h2&gt;
&lt;p&gt;\alpha_k
\frac{1}{m}
\sum_{j\in\mathcal I_k}
\nabla_wf(w_k,x_j),
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;p&gt;$$
\lvert\mathcal I_k\rvert=m.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Stochastic gradient descent, SGD&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;h2&gt;w_k&lt;/h2&gt;
&lt;p&gt;\alpha_k\nabla_wf(w_k,x_k).
$$&lt;/p&gt;
&lt;h3&gt;12.2 对比&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;每次使用的样本数&lt;/th&gt;
&lt;th&gt;梯度随机性&lt;/th&gt;
&lt;th&gt;单步计算量&lt;/th&gt;
&lt;th&gt;教材强调&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;BGD&lt;/td&gt;
&lt;td&gt;全部 $n$ 个&lt;/td&gt;
&lt;td&gt;最低&lt;/td&gt;
&lt;td&gt;最高&lt;/td&gt;
&lt;td&gt;每次都使用完整数据集&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MBGD&lt;/td&gt;
&lt;td&gt;$m$ 个&lt;/td&gt;
&lt;td&gt;中等&lt;/td&gt;
&lt;td&gt;中等&lt;/td&gt;
&lt;td&gt;在随机性与计算量之间折中&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SGD&lt;/td&gt;
&lt;td&gt;$1$ 个&lt;/td&gt;
&lt;td&gt;最高&lt;/td&gt;
&lt;td&gt;最低&lt;/td&gt;
&lt;td&gt;能随样本到达立即更新&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;MBGD 是二者之间的中间形式：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;相比 SGD，多个样本的平均会削弱随机性；&lt;/li&gt;
&lt;li&gt;相比 BGD，不需要每轮读取全部数据，更灵活；&lt;/li&gt;
&lt;li&gt;$m=1$ 时 MBGD 退化为 SGD；&lt;/li&gt;
&lt;li&gt;若 mini-batch 是有放回随机抽样，即使 $m=n$ 也不一定等于 BGD，因为可能重复抽到某些样本而遗漏另一些样本。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;12.3 均值估计下的三种方法&lt;/h3&gt;
&lt;p&gt;目标：&lt;/p&gt;
&lt;h1&gt;$$
\min_w
J(w)&lt;/h1&gt;
&lt;p&gt;\frac{1}{2n}
\sum_{i=1}^{n}
\left\lVert w-x_i\right\rVert^2,
$$&lt;/p&gt;
&lt;p&gt;最优解：&lt;/p&gt;
&lt;p&gt;$$
w^*=\bar x.
$$&lt;/p&gt;
&lt;p&gt;更新分别为：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k-\alpha_k(w_k-\bar x)
\qquad
\text{BGD},
$$&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k-\alpha_k
\left(
w_k-\bar x_k^{(m)}
\right)
\qquad
\text{MBGD},
$$&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k-\alpha_k(w_k-x_k)
\qquad
\text{SGD},
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;h1&gt;$$
\bar x_k^{(m)}&lt;/h1&gt;
&lt;p&gt;\frac{1}{m}
\sum_{j\in\mathcal I_k}x_j.
$$&lt;/p&gt;
&lt;p&gt;当 $\alpha_k=1/k$ 时：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;\frac{1}{k}
\sum_{j=1}^{k}\bar x
=\bar x
\qquad
\text{BGD},
$$&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;\frac{1}{k}
\sum_{j=1}^{k}
\bar x_j^{(m)}
\qquad
\text{MBGD},
$$&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;\frac{1}{k}
\sum_{j=1}^{k}x_j
\qquad
\text{SGD}.
$$&lt;/p&gt;
&lt;p&gt;BGD 每一步都直接得到经验均值；MBGD 的输入本身已经是小批量平均，通常比 SGD 更快、更平滑。&lt;/p&gt;
&lt;h2&gt;13. SGD 收敛定理&lt;/h2&gt;
&lt;h3&gt;13.1 Theorem 6.4 - Convergence of SGD&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 6.4 - Convergence of SGD
对式 (6.13)，若：&lt;/p&gt;
&lt;p&gt;$$
0&amp;lt;c_1
\leq
\nabla_w^2f(w,X)
\leq
c_2,
$$&lt;/p&gt;
&lt;p&gt;$$
\sum_{k=1}^{\infty}a_k=\infty,
\qquad
\sum_{k=1}^{\infty}a_k^2&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;且 ${x_k}_{k=1}^{\infty}$ i.i.d.，则 $w_k$ 几乎必然收敛到：&lt;/p&gt;
&lt;p&gt;$$
\nabla_w\mathbb E[f(w,X)]=0
$$&lt;/p&gt;
&lt;p&gt;的根。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;条件一要求曲率有正下界和有限上界。标量情形中是二阶导数；向量情形中对应 Hessian 矩阵条件。&lt;/p&gt;
&lt;h3&gt;13.2 Box 6.1 - SGD 是 RM 的特例&lt;/h3&gt;
&lt;p&gt;SGD 要最小化：&lt;/p&gt;
&lt;p&gt;$$
J(w)=\mathbb E[f(w,X)].
$$&lt;/p&gt;
&lt;p&gt;将其改成求根：&lt;/p&gt;
&lt;h1&gt;$$
g(w)
\doteq
\nabla_wJ(w)&lt;/h1&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w,X)].
$$&lt;/p&gt;
&lt;p&gt;可观测的随机梯度：&lt;/p&gt;
&lt;h1&gt;$$
\widetilde g(w,\eta)&lt;/h1&gt;
&lt;p&gt;\nabla_wf(w,x)
$$&lt;/p&gt;
&lt;p&gt;分解为：&lt;/p&gt;
&lt;h2&gt;$$
\begin{aligned}
\widetilde g(w,\eta)
&amp;amp;=
\mathbb E[\nabla_wf(w,X)]\
&amp;amp;\quad+
\left(
\nabla_wf(w,x)&lt;/h2&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w,X)]
\right),
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其中括号内为 $\eta$。RM 更新：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
w_{k+1}
&amp;amp;=w_k-a_k\widetilde g(w_k,\eta_k)\
&amp;amp;=w_k-a_k\nabla_wf(w_k,x_k),
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;就是 SGD。&lt;/p&gt;
&lt;p&gt;接着逐项验证 Theorem 6.1：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;曲率条件给出：&lt;/li&gt;
&lt;/ol&gt;
&lt;h1&gt;$$
\nabla_wg(w)&lt;/h1&gt;
&lt;h1&gt;\nabla_w
\mathbb E[\nabla_wf(w,X)]&lt;/h1&gt;
&lt;p&gt;\mathbb E[\nabla_w^2f(w,X)],
$$&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;p&gt;$$
c_1\leq\nabla_wg(w)\leq c_2.
$$&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;步长条件与 RM 完全相同。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;由于 $x_k$ 与历史 $\mathcal H_k$ 独立且同分布：&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;$$
\begin{aligned}
\mathbb E[\eta_k\mid\mathcal H_k]
&amp;amp;=
\mathbb E[
\nabla_wf(w_k,x_k)&lt;/h2&gt;
&lt;h2&gt;\mathbb E[\nabla_wf(w_k,X)]
\mid\mathcal H_k
]\
&amp;amp;=
\mathbb E_{x_k}[\nabla_wf(w_k,x_k)]&lt;/h2&gt;
&lt;p&gt;\mathbb E[\nabla_wf(w_k,X)]\
&amp;amp;=0.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;若对给定 $x$，$\lvert\nabla_wf(w,x)\rvert$ 有界，则相应条件二阶矩有限。Theorem 6.1 因而推出 SGD 收敛。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 证明关系
Theorem 6.2 证明 Theorem 6.1；Theorem 6.1 再证明 Theorem 6.4。也就是 Dvoretzky 是通用收敛模板，RM 是通用带噪求根算法，SGD 是把优化的一阶条件放进 RM 后得到的特例。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;14. 本章总结&lt;/h2&gt;
&lt;p&gt;本章从一个看似简单的均值问题建立了后续增量强化学习的数学骨架：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;样本均值可从批量计算改写为“旧估计加步长乘误差”的增量更新。&lt;/li&gt;
&lt;li&gt;RM 把该结构推广到未知函数的带噪求根，只需要黑箱输入输出。&lt;/li&gt;
&lt;li&gt;RM 收敛依赖三个核心要素：正确的平均方向、合适的步长、无偏且二阶矩受控的噪声。&lt;/li&gt;
&lt;li&gt;Dvoretzky 定理通过平方误差与拟鞅工具给出一般随机递推的几乎必然收敛。&lt;/li&gt;
&lt;li&gt;均值增量估计既是 RM 特例，也是 SGD 特例。&lt;/li&gt;
&lt;li&gt;SGD 用单样本随机梯度代替真实期望梯度，远离最优点时信号占优、靠近最优点时噪声相对突出。&lt;/li&gt;
&lt;li&gt;BGD、MBGD、SGD 主要区别是每步使用的样本数，由此形成计算量与随机性的权衡。&lt;/li&gt;
&lt;li&gt;多变量 Dvoretzky 扩展为后续多状态强化学习算法的收敛分析提供工具。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;15. 教材 Q&amp;amp;A&lt;/h2&gt;
&lt;h3&gt;Q1. 什么是随机逼近？&lt;/h3&gt;
&lt;p&gt;随机逼近是一大类用于求根或优化问题的随机迭代算法。&lt;/p&gt;
&lt;h3&gt;Q2. 为什么需要学习随机逼近？&lt;/h3&gt;
&lt;p&gt;Chapter 7 的时序差分强化学习可以看作随机逼近算法。理解本章后，后续增量更新的设计与收敛条件就不会显得突兀。&lt;/p&gt;
&lt;h3&gt;Q3. 为什么本章反复讨论均值估计？&lt;/h3&gt;
&lt;p&gt;状态价值和动作价值都是随机回报的均值；时序差分更新与本章的增量均值随机逼近具有相似结构。&lt;/p&gt;
&lt;h3&gt;Q4. RM 相比其他求根方法有什么优势？&lt;/h3&gt;
&lt;p&gt;RM 不需要目标函数或其导数的解析表达式，只需要输入与带噪输出，因此可作为黑箱方法。SGD 就是 RM 的特例。&lt;/p&gt;
&lt;h3&gt;Q5. SGD 的基本思想是什么？&lt;/h3&gt;
&lt;p&gt;当随机变量分布未知时，用样本产生的随机梯度替代以期望表示的真实梯度，并在每个样本到达时增量更新。&lt;/p&gt;
&lt;h3&gt;Q6. SGD 能快速收敛吗？&lt;/h3&gt;
&lt;p&gt;能。估计离最优解较远时，真实梯度信号相对噪声强，收敛很快；接近最优解时，随机梯度噪声的相对影响增大，速度下降且轨迹更随机。&lt;/p&gt;
&lt;h3&gt;Q7. 什么是 MBGD？相对 SGD 和 BGD 有何优势？&lt;/h3&gt;
&lt;p&gt;MBGD 每次使用一个小批量。相比 SGD，它通过多个样本平均降低随机性；相比 BGD，它不必每轮使用全部数据，因此更灵活。&lt;/p&gt;
&lt;h2&gt;16. 一页式复习&lt;/h2&gt;
&lt;h3&gt;16.1 最核心的四个更新&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;增量均值&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k+\alpha_k(x_k-w_k).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Robbins-Monro&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k-a_k\widetilde g(w_k,\eta_k).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SGD&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;p&gt;w_k-\alpha_k\nabla_wf(w_k,x_k).
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Dvoretzky 模板&lt;/strong&gt;&lt;/p&gt;
&lt;h1&gt;$$
\Delta_{k+1}&lt;/h1&gt;
&lt;p&gt;(1-\alpha_k)\Delta_k+\beta_k\eta_k.
$$&lt;/p&gt;
&lt;h3&gt;16.2 Robbins-Monro 步长条件&lt;/h3&gt;
&lt;p&gt;$$
\sum_ka_k=\infty
\quad\text{且}\quad
\sum_ka_k^2&amp;lt;\infty.
$$&lt;/p&gt;
&lt;p&gt;记忆：&lt;/p&gt;
&lt;p&gt;$$
\text{不能衰减太快}
\quad+\quad
\text{必须最终趋零}.
$$&lt;/p&gt;
&lt;p&gt;典型选择：&lt;/p&gt;
&lt;p&gt;$$
a_k=\frac{1}{k}.
$$&lt;/p&gt;
&lt;h3&gt;16.3 三层包含关系&lt;/h3&gt;
&lt;p&gt;$$
\text{均值估计}
\subset
\text{SGD}
\subset
\text{RM}.
$$&lt;/p&gt;
&lt;p&gt;证明工具：&lt;/p&gt;
&lt;p&gt;$$
\text{Dvoretzky}
\Longrightarrow
\text{RM 收敛}
\Longrightarrow
\text{SGD 收敛}.
$$&lt;/p&gt;
&lt;h3&gt;16.4 SGD 收敛模式&lt;/h3&gt;
&lt;p&gt;$$
\delta_k
\lesssim
\frac{\text{随机梯度误差}}
{\text{到最优解的距离}}.
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;离最优点远：相对噪声小，快速前进；&lt;/li&gt;
&lt;li&gt;离最优点近：相对噪声大，出现波动；&lt;/li&gt;
&lt;li&gt;mini-batch 越大：噪声通常越小，但每步计算越多。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;17. 公式清单&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;公式&lt;/th&gt;
&lt;th&gt;名称&lt;/th&gt;
&lt;th&gt;作用&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$w_{k+1}=w_k+\alpha_k(x_k-w_k)$&lt;/td&gt;
&lt;td&gt;增量均值&lt;/td&gt;
&lt;td&gt;样本到达时更新均值估计&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$w_{k+1}=w_k-a_k\widetilde g(w_k,\eta_k)$&lt;/td&gt;
&lt;td&gt;RM 更新&lt;/td&gt;
&lt;td&gt;仅凭带噪函数值求根&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\sum_ka_k=\infty,\ \sum_ka_k^2&amp;lt;\infty$&lt;/td&gt;
&lt;td&gt;RM 步长条件&lt;/td&gt;
&lt;td&gt;保留总移动能力并抑制噪声&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Delta_{k+1}=(1-\alpha_k)\Delta_k+\beta_k\eta_k$&lt;/td&gt;
&lt;td&gt;Dvoretzky 模板&lt;/td&gt;
&lt;td&gt;统一分析随机误差递推&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$J(w)=\mathbb E[f(w,X)]$&lt;/td&gt;
&lt;td&gt;随机优化目标&lt;/td&gt;
&lt;td&gt;定义 SGD 要解决的问题&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$w_{k+1}=w_k-\alpha_k\nabla_wf(w_k,x_k)$&lt;/td&gt;
&lt;td&gt;SGD 更新&lt;/td&gt;
&lt;td&gt;用单样本随机梯度增量优化&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$J(w)=\mathbb E[\frac12\lVert w-X\rVert^2]$&lt;/td&gt;
&lt;td&gt;均值的最小二乘形式&lt;/td&gt;
&lt;td&gt;说明均值估计是 SGD&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_k=\frac{\lvert\nabla f-\mathbb E[\nabla f]\rvert}{\lvert\mathbb E[\nabla f]\rvert}$&lt;/td&gt;
&lt;td&gt;随机梯度相对误差&lt;/td&gt;
&lt;td&gt;解释远处快、近处抖&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;18. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$X$&lt;/td&gt;
&lt;td&gt;随机变量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$x_k$&lt;/td&gt;
&lt;td&gt;第 $k$ 次获得或抽取的样本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$w_k$&lt;/td&gt;
&lt;td&gt;第 $k$ 次参数或根估计&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$w^*$&lt;/td&gt;
&lt;td&gt;真根或最优解&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$g(w)$&lt;/td&gt;
&lt;td&gt;待求零点的未知函数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\widetilde g(w,\eta)$&lt;/td&gt;
&lt;td&gt;带噪函数观测&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\eta_k$&lt;/td&gt;
&lt;td&gt;第 $k$ 次噪声或随机梯度扰动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$a_k,\alpha_k,\beta_k$&lt;/td&gt;
&lt;td&gt;随机递推中的步长或系数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathcal H_k$&lt;/td&gt;
&lt;td&gt;第 $k$ 步之前的历史信息&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Delta_k$&lt;/td&gt;
&lt;td&gt;当前估计相对目标的误差&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$h_k$&lt;/td&gt;
&lt;td&gt;平方误差 $\Delta_k^2$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$J(w)$&lt;/td&gt;
&lt;td&gt;优化目标函数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$f(w,X)$&lt;/td&gt;
&lt;td&gt;单个随机样本对应的损失&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\nabla_wf$&lt;/td&gt;
&lt;td&gt;关于 $w$ 的梯度&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\nabla_w^2f$&lt;/td&gt;
&lt;td&gt;标量二阶导数或向量情形的 Hessian&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathcal I_k$&lt;/td&gt;
&lt;td&gt;第 $k$ 次 mini-batch 的样本索引集&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$m$&lt;/td&gt;
&lt;td&gt;mini-batch 大小&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_k$&lt;/td&gt;
&lt;td&gt;随机梯度相对真实梯度的误差&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;19. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;English&lt;/th&gt;
&lt;th&gt;中文&lt;/th&gt;
&lt;th&gt;核心含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;stochastic approximation&lt;/td&gt;
&lt;td&gt;随机逼近&lt;/td&gt;
&lt;td&gt;用随机迭代求根或优化&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;incremental&lt;/td&gt;
&lt;td&gt;增量式&lt;/td&gt;
&lt;td&gt;每个样本到达时立刻更新&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Robbins-Monro algorithm&lt;/td&gt;
&lt;td&gt;Robbins-Monro 算法&lt;/td&gt;
&lt;td&gt;仅用带噪函数观测求根&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;root-finding&lt;/td&gt;
&lt;td&gt;求根&lt;/td&gt;
&lt;td&gt;寻找使函数为零的输入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;almost sure convergence&lt;/td&gt;
&lt;td&gt;几乎必然收敛&lt;/td&gt;
&lt;td&gt;以概率 1 收敛&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;stochastic gradient&lt;/td&gt;
&lt;td&gt;随机梯度&lt;/td&gt;
&lt;td&gt;单样本或小批量产生的梯度&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;stochastic gradient descent&lt;/td&gt;
&lt;td&gt;随机梯度下降&lt;/td&gt;
&lt;td&gt;用随机梯度执行增量优化&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;batch gradient descent&lt;/td&gt;
&lt;td&gt;批量梯度下降&lt;/td&gt;
&lt;td&gt;每轮使用全部样本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;mini-batch gradient descent&lt;/td&gt;
&lt;td&gt;小批量梯度下降&lt;/td&gt;
&lt;td&gt;每轮使用一组样本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;history&lt;/td&gt;
&lt;td&gt;历史信息&lt;/td&gt;
&lt;td&gt;当前更新前已经产生的随机变量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;maximum norm&lt;/td&gt;
&lt;td&gt;最大范数&lt;/td&gt;
&lt;td&gt;所有索引分量绝对值的最大值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;quasimartingale&lt;/td&gt;
&lt;td&gt;拟鞅&lt;/td&gt;
&lt;td&gt;Dvoretzky 证明使用的收敛工具&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;20. 常见误区&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 1：增量均值只是批量均值的粗略近似
当 $\alpha_k=1/k$ 且索引定义一致时，两者代数上完全等价。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 2：随机逼近必须知道 $g(w)$
RM 的优势正是无需知道函数表达式，只访问带噪黑箱输出。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 3：噪声必须是高斯噪声
Theorem 6.1 只要求条件均值为零、条件二阶矩有限。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 4：只要 $a_k\rightarrow0$ 就能收敛
还必须避免衰减过快。若 $\sum_ka_k&amp;lt;\infty$，算法可能没有足够总移动距离到达根。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 5：常数步长满足 Robbins-Monro 条件
常数步长使 $\sum_ka_k^2=\infty$，不能直接套用 Theorem 6.1 的几乎必然收敛结论。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 6：Theorem 6.1 的条件是所有成功案例的必要条件
它们是教材给出的充分条件。违反某条条件的算法仍可能在受限初值或较弱意义下工作。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 7：SGD 的随机梯度等于真实梯度
单次通常不相等；关键是其条件期望与真实梯度一致。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 8：SGD 靠近最优点时应该更稳定、更快
真实梯度在最优点附近变小，样本噪声的相对影响反而增大。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 9：mini-batch 大小 $m=n$ 必然等于 BGD
若 mini-batch 采用有放回随机抽样，可能重复样本，未必覆盖全部 $n$ 个数据。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 10：有限数据集形式不是 SGD
在数据集上定义均匀随机变量后，有限平均严格等于期望；独立均匀抽样更新就是 SGD。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;21. 自测题&lt;/h2&gt;
&lt;h3&gt;21.1 概念题&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;1. 为什么增量均值更新只需常数级存储？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;因为更新只保留当前估计 $w_k$、新样本 $x_k$ 和计数或步长，不需要保存全部历史样本。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;2. Robbins-Monro 算法比普通求根方法少需要什么信息？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;它不需要 $g(w)$ 或其导数的解析表达式，只需要能向黑箱输入 $w$ 并得到带噪输出 $\widetilde g(w,\eta)$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;3. 两个步长和式分别控制什么？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
\sum_ka_k=\infty
$$&lt;/p&gt;
&lt;p&gt;防止总移动能力有限；而：&lt;/p&gt;
&lt;p&gt;$$
\sum_ka_k^2&amp;lt;\infty
$$&lt;/p&gt;
&lt;p&gt;使步长趋零并限制噪声累计影响。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;4. 为什么 SGD 是 Robbins-Monro 的特例？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;优化的一阶条件是求解：&lt;/p&gt;
&lt;p&gt;$$
g(w)=\nabla_wJ(w)=0.
$$&lt;/p&gt;
&lt;p&gt;单样本梯度是 $g(w)$ 的带噪无偏观测，把它代入 RM 更新就得到 SGD。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;5. Dvoretzky 证明为什么研究平方误差而不是直接研究误差？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;平方误差非负，展开后能把收缩项、噪声能量项和零均值交叉项分开；再借助拟鞅收敛与步长条件确定极限为零。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;21.2 判断与计算&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;6. 判断：步长 a_k=1/sqrt(k) 满足 Robbins-Monro 的两个和式条件。&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;错误。虽然：&lt;/p&gt;
&lt;p&gt;$$
\sum_k\frac{1}{\sqrt{k}}=\infty,
$$&lt;/p&gt;
&lt;p&gt;但：&lt;/p&gt;
&lt;h1&gt;$$
\sum_k a_k^2&lt;/h1&gt;
&lt;p&gt;\sum_k\frac{1}{k}
=\infty,
$$&lt;/p&gt;
&lt;p&gt;所以平方和不收敛。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;7. 判断：步长 a_k=1/k^2 满足 Robbins-Monro 的两个和式条件。&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;错误。平方和收敛，但：&lt;/p&gt;
&lt;p&gt;$$
\sum_k\frac{1}{k^2}&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;总步长有限，可能无法从任意初值走到根。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;8. 当前均值估计 w_k=4，新样本 x_k=10，alpha_k=0.2。求新估计。&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
=4+0.2(10-4)
=5.2.
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;9. 对 f(w,x)=1/2(w-x)^2，写出 SGD 更新。&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
\nabla_wf(w,x)=w-x.
$$&lt;/p&gt;
&lt;p&gt;所以：&lt;/p&gt;
&lt;h1&gt;$$
w_{k+1}&lt;/h1&gt;
&lt;h1&gt;w_k-\alpha_k(w_k-x_k)&lt;/h1&gt;
&lt;p&gt;w_k+\alpha_k(x_k-w_k).
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;21.3 推导与思考&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;10. 把均值估计写成 Robbins-Monro 求根问题。&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;定义：&lt;/p&gt;
&lt;p&gt;$$
g(w)=w-\mathbb E[X].
$$&lt;/p&gt;
&lt;p&gt;样本给出的带噪观测：&lt;/p&gt;
&lt;p&gt;$$
\widetilde g(w)=w-x
=g(w)+(\mathbb E[X]-x).
$$&lt;/p&gt;
&lt;p&gt;代入 RM 即得：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
=w_k-\alpha_k(w_k-x_k).
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;11. 为什么 SGD 离最优点远时往往看起来像普通梯度下降？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;离最优点远时真实梯度通常较大，随机梯度与真实梯度之差相对较小。教材的相对误差上界与
$1/\lvert w_k-w^*\rvert$ 成比例，因此远处噪声的相对影响较弱。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;12. MBGD 为什么通常比 SGD 平稳？代价是什么？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;MBGD 对多个样本梯度取平均，独立噪声会部分抵消，因此方差通常更小；代价是每次迭代需要更多样本读取和梯度计算。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;13. Theorem 6.3 为什么要求条件对每个 s 都成立？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;因为结论是所有分量 $\Delta_k(s)$ 同时收敛。若某个状态或状态动作对没有足够更新、噪声不受控或步长条件失败，就不能由该定理保证该分量收敛。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 7 - Temporal-Difference Methods</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-7-temporal-difference-methods/chapter-7---temporal-difference-methods/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-7-temporal-difference-methods/chapter-7---temporal-difference-methods/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 7 - Temporal-Difference Methods&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
时序差分学习（temporal-difference learning, TD learning）把 Chapter 5 的无模型采样与 Chapter 6 的随机逼近结合起来：它不需要环境模型，也不必等到整条回合结束，而是在每个转移到达后，用“奖励加下一时刻的价值估计”立即更新当前价值。本章依次建立状态价值 TD、Sarsa、n 步 Sarsa 和 Q-learning，并从 Bellman 方程、Bellman 最优方程、同策略与异策略三个角度解释它们之间的关系。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识结构&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-7-1-book-roadmap.png&quot; alt=&quot;Figure 7.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt; Chapter 7 位于表格型方法向函数近似方法过渡的关键位置。它从 Monte Carlo 的非增量、完整回合更新，转向逐步、增量更新；同时用 Chapter 6 的随机逼近理论解释为什么带噪且自举的迭代能够收敛。后续 Chapter 8 会把这里的表格型价值函数推广到参数化函数。&lt;/p&gt;
&lt;p&gt;本章主线是：&lt;/p&gt;
&lt;p&gt;$$
\text{Bellman 方程}
\longrightarrow
\text{单步采样目标}
\longrightarrow
\text{TD 更新}
\longrightarrow
\text{策略改进}
\longrightarrow
\text{最优策略}.
$$&lt;/p&gt;
&lt;p&gt;算法关系可以概括为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\text{状态价值 TD}
&amp;amp;\longrightarrow \text{给定策略的 }v_\pi,\
\text{Sarsa}
&amp;amp;\longrightarrow \text{给定策略的 }q_\pi,\
n\text{ 步 Sarsa}
&amp;amp;\longrightarrow \text{Sarsa 与 MC 之间的连续桥梁},\
\text{Q-learning}
&amp;amp;\longrightarrow \text{直接逼近 }q_*.
\end{aligned}
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 一句话总览
所有算法都具有“旧估计向 TD 目标移动”的同一骨架；它们真正不同的地方，是 TD 目标怎样构造，以及目标值对应给定策略的 Bellman 方程还是 Bellman 最优方程。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;1. 状态价值的 TD 学习&lt;/h2&gt;
&lt;h3&gt;1.1 问题设定&lt;/h3&gt;
&lt;p&gt;给定固定策略 $\pi$，智能体按该策略产生经验序列：&lt;/p&gt;
&lt;p&gt;$$
(s_0,r_1,s_1,\ldots,s_t,r_{t+1},s_{t+1},\ldots).
$$&lt;/p&gt;
&lt;p&gt;目标是用样本估计所有状态的真实价值 $v_\pi(s)$，但不知道环境的转移概率和奖励模型。&lt;/p&gt;
&lt;h3&gt;1.2 TD(0) 更新&lt;/h3&gt;
&lt;p&gt;在时刻 $t$ 观察到转移 $(s_t,r_{t+1},s_{t+1})$ 后，只更新刚访问的状态：&lt;/p&gt;
&lt;h1&gt;$$
v_{t+1}(s_t)&lt;/h1&gt;
&lt;h2&gt;v_t(s_t)
-\alpha_t(s_t)
\left[
v_t(s_t)&lt;/h2&gt;
&lt;p&gt;\left(r_{t+1}+\gamma v_t(s_{t+1})\right)
\right].
\tag{7.1}
$$&lt;/p&gt;
&lt;p&gt;对所有未访问状态：&lt;/p&gt;
&lt;p&gt;$$
v_{t+1}(s)=v_t(s),
\qquad s\ne s_t.
\tag{7.2}
$$&lt;/p&gt;
&lt;p&gt;式 (7.2) 在算法描述中经常省略，但它在数学上不可缺少：一次迭代只改变价值向量的一个分量。&lt;/p&gt;
&lt;p&gt;把更新写成更熟悉的插值形式：&lt;/p&gt;
&lt;h1&gt;$$
v_{t+1}(s_t)&lt;/h1&gt;
&lt;p&gt;(1-\alpha_t(s_t))v_t(s_t)
+\alpha_t(s_t)
\left[r_{t+1}+\gamma v_t(s_{t+1})\right].
$$&lt;/p&gt;
&lt;p&gt;因此，当 $0&amp;lt;\alpha_t(s_t)&amp;lt;1$ 时，新估计位于旧估计和本次 TD 目标之间。&lt;/p&gt;
&lt;h3&gt;1.3 从回报定义到 Bellman 方程&lt;/h3&gt;
&lt;p&gt;状态价值定义为：&lt;/p&gt;
&lt;h1&gt;$$
v_\pi(s)&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
G_t
\mid
S_t=s
\right].
$$&lt;/p&gt;
&lt;p&gt;由于&lt;/p&gt;
&lt;p&gt;$$
G_t=R_{t+1}+\gamma G_{t+1},
$$&lt;/p&gt;
&lt;p&gt;可得：&lt;/p&gt;
&lt;h1&gt;$$
v_\pi(s)&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
R_{t+1}+\gamma G_{t+1}
\mid
S_t=s
\right].
\tag{7.3}
$$&lt;/p&gt;
&lt;p&gt;在 Markov 性与固定策略下，&lt;/p&gt;
&lt;h1&gt;$$
\mathbb E_\pi
\left[
G_{t+1}
\mid
S_t=s
\right]&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
v_\pi(S_{t+1})
\mid
S_t=s
\right],
$$&lt;/p&gt;
&lt;p&gt;于是得到 Bellman 期望方程：&lt;/p&gt;
&lt;h1&gt;$$
v_\pi(s)&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
R_{t+1}+\gamma v_\pi(S_{t+1})
\mid
S_t=s
\right].
\tag{7.4}
$$&lt;/p&gt;
&lt;h3&gt;1.4 Box 7.1 - 用 Robbins-Monro 推导 TD&lt;/h3&gt;
&lt;p&gt;把 Bellman 方程移到一边，定义求根函数：&lt;/p&gt;
&lt;h2&gt;$$
g(v_\pi(s_t))
\doteq
v_\pi(s_t)&lt;/h2&gt;
&lt;p&gt;\mathbb E_\pi
\left[
R_{t+1}+\gamma v_\pi(S_{t+1})
\mid
S_t=s_t
\right].
$$&lt;/p&gt;
&lt;p&gt;真实根满足 $g(v_\pi(s_t))=0$。但期望未知，只能用单个转移构造带噪观测：&lt;/p&gt;
&lt;h1&gt;$$
\widetilde g(v_\pi(s_t))&lt;/h1&gt;
&lt;h2&gt;v_\pi(s_t)&lt;/h2&gt;
&lt;p&gt;\left[
r_{t+1}+\gamma v_\pi(s_{t+1})
\right].
$$&lt;/p&gt;
&lt;p&gt;Robbins-Monro 更新为：&lt;/p&gt;
&lt;h2&gt;$$
\begin{aligned}
v_{t+1}(s_t)
&amp;amp;=
v_t(s_t)-\alpha_t(s_t)\widetilde g(v_t(s_t))\
&amp;amp;=
v_t(s_t)
-\alpha_t(s_t)
\left[
v_t(s_t)&lt;/h2&gt;
&lt;p&gt;\left(r_{t+1}+\gamma v_\pi(s_{t+1})\right)
\right].
\end{aligned}
\tag{7.5}
$$&lt;/p&gt;
&lt;p&gt;这里仍含未知真值 $v_\pi(s_{t+1})$。把它替换为当前估计 $v_t(s_{t+1})$，就得到式 (7.1)。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 自举发生在哪里
TD 目标用一个估计 $v_t(s_{t+1})$ 去更新另一个估计 $v_t(s_t)$，这就是 bootstrapping。随机逼近推导先给出理想的无偏观测，再用当前估计代替未知真值；Theorem 7.1 说明这种耦合替换仍可收敛。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;1.5 TD 目标与 TD 误差&lt;/h3&gt;
&lt;p&gt;定义一步 TD 目标：&lt;/p&gt;
&lt;p&gt;$$
\overline v_t
\doteq
r_{t+1}+\gamma v_t(s_{t+1}).
$$&lt;/p&gt;
&lt;p&gt;教材采用的 TD 误差符号是：&lt;/p&gt;
&lt;h1&gt;$$
\delta_t
\doteq
v_t(s_t)-\overline v_t&lt;/h1&gt;
&lt;h2&gt;v_t(s_t)&lt;/h2&gt;
&lt;p&gt;\left[r_{t+1}+\gamma v_t(s_{t+1})\right].
$$&lt;/p&gt;
&lt;p&gt;因此更新写成：&lt;/p&gt;
&lt;h1&gt;$$
v_{t+1}(s_t)&lt;/h1&gt;
&lt;p&gt;v_t(s_t)-\alpha_t(s_t)\delta_t.
\tag{7.6}
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 符号约定
很多强化学习资料把 TD 误差定义为“目标减当前值”，此时更新使用加号。本教材定义为“当前值减目标”，所以更新使用减号。两种写法数值完全等价，但推导时不能混用。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;若 $0&amp;lt;\alpha_t(s_t)&amp;lt;1$，则：&lt;/p&gt;
&lt;h1&gt;$$
v_{t+1}(s_t)-\overline v_t&lt;/h1&gt;
&lt;p&gt;\left(1-\alpha_t(s_t)\right)
\left[v_t(s_t)-\overline v_t\right],
$$&lt;/p&gt;
&lt;p&gt;从而：&lt;/p&gt;
&lt;p&gt;$$
\left\lvert
v_{t+1}(s_t)-\overline v_t
\right\rvert
&amp;lt;
\left\lvert
v_t(s_t)-\overline v_t
\right\rvert.
$$&lt;/p&gt;
&lt;p&gt;这说明每次更新都把当前估计拉近本次目标，但不表示它在每一步都更接近真值，因为 TD 目标本身是随机且随估计变化的。&lt;/p&gt;
&lt;p&gt;当 $v_t=v_\pi$ 时：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E_\pi
\left[
\delta_t
\mid
S_t=s_t
\right]
=0.
$$&lt;/p&gt;
&lt;p&gt;因此 TD 误差也可理解为 innovation，即新样本相对于当前预测带来的新信息。&lt;/p&gt;
&lt;h3&gt;1.6 TD 与 Monte Carlo 的比较&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;Table 7.1：TD learning 与 MC learning&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;比较维度&lt;/th&gt;
&lt;th&gt;TD learning&lt;/th&gt;
&lt;th&gt;Monte Carlo learning&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;更新时间&lt;/td&gt;
&lt;td&gt;增量式，每得到一个转移样本即可更新&lt;/td&gt;
&lt;td&gt;非增量式，通常要等完整回合结束并计算回报&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;适用任务&lt;/td&gt;
&lt;td&gt;回合式与持续式任务均可&lt;/td&gt;
&lt;td&gt;主要用于有终止状态的回合式任务&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;是否自举&lt;/td&gt;
&lt;td&gt;是，目标包含已有估计，需初始化价值&lt;/td&gt;
&lt;td&gt;否，直接使用实际折扣回报&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;方差&lt;/td&gt;
&lt;td&gt;通常较低；单步 Sarsa 只引入 $R_{t+1},S_{t+1},A_{t+1}$ 等少量随机量&lt;/td&gt;
&lt;td&gt;通常较高；完整回报累积整条未来轨迹的随机性&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;若一条长度为 $L$ 的回合中每个状态有 $\lvert\mathcal A\rvert$ 个可选动作，软策略可能产生数量级为 $\lvert\mathcal A\rvert^L$ 的动作序列。MC 目标吸收整条序列的随机性，而单步 TD 只使用局部转移，因此常有更低方差。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
TD 与 MC 的核心权衡是偏差和方差。TD 用当前估计截断未来回报，通常降低方差但引入自举偏差；MC 使用完整真实回报，没有自举偏差，却对整条轨迹的随机性更敏感。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;1.7 Theorem 7.1 - TD 的收敛性&lt;/h3&gt;
&lt;p&gt;给定固定策略 $\pi$，若对每个状态 $s$ 都有：&lt;/p&gt;
&lt;p&gt;$$
\sum_{t=0}^{\infty}\alpha_t(s)=\infty,
\qquad
\sum_{t=0}^{\infty}\alpha_t^2(s)&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;其中访问 $s$ 时 $\alpha_t(s)&amp;gt;0$，未访问时 $\alpha_t(s)=0$，则：&lt;/p&gt;
&lt;p&gt;$$
v_t(s)\longrightarrow v_\pi(s)
\qquad
\text{almost surely}.
$$&lt;/p&gt;
&lt;p&gt;第一项要求每个状态获得无限或足够多的有效更新，因此必须保证充分探索，例如使用 exploring starts 或探索性策略。第二项要求步长平方和有限，使噪声的累计方差受控。&lt;/p&gt;
&lt;p&gt;常数步长不满足第二个条件，所以一般不能保证几乎必然收敛到一个固定点；不过在平稳问题中，它可以在真值附近波动，并具有跟踪非平稳目标的能力。&lt;/p&gt;
&lt;h3&gt;1.8 Box 7.2 - 收敛证明的结构&lt;/h3&gt;
&lt;p&gt;定义误差：&lt;/p&gt;
&lt;p&gt;$$
\Delta_t(s)
\doteq
v_t(s)-v_\pi(s).
$$&lt;/p&gt;
&lt;p&gt;对已访问状态，式 (7.1) 可写为：&lt;/p&gt;
&lt;h1&gt;$$
v_{t+1}(s)&lt;/h1&gt;
&lt;h2&gt;v_t(s)
-\alpha_t(s)
\left[
v_t(s)&lt;/h2&gt;
&lt;p&gt;\left(r_{t+1}+\gamma v_t(s_{t+1})\right)
\right].
\tag{7.7}
$$&lt;/p&gt;
&lt;p&gt;对未访问状态：&lt;/p&gt;
&lt;p&gt;$$
v_{t+1}(s)=v_t(s).
\tag{7.8}
$$&lt;/p&gt;
&lt;p&gt;令&lt;/p&gt;
&lt;p&gt;$$
\eta_t(s)
\doteq
r_{t+1}+\gamma v_t(s_{t+1})-v_\pi(s)
$$&lt;/p&gt;
&lt;p&gt;用于已访问状态，并对未访问状态令 $\eta_t(s)=0$。两种情况可统一为：&lt;/p&gt;
&lt;h1&gt;$$
\Delta_{t+1}(s)&lt;/h1&gt;
&lt;p&gt;\left(1-\alpha_t(s)\right)\Delta_t(s)
+\alpha_t(s)\eta_t(s).
\tag{7.9}
$$&lt;/p&gt;
&lt;p&gt;证明随后核对 Chapter 6 的多变量随机逼近定理。&lt;/p&gt;
&lt;p&gt;若 $s\ne s_t$，则：&lt;/p&gt;
&lt;p&gt;$$
\left\lvert
\mathbb E[\eta_t(s)]
\right\rvert
=0
\le
\gamma\lVert\Delta_t\rVert_\infty.
\tag{7.10}
$$&lt;/p&gt;
&lt;p&gt;若 $s=s_t$，利用 Bellman 方程：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E[\eta_t(s)]
&amp;amp;=
\gamma
\sum_{s&apos;\in\mathcal S}
p(s&apos;\mid s_t)
\left[v_t(s&apos;)-v_\pi(s&apos;)\right],\
\left\lvert\mathbb E[\eta_t(s)]\right\rvert
&amp;amp;\le
\gamma
\max_{s&apos;\in\mathcal S}
\left\lvert v_t(s&apos;)-v_\pi(s&apos;)\right\rvert\
&amp;amp;=
\gamma\lVert\Delta_t\rVert_\infty.
\end{aligned}
\tag{7.11}
$$&lt;/p&gt;
&lt;p&gt;因为 $0\le\gamma&amp;lt;1$，条件期望映射具有压缩性；奖励有界又保证条件方差有界。再结合 Robbins-Monro 步长条件，便得到 $\Delta_t\to0$。&lt;/p&gt;
&lt;h2&gt;2. 动作价值的 TD 学习：Sarsa&lt;/h2&gt;
&lt;h3&gt;2.1 固定策略下的 Sarsa&lt;/h3&gt;
&lt;p&gt;给定策略 $\pi$，经验序列写为：&lt;/p&gt;
&lt;p&gt;$$
(s_0,a_0,r_1,s_1,a_1,\ldots,s_t,a_t,r_{t+1},s_{t+1},a_{t+1},\ldots).
$$&lt;/p&gt;
&lt;p&gt;Sarsa 更新为：&lt;/p&gt;
&lt;h2&gt;$$
\begin{aligned}
q_{t+1}(s_t,a_t)
&amp;amp;=
q_t(s_t,a_t)\
&amp;amp;\quad
-\alpha_t(s_t,a_t)
\left[
q_t(s_t,a_t)&lt;/h2&gt;
&lt;p&gt;\left(r_{t+1}+\gamma q_t(s_{t+1},a_{t+1})\right)
\right],
\end{aligned}
\tag{7.12}
$$&lt;/p&gt;
&lt;p&gt;而对所有 $(s,a)\ne(s_t,a_t)$：&lt;/p&gt;
&lt;p&gt;$$
q_{t+1}(s,a)=q_t(s,a).
$$&lt;/p&gt;
&lt;p&gt;名称 Sarsa 来自一次更新所需的五元组：&lt;/p&gt;
&lt;p&gt;$$
S_t,\ A_t,\ R_{t+1},\ S_{t+1},\ A_{t+1}.
$$&lt;/p&gt;
&lt;p&gt;其 TD 目标和教材符号下的 TD 误差分别为：&lt;/p&gt;
&lt;h1&gt;$$
\overline q_t^{\text{Sarsa}}&lt;/h1&gt;
&lt;p&gt;r_{t+1}+\gamma q_t(s_{t+1},a_{t+1}),
$$&lt;/p&gt;
&lt;h1&gt;$$
\delta_t^{\text{Sarsa}}&lt;/h1&gt;
&lt;p&gt;q_t(s_t,a_t)-\overline q_t^{\text{Sarsa}}.
$$&lt;/p&gt;
&lt;h3&gt;2.2 动作价值 Bellman 方程&lt;/h3&gt;
&lt;p&gt;Sarsa 是对以下方程的随机逼近：&lt;/p&gt;
&lt;h1&gt;$$
q_\pi(s,a)&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
R+\gamma q_\pi(S&apos;,A&apos;)
\mid
s,a
\right],
\qquad
\forall(s,a).
\tag{7.13}
$$&lt;/p&gt;
&lt;h3&gt;2.3 Box 7.3 - 为什么式 (7.13) 是 Bellman 方程&lt;/h3&gt;
&lt;p&gt;按模型展开：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
q_\pi(s,a)
&amp;amp;=
\sum_r r,p(r\mid s,a)
+\gamma
\sum_{s&apos;}\sum_{a&apos;}
q_\pi(s&apos;,a&apos;)p(s&apos;\mid s,a)\pi(a&apos;\mid s&apos;)\
&amp;amp;=
\sum_r r,p(r\mid s,a)
+\gamma
\sum_{s&apos;}p(s&apos;\mid s,a)
\sum_{a&apos;}q_\pi(s&apos;,a&apos;)\pi(a&apos;\mid s&apos;).
\end{aligned}
\tag{7.14}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
p(s&apos;,a&apos;\mid s,a)
&amp;amp;=
p(s&apos;\mid s,a)p(a&apos;\mid s&apos;,s,a)\
&amp;amp;=
p(s&apos;\mid s,a)\pi(a&apos;\mid s&apos;).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;这正是：&lt;/p&gt;
&lt;h1&gt;$$
q_\pi(s,a)&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
R_{t+1}+\gamma q_\pi(S_{t+1},A_{t+1})
\mid
S_t=s,A_t=a
\right].
$$&lt;/p&gt;
&lt;h3&gt;2.4 Theorem 7.2 - Sarsa 的收敛性&lt;/h3&gt;
&lt;p&gt;给定固定策略 $\pi$，若对所有状态动作对 $(s,a)$：&lt;/p&gt;
&lt;p&gt;$$
\sum_t\alpha_t(s,a)=\infty,
\qquad
\sum_t\alpha_t^2(s,a)&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;p&gt;$$
q_t(s,a)\longrightarrow q_\pi(s,a)
\qquad
\text{almost surely}.
$$&lt;/p&gt;
&lt;p&gt;这里 $\alpha_t(s,a)$ 仅在 $(s,a)=(s_t,a_t)$ 时为正。因此第一项也意味着每个状态动作对必须被无限或足够多次访问。&lt;/p&gt;
&lt;h3&gt;2.5 用 Sarsa 学习最优策略&lt;/h3&gt;
&lt;p&gt;固定策略 Sarsa 只做策略评估。要学习最优策略，需要在每次动作价值更新后立刻改进策略，这就是广义策略迭代：&lt;/p&gt;
&lt;p&gt;$$
\text{局部策略评估}
\longleftrightarrow
\text{局部策略改进}.
$$&lt;/p&gt;
&lt;p&gt;对状态 $s_t$ 采用 $\epsilon$-greedy 改进。设：&lt;/p&gt;
&lt;p&gt;$$
a^*
\in
\arg\max_{a\in\mathcal A(s_t)}
q_{t+1}(s_t,a).
$$&lt;/p&gt;
&lt;p&gt;教材给出的概率写法为：&lt;/p&gt;
&lt;h1&gt;$$
\pi_{t+1}(a\mid s_t)&lt;/h1&gt;
&lt;p&gt;\begin{cases}
1-\dfrac{\epsilon}{\lvert\mathcal A(s_t)\rvert}
\left(\lvert\mathcal A(s_t)\rvert-1\right),
&amp;amp; a=a^&lt;em&gt;,\
\dfrac{\epsilon}{\lvert\mathcal A(s_t)\rvert},
&amp;amp; a\ne a^&lt;/em&gt;.
\end{cases}
$$&lt;/p&gt;
&lt;p&gt;这等价于：以 $1-\epsilon$ 选择贪婪动作，另以 $\epsilon$ 在所有动作上均匀探索。&lt;/p&gt;
&lt;h3&gt;2.6 Algorithm 7.1 - Sarsa 控制&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;初始化&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;对所有 $(s,a)$ 初始化 $q_0(s,a)$；&lt;/li&gt;
&lt;li&gt;选择学习率 $\alpha_t(s,a)&amp;gt;0$；&lt;/li&gt;
&lt;li&gt;从 $q_0$ 导出初始 $\epsilon$-greedy 策略 $\pi_0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;每个回合&lt;/strong&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从初始状态 $s_0$ 开始，按 $\pi_0(\cdot\mid s_0)$ 选择 $a_0$。&lt;/li&gt;
&lt;li&gt;当 $s_t$ 不是目标状态时：
&lt;ul&gt;
&lt;li&gt;执行 $a_t$，观察 $r_{t+1},s_{t+1}$；&lt;/li&gt;
&lt;li&gt;按当前策略 $\pi_t(\cdot\mid s_{t+1})$ 选择 $a_{t+1}$；&lt;/li&gt;
&lt;li&gt;用式 (7.12) 更新 $q(s_t,a_t)$；&lt;/li&gt;
&lt;li&gt;把 $s_t$ 的策略更新为关于新 $q$ 的 $\epsilon$-greedy 策略；&lt;/li&gt;
&lt;li&gt;令 $s_t\leftarrow s_{t+1}$，$a_t\leftarrow a_{t+1}$。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这里没有先把一个策略完全评估好再改进，而是把评估和改进交织执行。&lt;/p&gt;
&lt;h3&gt;2.7 Sarsa 实验&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-7-2-sarsa-example.png&quot; alt=&quot;Figure 7.2：Sarsa 网格世界示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;实验设置：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;所有回合从左上角开始，到蓝色目标格终止；&lt;/li&gt;
&lt;li&gt;$r_{\text{target}}=0$；&lt;/li&gt;
&lt;li&gt;$r_{\text{forbidden}}=r_{\text{boundary}}=-10$；&lt;/li&gt;
&lt;li&gt;$r_{\text{other}}=-1$；&lt;/li&gt;
&lt;li&gt;$\alpha=0.1$，$\epsilon=0.1$；&lt;/li&gt;
&lt;li&gt;$q_0(s,a)=0$，初始策略对 5 个动作均匀分布。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;结果解读：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;左图显示最终策略能把智能体从指定起点带到目标；&lt;/li&gt;
&lt;li&gt;总奖励随训练整体上升；&lt;/li&gt;
&lt;li&gt;回合长度随训练整体下降；&lt;/li&gt;
&lt;li&gt;偶发的长度尖峰和奖励骤降来自 $\epsilon$-greedy 的随机探索；&lt;/li&gt;
&lt;li&gt;未充分访问的状态不保证得到全局最优动作，因此“找到一条好路径”不等于“学到所有状态的最优策略”。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2.8 Box 7.4 - Expected Sarsa&lt;/h3&gt;
&lt;p&gt;Expected Sarsa 不再对下一动作 $A$ 取一次样本，而是在当前策略下对它求期望：&lt;/p&gt;
&lt;h2&gt;$$
\begin{aligned}
q_{t+1}(s_t,a_t)
&amp;amp;=
q_t(s_t,a_t)\
&amp;amp;\quad
-\alpha_t(s_t,a_t)
\left[
q_t(s_t,a_t)&lt;/h2&gt;
&lt;p&gt;\left(
r_{t+1}
+\gamma\mathbb E_{\pi_t}
\left[q_t(s_{t+1},A)\right]
\right)
\right].
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;h1&gt;$$
\mathbb E_{\pi_t}
\left[q_t(s_{t+1},A)\right]&lt;/h1&gt;
&lt;p&gt;\sum_a
\pi_t(a\mid s_{t+1})q_t(s_{t+1},a)
\doteq
v_t(s_{t+1}).
$$&lt;/p&gt;
&lt;p&gt;Expected Sarsa 对应的方程是：&lt;/p&gt;
&lt;h1&gt;$$
q_\pi(s,a)&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
R_{t+1}
+\gamma
\mathbb E_\pi
\left[
q_\pi(S_{t+1},A_{t+1})
\mid
S_{t+1}
\right]
\mid
S_t=s,A_t=a
\right].
\tag{7.15}
$$&lt;/p&gt;
&lt;p&gt;它与 Sarsa 的区别只在 TD 目标：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\overline q_t^{\text{Sarsa}}
&amp;amp;=
r_{t+1}+\gamma q_t(s_{t+1},a_{t+1}),\
\overline q_t^{\text{Expected Sarsa}}
&amp;amp;=
r_{t+1}
+\gamma
\sum_a\pi_t(a\mid s_{t+1})q_t(s_{t+1},a).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;求期望略增计算量，但消除了下一动作采样造成的随机性，通常能降低估计方差。&lt;/p&gt;
&lt;h2&gt;3. n 步 Sarsa&lt;/h2&gt;
&lt;h3&gt;3.1 从折扣回报的不同分解出发&lt;/h3&gt;
&lt;p&gt;动作价值定义：&lt;/p&gt;
&lt;h1&gt;$$
q_\pi(s,a)&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
G_t
\mid
S_t=s,A_t=a
\right].
\tag{7.16}
$$&lt;/p&gt;
&lt;p&gt;同一个回报可以按不同深度自举：&lt;/p&gt;
&lt;h1&gt;$$
G_t^{(1)}&lt;/h1&gt;
&lt;p&gt;R_{t+1}+\gamma q_\pi(S_{t+1},A_{t+1}),
$$&lt;/p&gt;
&lt;h1&gt;$$
G_t^{(2)}&lt;/h1&gt;
&lt;p&gt;R_{t+1}
+\gamma R_{t+2}
+\gamma^2q_\pi(S_{t+2},A_{t+2}),
$$&lt;/p&gt;
&lt;p&gt;一般地：&lt;/p&gt;
&lt;h1&gt;$$
G_t^{(n)}&lt;/h1&gt;
&lt;p&gt;\sum_{k=1}^{n}\gamma^{k-1}R_{t+k}
+\gamma^nq_\pi(S_{t+n},A_{t+n}).
$$&lt;/p&gt;
&lt;p&gt;若一直展开到回合结束：&lt;/p&gt;
&lt;h1&gt;$$
G_t^{(\infty)}&lt;/h1&gt;
&lt;p&gt;R_{t+1}
+\gamma R_{t+2}
+\gamma^2R_{t+3}
+\cdots.
$$&lt;/p&gt;
&lt;p&gt;这些上标只表示分解方式不同；在使用真实 $q_\pi$ 时，它们对同一 $G_t$ 的期望是一致的。&lt;/p&gt;
&lt;h3&gt;3.2 n 步更新&lt;/h3&gt;
&lt;p&gt;用样本目标：&lt;/p&gt;
&lt;h1&gt;$$
\overline q_t^{(n)}&lt;/h1&gt;
&lt;p&gt;r_{t+1}
+\gamma r_{t+2}
+\cdots
+\gamma^{n-1}r_{t+n}
+\gamma^nq_t(s_{t+n},a_{t+n}),
$$&lt;/p&gt;
&lt;p&gt;n 步 Sarsa 更新为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
q_{t+1}(s_t,a_t)
&amp;amp;=
q_t(s_t,a_t)\
&amp;amp;\quad
-\alpha_t(s_t,a_t)
\left[
q_t(s_t,a_t)-\overline q_t^{(n)}
\right].
\end{aligned}
\tag{7.17}
$$&lt;/p&gt;
&lt;p&gt;实际在时刻 $t$ 尚未获得 $r_{t+n},s_{t+n},a_{t+n}$，所以必须等到 $t+n$ 才更新 $(s_t,a_t)$。更准确的在线索引写成：&lt;/p&gt;
&lt;h2&gt;$$
\begin{aligned}
q_{t+n}(s_t,a_t)
&amp;amp;=
q_{t+n-1}(s_t,a_t)\
&amp;amp;\quad
-\alpha_{t+n-1}(s_t,a_t)
\Bigg[
q_{t+n-1}(s_t,a_t)\
&amp;amp;\qquad&lt;/h2&gt;
&lt;p&gt;\left(
r_{t+1}
+\gamma r_{t+2}
+\cdots
+\gamma^n q_{t+n-1}(s_{t+n},a_{t+n})
\right)
\Bigg].
\end{aligned}
$$&lt;/p&gt;
&lt;h3&gt;3.3 两个极端&lt;/h3&gt;
&lt;p&gt;当 $n=1$：&lt;/p&gt;
&lt;h1&gt;$$
\overline q_t^{(1)}&lt;/h1&gt;
&lt;p&gt;r_{t+1}+\gamma q_t(s_{t+1},a_{t+1}),
$$&lt;/p&gt;
&lt;p&gt;算法退化为单步 Sarsa。&lt;/p&gt;
&lt;p&gt;当 $n=\infty$ 且 $\alpha_t=1$：&lt;/p&gt;
&lt;p&gt;$$
q_{t+1}(s_t,a_t)
\doteq
r_{t+1}
+\gamma r_{t+2}
+\gamma^2r_{t+3}
+\cdots,
$$&lt;/p&gt;
&lt;p&gt;算法退化为 Monte Carlo 回报学习。&lt;/p&gt;
&lt;h3&gt;3.4 偏差、方差与延迟&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;$n$ 的选择&lt;/th&gt;
&lt;th&gt;自举程度&lt;/th&gt;
&lt;th&gt;更新延迟&lt;/th&gt;
&lt;th&gt;典型偏差&lt;/th&gt;
&lt;th&gt;典型方差&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$n=1$&lt;/td&gt;
&lt;td&gt;最强&lt;/td&gt;
&lt;td&gt;最短&lt;/td&gt;
&lt;td&gt;较大&lt;/td&gt;
&lt;td&gt;较低&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;中等 $n$&lt;/td&gt;
&lt;td&gt;中等&lt;/td&gt;
&lt;td&gt;中等&lt;/td&gt;
&lt;td&gt;中等&lt;/td&gt;
&lt;td&gt;中等&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;大 $n$&lt;/td&gt;
&lt;td&gt;较弱&lt;/td&gt;
&lt;td&gt;较长&lt;/td&gt;
&lt;td&gt;较小&lt;/td&gt;
&lt;td&gt;较高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;完整回合&lt;/td&gt;
&lt;td&gt;无自举&lt;/td&gt;
&lt;td&gt;到回合结束&lt;/td&gt;
&lt;td&gt;无自举偏差&lt;/td&gt;
&lt;td&gt;最高&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;本节给出的 n 步 Sarsa 仍是策略评估算法。若要学习最优策略，仍须像 Algorithm 7.1 那样加入策略改进。&lt;/p&gt;
&lt;h2&gt;4. 最优动作价值的 TD 学习：Q-learning&lt;/h2&gt;
&lt;h3&gt;4.1 Q-learning 更新&lt;/h3&gt;
&lt;p&gt;Q-learning 直接估计最优动作价值。其更新为：&lt;/p&gt;
&lt;h2&gt;$$
\begin{aligned}
q_{t+1}(s_t,a_t)
&amp;amp;=
q_t(s_t,a_t)\
&amp;amp;\quad
-\alpha_t(s_t,a_t)
\left[
q_t(s_t,a_t)&lt;/h2&gt;
&lt;p&gt;\left(
r_{t+1}
+\gamma
\max_{a\in\mathcal A(s_{t+1})}
q_t(s_{t+1},a)
\right)
\right],
\end{aligned}
\tag{7.18}
$$&lt;/p&gt;
&lt;p&gt;其余状态动作对保持不变。&lt;/p&gt;
&lt;p&gt;Q-learning 的 TD 目标是：&lt;/p&gt;
&lt;h1&gt;$$
\overline q_t^{\text{Q}}&lt;/h1&gt;
&lt;p&gt;r_{t+1}
+\gamma
\max_{a\in\mathcal A(s_{t+1})}
q_t(s_{t+1},a).
$$&lt;/p&gt;
&lt;p&gt;与 Sarsa 相比，Q-learning 不需要实际采样 $a_{t+1}$ 来构造目标，只需 $(s_t,a_t,r_{t+1},s_{t+1})$。&lt;/p&gt;
&lt;h3&gt;4.2 Q-learning 求解的方程&lt;/h3&gt;
&lt;p&gt;Q-learning 是对下式的随机逼近：&lt;/p&gt;
&lt;h1&gt;$$
q(s,a)&lt;/h1&gt;
&lt;p&gt;\mathbb E
\left[
R_{t+1}
+\gamma\max_{a&apos;}q(S_{t+1},a&apos;)
\mid
S_t=s,A_t=a
\right].
\tag{7.19}
$$&lt;/p&gt;
&lt;p&gt;这是动作价值形式的 Bellman 最优方程，其唯一解是 $q_*(s,a)$。&lt;/p&gt;
&lt;h3&gt;4.3 Box 7.5 - 从动作价值到 Bellman 最优方程&lt;/h3&gt;
&lt;p&gt;按期望定义展开式 (7.19)：&lt;/p&gt;
&lt;h1&gt;$$
q(s,a)&lt;/h1&gt;
&lt;p&gt;\sum_r p(r\mid s,a)r
+\gamma
\sum_{s&apos;}p(s&apos;\mid s,a)
\max_{a&apos;\in\mathcal A(s&apos;)}q(s&apos;,a&apos;).
$$&lt;/p&gt;
&lt;p&gt;两边对当前动作取最大，并定义：&lt;/p&gt;
&lt;p&gt;$$
v(s)
\doteq
\max_{a\in\mathcal A(s)}q(s,a),
$$&lt;/p&gt;
&lt;p&gt;得到：&lt;/p&gt;
&lt;h1&gt;$$
v(s)&lt;/h1&gt;
&lt;p&gt;\max_{a\in\mathcal A(s)}
\left[
\sum_r p(r\mid s,a)r
+\gamma
\sum_{s&apos;}p(s&apos;\mid s,a)v(s&apos;)
\right].
$$&lt;/p&gt;
&lt;p&gt;这正是状态价值形式的 Bellman 最优方程。因此式 (7.19) 的固定点对应最优动作价值和最优策略。&lt;/p&gt;
&lt;h3&gt;4.4 同策略与异策略&lt;/h3&gt;
&lt;p&gt;强化学习中要区分两类策略：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;行为策略&lt;/strong&gt; $\pi_b$：真正与环境交互、生成经验样本的策略；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;目标策略&lt;/strong&gt; $\pi_T$：算法试图评估或不断改进的策略。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;若 $\pi_b=\pi_T$，称为同策略学习（on-policy learning）；若二者可以不同，称为异策略学习（off-policy learning）。&lt;/p&gt;
&lt;h4&gt;Sarsa 为什么是同策略&lt;/h4&gt;
&lt;p&gt;Sarsa 的样本产生链是：&lt;/p&gt;
&lt;p&gt;$$
s_t
\xrightarrow{\pi_b}
a_t
\xrightarrow{\text{environment}}
(r_{t+1},s_{t+1})
\xrightarrow{\pi_b}
a_{t+1}.
$$&lt;/p&gt;
&lt;p&gt;它的目标包含 $q_t(s_{t+1},a_{t+1})$，而 $a_{t+1}$ 是由行为策略采样的。因此 Sarsa 实际评估的就是产生样本的策略，必须有：&lt;/p&gt;
&lt;p&gt;$$
\pi_T=\pi_b.
$$&lt;/p&gt;
&lt;h4&gt;Q-learning 为什么是异策略&lt;/h4&gt;
&lt;p&gt;Q-learning 的样本链只需要：&lt;/p&gt;
&lt;p&gt;$$
s_t
\xrightarrow{\pi_b}
a_t
\xrightarrow{\text{environment}}
(r_{t+1},s_{t+1}).
$$&lt;/p&gt;
&lt;p&gt;其目标在 $s_{t+1}$ 上直接做最大化：&lt;/p&gt;
&lt;p&gt;$$
\max_a q_t(s_{t+1},a),
$$&lt;/p&gt;
&lt;p&gt;不依赖行为策略实际会在下一状态采取什么动作。目标策略可以取关于 $q_t$ 的贪婪策略，而行为策略可以用另一种更强的探索策略。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 根本区别
Sarsa 解的是某个给定策略的 Bellman 方程，目标中的下一动作必须服从该策略；Q-learning 解的是 Bellman 最优方程，目标中的最大化已经隐含了贪婪目标策略，所以生成当前动作的行为策略可以不同。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Monte Carlo 的位置&lt;/h4&gt;
&lt;p&gt;本章前面介绍的普通 MC 控制也是同策略的：被评估和改进的策略同时负责生成完整回合。以后可借助重要性采样把同策略算法改造成异策略算法。&lt;/p&gt;
&lt;h3&gt;4.5 同策略/异策略与在线/离线不能混淆&lt;/h3&gt;
&lt;p&gt;这两组概念回答不同问题：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;维度&lt;/th&gt;
&lt;th&gt;第一种情形&lt;/th&gt;
&lt;th&gt;第二种情形&lt;/th&gt;
&lt;th&gt;判断问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;策略关系&lt;/td&gt;
&lt;td&gt;on-policy&lt;/td&gt;
&lt;td&gt;off-policy&lt;/td&gt;
&lt;td&gt;生成数据的策略是否等于被学习的策略？&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;数据时序&lt;/td&gt;
&lt;td&gt;online&lt;/td&gt;
&lt;td&gt;offline&lt;/td&gt;
&lt;td&gt;学习时是否仍在与环境交互？&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;在线学习：交互过程中边收集数据边更新；&lt;/li&gt;
&lt;li&gt;离线学习：用预先收集的数据更新，不再与环境交互；&lt;/li&gt;
&lt;li&gt;同策略算法可自然在线实现，但不能直接把其他策略产生的数据当作本策略数据；&lt;/li&gt;
&lt;li&gt;异策略算法既可在线，也可离线实现。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
“异策略”不自动等于“离线”。在线 Q-learning 可以一边用探索性行为策略交互，一边学习贪婪目标策略；离线 Q-learning 则先固定数据集，再从中学习。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.6 Algorithm 7.2 - Q-learning 的同策略实现&lt;/h3&gt;
&lt;p&gt;尽管 Q-learning 本质上支持异策略，它也可以让行为策略和目标策略相同，从而按同策略方式实现。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;初始化&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;初始化 $q_0(s,a)$；&lt;/li&gt;
&lt;li&gt;设学习率 $\alpha_t(s,a)&amp;gt;0$；&lt;/li&gt;
&lt;li&gt;从 $q_0$ 导出初始 $\epsilon$-greedy 策略 $\pi_0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;每个回合&lt;/strong&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;在 $s_t$ 按当前 $\epsilon$-greedy 策略生成 $a_t$。&lt;/li&gt;
&lt;li&gt;执行动作并得到 $r_{t+1},s_{t+1}$。&lt;/li&gt;
&lt;li&gt;用式 (7.18) 更新 $q(s_t,a_t)$。&lt;/li&gt;
&lt;li&gt;把 $s_t$ 的策略更新为关于新 $q$ 的 $\epsilon$-greedy 策略。&lt;/li&gt;
&lt;li&gt;转到 $s_{t+1}$，重复直到终止。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这里“同策略实现”只描述行为策略与维护的控制策略相同；Q-learning 的更新目标仍然是 Bellman 最优目标，而不是 Sarsa 的采样动作目标。&lt;/p&gt;
&lt;h3&gt;4.7 Algorithm 7.3 - Q-learning 的异策略实现&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;初始化&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;初始化 $q_0(s,a)$；&lt;/li&gt;
&lt;li&gt;指定行为策略 $\pi_b(a\mid s)$；&lt;/li&gt;
&lt;li&gt;设学习率 $\alpha_t(s,a)&amp;gt;0$；&lt;/li&gt;
&lt;li&gt;目标策略将由 $q_t$ 的贪婪动作给出。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;对行为策略产生的经验进行更新&lt;/strong&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;使用 $\pi_b$ 生成回合
$$
{s_0,a_0,r_1,s_1,a_1,r_2,\ldots}.
$$&lt;/li&gt;
&lt;li&gt;对回合内每个转移 $(s_t,a_t,r_{t+1},s_{t+1})$：
&lt;ul&gt;
&lt;li&gt;用式 (7.18) 更新 $q(s_t,a_t)$；&lt;/li&gt;
&lt;li&gt;选择一个
$$
a_t^*\in\arg\max_{a&apos;}q_{t+1}(s_t,a&apos;).
$$&lt;/li&gt;
&lt;li&gt;
&lt;h1&gt;把 $s_t$ 处的目标策略更新为：
$$
\pi_{T,t+1}(a\mid s_t)&lt;/h1&gt;
\begin{cases}
1,
&amp;amp;a=a_t^*,\
0,
&amp;amp;\text{otherwise}.
\end{cases}
$$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;目标策略不负责采样，因此不必为探索保留概率，可以直接贪婪。行为策略则应保证相关状态动作对得到充分覆盖。&lt;/p&gt;
&lt;h3&gt;4.8 Q-learning 的收敛条件&lt;/h3&gt;
&lt;p&gt;教材指出其证明与 Theorem 7.1 类似并省略。表格型 Q-learning 的基本要求仍包括：&lt;/p&gt;
&lt;p&gt;$$
\sum_t\alpha_t(s,a)=\infty,
\qquad
\sum_t\alpha_t^2(s,a)&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;以及所有需要学习的 $(s,a)$ 被充分访问、奖励有界、折扣率满足 $0\le\gamma&amp;lt;1$ 等。在这些条件下，Bellman 最优算子的压缩性把随机更新推向 $q_*$。&lt;/p&gt;
&lt;h3&gt;4.9 Q-learning 实验一：指定起点到目标&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-7-3-q-learning-example.png&quot; alt=&quot;Figure 7.3：Q-learning 网格世界示例&quot; /&gt;&lt;/p&gt;
&lt;p&gt;实验设置与 Sarsa 示例相同：&lt;/p&gt;
&lt;p&gt;$$
r_{\text{target}}=0,
\qquad
r_{\text{forbidden}}=r_{\text{boundary}}=-10,
\qquad
r_{\text{other}}=-1,
$$&lt;/p&gt;
&lt;p&gt;且 $\alpha=0.1,\epsilon=0.1$。结果同样显示：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;学到的策略可从指定起点抵达目标；&lt;/li&gt;
&lt;li&gt;总奖励整体提高；&lt;/li&gt;
&lt;li&gt;回合长度整体缩短；&lt;/li&gt;
&lt;li&gt;由于探索仍在进行，单个回合会有随机波动。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;比较 Figure 7.2 和 Figure 7.3 时，不应只凭单次曲线断言哪个算法绝对更好；二者使用的 TD 目标不同，对行为策略风险的反应也不同。&lt;/p&gt;
&lt;h3&gt;4.10 Q-learning 实验二：异策略学习所有状态&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-7-4-off-policy-q-learning.png&quot; alt=&quot;Figure 7.4：异策略 Q-learning 的完整实验&quot; /&gt;&lt;/p&gt;
&lt;p&gt;实验设置：&lt;/p&gt;
&lt;h1&gt;$$
r_{\text{boundary}}&lt;/h1&gt;
&lt;p&gt;r_{\text{forbidden}}
=-1,
\qquad
r_{\text{target}}=1,
\qquad
\gamma=0.9,
\qquad
\alpha=0.1.
$$&lt;/p&gt;
&lt;p&gt;子图含义：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;(a) 和 (b)：由基于模型的策略迭代求得的最优策略与最优状态价值，作为 ground truth；&lt;/li&gt;
&lt;li&gt;(c)：行为策略在每个状态对 5 个动作均匀采样，即每个动作概率为 $0.2$；&lt;/li&gt;
&lt;li&gt;(d)：该行为策略产生一条长为 $100000$ 步的持续轨迹，覆盖大量状态动作对；&lt;/li&gt;
&lt;li&gt;(e)：Q-learning 从这条异策略数据中学到的贪婪目标策略；&lt;/li&gt;
&lt;li&gt;(f)：$q_0(s,a)=0$ 时，状态价值均方根误差逐步趋近 0；&lt;/li&gt;
&lt;li&gt;(g)：$q_0(s,a)=10$ 时，初值较接近真值，约在 $10000$ 步内收敛；&lt;/li&gt;
&lt;li&gt;(h)：$q_0(s,a)=100$ 时，初值很差，仍能收敛但需要更多更新。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;学到的最优策略不必与基准图中的箭头完全相同，因为一个 MDP 可能存在多个具有相同最优价值的最优策略。&lt;/p&gt;
&lt;h3&gt;4.11 Q-learning 实验三：探索能力决定数据质量&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-7-5-behavior-policy-exploration.png&quot; alt=&quot;Figure 7.5：行为策略探索能力对 Q-learning 的影响&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Figure 7.5 的三行分别考察不同的行为策略。左列是行为策略，中列是它产生的 $100000$ 步轨迹，右列是状态价值均方根误差。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;均匀策略可视为 $\epsilon=1$，覆盖最充分，Figure 7.4 中误差快速归零；&lt;/li&gt;
&lt;li&gt;当 $\epsilon=0.5$ 时，覆盖变弱，误差只缓慢下降；&lt;/li&gt;
&lt;li&gt;当 $\epsilon=0.1$ 时，某些区域很少访问，误差几乎不下降；&lt;/li&gt;
&lt;li&gt;第三行虽也标为 $\epsilon=0.1$，但初始贪婪偏好不同，产生了另一种覆盖模式，仍不足以学好全局价值。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 异策略不等于不需要探索
Q-learning 允许目标策略和行为策略不同，却仍要求数据覆盖。行为策略若不访问某些状态动作对，算法就没有信息更新它们；“可从任意策略学习”必须理解为“可从任意具有充分覆盖的数据生成策略学习”。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;5. 统一视角&lt;/h2&gt;
&lt;h3&gt;5.1 统一更新骨架&lt;/h3&gt;
&lt;p&gt;动作价值 TD 算法都可以写成：&lt;/p&gt;
&lt;h1&gt;$$
q_{t+1}(s_t,a_t)&lt;/h1&gt;
&lt;p&gt;q_t(s_t,a_t)
-\alpha_t(s_t,a_t)
\left[
q_t(s_t,a_t)-\overline q_t
\right],
\tag{7.20}
$$&lt;/p&gt;
&lt;p&gt;其中 $\overline q_t$ 是具体算法的 TD 目标。统一误差为：&lt;/p&gt;
&lt;p&gt;$$
\delta_t
\doteq
q_t(s_t,a_t)-\overline q_t.
$$&lt;/p&gt;
&lt;h3&gt;5.2 Table 7.2 - TD 目标&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;算法&lt;/th&gt;
&lt;th&gt;TD 目标 $\overline q_t$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Sarsa&lt;/td&gt;
&lt;td&gt;$r_{t+1}+\gamma q_t(s_{t+1},a_{t+1})$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;n 步 Sarsa&lt;/td&gt;
&lt;td&gt;$r_{t+1}+\gamma r_{t+2}+\cdots+\gamma^n q_t(s_{t+n},a_{t+n})$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Q-learning&lt;/td&gt;
&lt;td&gt;$r_{t+1}+\gamma\max_a q_t(s_{t+1},a)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Monte Carlo&lt;/td&gt;
&lt;td&gt;$r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;MC 也能嵌入式 (7.20)：令 $\alpha_t(s_t,a_t)=1$，则新估计直接等于完整回报目标。&lt;/p&gt;
&lt;h3&gt;5.3 Table 7.2 - 所求方程&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;算法&lt;/th&gt;
&lt;th&gt;要求解的方程&lt;/th&gt;
&lt;th&gt;方程类型&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Sarsa&lt;/td&gt;
&lt;td&gt;$q_\pi(s,a)=\mathbb E[R_{t+1}+\gamma q_\pi(S_{t+1},A_{t+1})\mid S_t=s,A_t=a]$&lt;/td&gt;
&lt;td&gt;Bellman equation&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;n 步 Sarsa&lt;/td&gt;
&lt;td&gt;$q_\pi(s,a)=\mathbb E[R_{t+1}+\gamma R_{t+2}+\cdots+\gamma^n q_\pi(S_{t+n},A_{t+n})\mid S_t=s,A_t=a]$&lt;/td&gt;
&lt;td&gt;Bellman equation&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Q-learning&lt;/td&gt;
&lt;td&gt;$q(s,a)=\mathbb E[R_{t+1}+\gamma\max_{a&apos;}q(S_{t+1},a&apos;)\mid S_t=s,A_t=a]$&lt;/td&gt;
&lt;td&gt;Bellman optimality equation&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Monte Carlo&lt;/td&gt;
&lt;td&gt;$q_\pi(s,a)=\mathbb E[R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots\mid S_t=s,A_t=a]$&lt;/td&gt;
&lt;td&gt;Bellman equation&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;除 Q-learning 外，本章这些算法都在评估给定策略的 Bellman 方程；Q-learning 直接求 Bellman 最优方程。&lt;/p&gt;
&lt;h3&gt;5.4 四个算法的关系&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;算法&lt;/th&gt;
&lt;th&gt;目标中的未来信息&lt;/th&gt;
&lt;th&gt;是否自举&lt;/th&gt;
&lt;th&gt;默认策略关系&lt;/th&gt;
&lt;th&gt;直接求最优值&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Sarsa&lt;/td&gt;
&lt;td&gt;下一步实际动作&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;同策略&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Expected Sarsa&lt;/td&gt;
&lt;td&gt;下一步动作的策略期望&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;同策略&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;n 步 Sarsa&lt;/td&gt;
&lt;td&gt;$n$ 个奖励加末端估计&lt;/td&gt;
&lt;td&gt;是，除完整回合外&lt;/td&gt;
&lt;td&gt;同策略&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Q-learning&lt;/td&gt;
&lt;td&gt;下一状态的最大动作价值&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;异策略&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Monte Carlo&lt;/td&gt;
&lt;td&gt;完整实际回报&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;本章版本为同策略&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
从算子角度看，Sarsa 和 Expected Sarsa 采样或计算 $T_\pi q$，Q-learning 采样 $T_*q$。从数据角度看，n 步方法改变的是目标向未来展开的深度。两条轴彼此独立：一条决定求哪个固定点，另一条决定用多长的回报近似它。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;6. 本章总结&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;TD 学习无模型、增量式，并通过自举实现逐步更新。&lt;/li&gt;
&lt;li&gt;状态价值 TD 用 $r_{t+1}+\gamma v_t(s_{t+1})$ 逼近 Bellman 方程的期望。&lt;/li&gt;
&lt;li&gt;在充分访问、奖励有界和 Robbins-Monro 步长条件下，固定策略 TD 几乎必然收敛到 $v_\pi$。&lt;/li&gt;
&lt;li&gt;Sarsa 把状态价值 TD 推广到动作价值，用实际下一动作构造目标。&lt;/li&gt;
&lt;li&gt;把 Sarsa 的策略评估与 $\epsilon$-greedy 改进交织起来，可执行同策略控制。&lt;/li&gt;
&lt;li&gt;Expected Sarsa 对下一动作求期望，通常以更多计算换取更低方差。&lt;/li&gt;
&lt;li&gt;n 步 Sarsa 连通了单步 Sarsa 与完整回合 MC，体现偏差、方差和更新延迟的权衡。&lt;/li&gt;
&lt;li&gt;Q-learning 用下一状态的最大动作价值作为目标，直接逼近 $q_*$。&lt;/li&gt;
&lt;li&gt;Sarsa 是同策略算法；Q-learning 本质上是异策略算法，但可用同策略或异策略方式实现。&lt;/li&gt;
&lt;li&gt;异策略学习仍然要求行为策略提供充分覆盖；探索不足会使未访问部分无法学习。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;7. 教材 Q&amp;amp;A&lt;/h2&gt;
&lt;h3&gt;Q1. TD 中的 “TD” 是什么意思？&lt;/h3&gt;
&lt;p&gt;每个 TD 算法都有一个 TD 误差，用于表示新样本目标与当前估计之间的差异。因为这个差异联系相邻或不同时间步的估计，所以叫 temporal difference，即时序差分。&lt;/p&gt;
&lt;h3&gt;Q2. TD learning 中的 “learning” 是什么意思？&lt;/h3&gt;
&lt;p&gt;从数学角度看，learning 就是 estimation：从样本估计状态价值或动作价值，再根据估计值获得或改进策略。&lt;/p&gt;
&lt;h3&gt;Q3. Sarsa 只能评估给定策略，怎样学习最优策略？&lt;/h3&gt;
&lt;p&gt;把价值估计与策略改进交织起来。每更新一个状态动作价值，就把对应状态的策略更新成关于当前 $q$ 的 $\epsilon$-greedy 策略；新策略继续生成样本，再进行下一次估计。这就是广义策略迭代。&lt;/p&gt;
&lt;h3&gt;Q4. 为什么 Sarsa 要把策略更新为 $\epsilon$-greedy？&lt;/h3&gt;
&lt;p&gt;因为同一个策略既是被改进的目标策略，也是负责生成评估样本的行为策略。若完全贪婪，许多动作可能永远不被访问，无法保证充分探索。&lt;/p&gt;
&lt;h3&gt;Q5. 定理要求学习率衰减，为什么实践中常用小常数？&lt;/h3&gt;
&lt;p&gt;固定策略评估是平稳问题，衰减步长适合得到严格收敛。但控制过程中策略每轮都在改变，目标是非平稳的；若步长衰减得太小，估计无法及时跟踪新策略。小常数步长能持续适应变化，代价是在最终值附近保留小幅波动。&lt;/p&gt;
&lt;h3&gt;Q6. 应学习所有状态的最优策略，还是只学习一部分？&lt;/h3&gt;
&lt;p&gt;取决于任务。若只需从固定起点到固定目标，可以重点探索路径附近状态，数据要求较低；但没有覆盖所有状态动作对，就不能保证路径是全局最优。若目标是得到完整最优策略，则需要全局充分探索。&lt;/p&gt;
&lt;h3&gt;Q7. 为什么 Q-learning 是异策略，而本章其他 TD 算法是同策略？&lt;/h3&gt;
&lt;p&gt;Q-learning 求解 Bellman 最优方程，其目标通过 $\max_a q(s&apos;,a)$ 隐含贪婪目标策略，不需要下一动作来自行为策略。Sarsa 等算法求解给定策略的 Bellman 方程，目标中的动作必须服从被评估策略，因此行为策略和目标策略相同。&lt;/p&gt;
&lt;h3&gt;Q8. 为什么异策略 Q-learning 的目标策略用 greedy 而不是 $\epsilon$-greedy？&lt;/h3&gt;
&lt;p&gt;目标策略不负责生成经验，所以不承担探索任务。探索由行为策略负责，目标策略可以直接取关于当前动作价值的贪婪策略。&lt;/p&gt;
&lt;h2&gt;8. 一页式复习&lt;/h2&gt;
&lt;h3&gt;8.1 四个核心目标&lt;/h3&gt;
&lt;p&gt;$$
\begin{aligned}
\text{TD state value:}\quad
&amp;amp;r_{t+1}+\gamma v_t(s_{t+1}),\
\text{Sarsa:}\quad
&amp;amp;r_{t+1}+\gamma q_t(s_{t+1},a_{t+1}),\
\text{Expected Sarsa:}\quad
&amp;amp;r_{t+1}+\gamma\sum_a\pi_t(a\mid s_{t+1})q_t(s_{t+1},a),\
\text{Q-learning:}\quad
&amp;amp;r_{t+1}+\gamma\max_a q_t(s_{t+1},a).
\end{aligned}
$$&lt;/p&gt;
&lt;h3&gt;8.2 统一更新&lt;/h3&gt;
&lt;p&gt;教材符号下：&lt;/p&gt;
&lt;h1&gt;$$
\text{new estimate}&lt;/h1&gt;
&lt;h2&gt;\text{current estimate}&lt;/h2&gt;
&lt;h2&gt;\alpha
\left(
\text{current estimate}&lt;/h2&gt;
&lt;p&gt;\text{target}
\right).
$$&lt;/p&gt;
&lt;h3&gt;8.3 收敛条件&lt;/h3&gt;
&lt;p&gt;对每个需要学习的状态或状态动作对：&lt;/p&gt;
&lt;p&gt;$$
\sum_t\alpha_t=\infty,
\qquad
\sum_t\alpha_t^2&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;并保证充分访问、奖励有界和 $0\le\gamma&amp;lt;1$。&lt;/p&gt;
&lt;h3&gt;8.4 算法定位&lt;/h3&gt;
&lt;p&gt;$$
\begin{aligned}
\text{Sarsa}
&amp;amp;=\text{sampled next action}+\text{on-policy},\
\text{Expected Sarsa}
&amp;amp;=\text{expected next action}+\text{on-policy},\
\text{Q-learning}
&amp;amp;=\text{greedy next value}+\text{off-policy},\
\text{MC}
&amp;amp;=\text{complete return}+\text{no bootstrap}.
\end{aligned}
$$&lt;/p&gt;
&lt;h3&gt;8.5 n 步连续谱&lt;/h3&gt;
&lt;p&gt;$$
\text{Sarsa}
\xleftarrow{\ n=1\ }
n\text{ 步 Sarsa}
\xrightarrow{\ n\to\infty\ }
\text{Monte Carlo}.
$$&lt;/p&gt;
&lt;h2&gt;9. 公式清单&lt;/h2&gt;
&lt;h3&gt;9.1 状态价值 TD&lt;/h3&gt;
&lt;h1&gt;$$
v_{t+1}(s_t)&lt;/h1&gt;
&lt;h2&gt;v_t(s_t)
-\alpha_t(s_t)
\left[
v_t(s_t)&lt;/h2&gt;
&lt;p&gt;\left(r_{t+1}+\gamma v_t(s_{t+1})\right)
\right].
$$&lt;/p&gt;
&lt;h3&gt;9.2 Sarsa&lt;/h3&gt;
&lt;h1&gt;$$
q_{t+1}(s_t,a_t)&lt;/h1&gt;
&lt;h2&gt;q_t(s_t,a_t)
-\alpha_t(s_t,a_t)
\left[
q_t(s_t,a_t)&lt;/h2&gt;
&lt;p&gt;\left(r_{t+1}+\gamma q_t(s_{t+1},a_{t+1})\right)
\right].
$$&lt;/p&gt;
&lt;h3&gt;9.3 Expected Sarsa&lt;/h3&gt;
&lt;h1&gt;$$
q_{t+1}(s_t,a_t)&lt;/h1&gt;
&lt;h2&gt;q_t(s_t,a_t)
-\alpha_t(s_t,a_t)
\left[
q_t(s_t,a_t)&lt;/h2&gt;
&lt;p&gt;\left(
r_{t+1}
+\gamma\sum_a\pi_t(a\mid s_{t+1})q_t(s_{t+1},a)
\right)
\right].
$$&lt;/p&gt;
&lt;h3&gt;9.4 n 步 Sarsa&lt;/h3&gt;
&lt;h1&gt;$$
\overline q_t^{(n)}&lt;/h1&gt;
&lt;p&gt;\sum_{k=1}^{n}\gamma^{k-1}r_{t+k}
+\gamma^n q_t(s_{t+n},a_{t+n}).
$$&lt;/p&gt;
&lt;h3&gt;9.5 Q-learning&lt;/h3&gt;
&lt;h1&gt;$$
q_{t+1}(s_t,a_t)&lt;/h1&gt;
&lt;h2&gt;q_t(s_t,a_t)
-\alpha_t(s_t,a_t)
\left[
q_t(s_t,a_t)&lt;/h2&gt;
&lt;p&gt;\left(
r_{t+1}
+\gamma\max_a q_t(s_{t+1},a)
\right)
\right].
$$&lt;/p&gt;
&lt;h3&gt;9.6 Bellman 与 Bellman 最优方程&lt;/h3&gt;
&lt;h1&gt;$$
q_\pi(s,a)&lt;/h1&gt;
&lt;p&gt;\mathbb E_\pi
\left[
R_{t+1}
+\gamma q_\pi(S_{t+1},A_{t+1})
\mid
S_t=s,A_t=a
\right],
$$&lt;/p&gt;
&lt;h1&gt;$$
q_*(s,a)&lt;/h1&gt;
&lt;p&gt;\mathbb E
\left[
R_{t+1}
+\gamma\max_{a&apos;}q_*(S_{t+1},a&apos;)
\mid
S_t=s,A_t=a
\right].
$$&lt;/p&gt;
&lt;h2&gt;10. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$S_t,s_t$&lt;/td&gt;
&lt;td&gt;时刻 $t$ 的随机状态及其观测值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$A_t,a_t$&lt;/td&gt;
&lt;td&gt;时刻 $t$ 的随机动作及其观测值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$R_{t+1},r_{t+1}$&lt;/td&gt;
&lt;td&gt;从时刻 $t$ 到 $t+1$ 的随机奖励及其观测值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$G_t$&lt;/td&gt;
&lt;td&gt;从时刻 $t$ 开始的折扣回报&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\gamma$&lt;/td&gt;
&lt;td&gt;折扣率，通常 $0\le\gamma&amp;lt;1$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi$&lt;/td&gt;
&lt;td&gt;给定策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_b$&lt;/td&gt;
&lt;td&gt;行为策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi_T$&lt;/td&gt;
&lt;td&gt;目标策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi(s)$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 的真实状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi(s,a)$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 的真实动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_*(s,a)$&lt;/td&gt;
&lt;td&gt;最优动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_t,q_t$&lt;/td&gt;
&lt;td&gt;时刻 $t$ 的价值估计&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\alpha_t$&lt;/td&gt;
&lt;td&gt;学习率或步长&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\overline v_t,\overline q_t$&lt;/td&gt;
&lt;td&gt;TD 目标&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\delta_t$&lt;/td&gt;
&lt;td&gt;教材约定下的“当前估计减目标”&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$G_t^{(n)}$&lt;/td&gt;
&lt;td&gt;向前展开 $n$ 步后再自举的回报分解&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathcal S,\mathcal A(s)$&lt;/td&gt;
&lt;td&gt;状态集合及状态 $s$ 的动作集合&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;11. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;术语&lt;/th&gt;
&lt;th&gt;英文&lt;/th&gt;
&lt;th&gt;核心含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;时序差分学习&lt;/td&gt;
&lt;td&gt;temporal-difference learning&lt;/td&gt;
&lt;td&gt;用相邻时间步的估计差异进行增量学习&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TD 目标&lt;/td&gt;
&lt;td&gt;TD target&lt;/td&gt;
&lt;td&gt;当前估计要靠近的单样本或多步目标&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TD 误差&lt;/td&gt;
&lt;td&gt;TD error&lt;/td&gt;
&lt;td&gt;当前估计与 TD 目标之差；需留意符号约定&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;自举&lt;/td&gt;
&lt;td&gt;bootstrapping&lt;/td&gt;
&lt;td&gt;用已有价值估计更新另一个价值估计&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Sarsa&lt;/td&gt;
&lt;td&gt;state-action-reward-state-action&lt;/td&gt;
&lt;td&gt;用实际下一动作构造动作价值 TD 目标&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Expected Sarsa&lt;/td&gt;
&lt;td&gt;Expected Sarsa&lt;/td&gt;
&lt;td&gt;对下一动作价值按策略求期望&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Q-learning&lt;/td&gt;
&lt;td&gt;Q-learning&lt;/td&gt;
&lt;td&gt;用下一状态最大动作价值逼近最优动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;同策略&lt;/td&gt;
&lt;td&gt;on-policy&lt;/td&gt;
&lt;td&gt;行为策略与目标策略相同&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;异策略&lt;/td&gt;
&lt;td&gt;off-policy&lt;/td&gt;
&lt;td&gt;行为策略与目标策略可以不同&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;在线学习&lt;/td&gt;
&lt;td&gt;online learning&lt;/td&gt;
&lt;td&gt;与环境交互的同时更新&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;离线学习&lt;/td&gt;
&lt;td&gt;offline learning&lt;/td&gt;
&lt;td&gt;从预先收集的数据中更新&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;充分覆盖&lt;/td&gt;
&lt;td&gt;sufficient coverage&lt;/td&gt;
&lt;td&gt;需要学习的状态动作对被访问足够多次&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;广义策略迭代&lt;/td&gt;
&lt;td&gt;generalized policy iteration&lt;/td&gt;
&lt;td&gt;策略评估与策略改进交织进行&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;12. 常见误区&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;把教材的 TD 误差符号抄反。&lt;/strong&gt; 本教材用当前估计减目标，所以更新前是减号。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认为 TD 每一步都更接近真值。&lt;/strong&gt; 它只保证在合适步长下更接近本次随机目标。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认为 Sarsa 的名字只包含四个量。&lt;/strong&gt; 两个 state 和两个 action 分属相邻时刻，完整五元组还有 reward。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认为 Q-learning 的行为策略必须贪婪。&lt;/strong&gt; 贪婪的是目标策略；行为策略通常应更具探索性。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;把 off-policy 等同于 offline。&lt;/strong&gt; 一个描述策略关系，一个描述数据收集时序。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认为异策略可以忽略覆盖。&lt;/strong&gt; 没有访问的数据区域无法被可靠学习。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认为 $n$ 越大总是越好。&lt;/strong&gt; 较大 $n$ 减少自举偏差，但增加方差、存储和更新延迟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认为常数步长满足几乎必然收敛定理。&lt;/strong&gt; 它不满足平方可和条件，通常只在目标附近持续波动。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认为指定起点找到好路径就等于全局最优。&lt;/strong&gt; 未充分探索的状态可能仍有更优路径。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认为最优策略只有一个。&lt;/strong&gt; 多个动作可能有相同最优价值，从而存在多个最优策略。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;13. 自测题&lt;/h2&gt;
&lt;h3&gt;13.1 概念题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;TD 相比 MC 为什么可以处理持续式任务？&lt;/li&gt;
&lt;li&gt;bootstrapping 在状态价值 TD、Sarsa 和 Q-learning 中分别出现在哪里？&lt;/li&gt;
&lt;li&gt;Expected Sarsa 为什么通常比 Sarsa 方差更低？&lt;/li&gt;
&lt;li&gt;Q-learning 为什么不需要在构造目标前采样 $a_{t+1}$？&lt;/li&gt;
&lt;li&gt;充分探索与异策略学习之间是什么关系？&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;13.2 判断与计算&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;若教材定义 $\delta_t=v_t(s_t)-[r_{t+1}+\gamma v_t(s_{t+1})]$，更新应写成 $v_{t+1}=v_t+\alpha_t\delta_t$。判断正误。&lt;/li&gt;
&lt;li&gt;给定 $q_t(s_t,a_t)=4$，$r_{t+1}=2$，$\gamma=0.9$，$q_t(s_{t+1},a_{t+1})=5$，$\alpha=0.1$，计算 Sarsa 更新后的值。&lt;/li&gt;
&lt;li&gt;若下一状态三个动作的价值为 $(3,5,4)$，策略概率为 $(0.2,0.5,0.3)$，计算 Expected Sarsa 的下一状态期望价值。&lt;/li&gt;
&lt;li&gt;若行为策略与目标策略不同，但数据仍在边交互边更新，这是 off-policy online 还是 off-policy offline？&lt;/li&gt;
&lt;li&gt;序列 $\alpha_t=1/(t+1)$ 是否满足两个 Robbins-Monro 求和条件？&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;13.3 推导与思考&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;从 Bellman 方程推导状态价值 TD 的单样本更新。&lt;/li&gt;
&lt;li&gt;说明 n 步 Sarsa 在 $n=1$ 与完整回合时分别如何退化。&lt;/li&gt;
&lt;li&gt;从 Q-learning 的动作价值方程推出状态价值 Bellman 最优方程。&lt;/li&gt;
&lt;li&gt;解释为什么行为策略探索性减弱会导致 Figure 7.5 中误差下降变慢。&lt;/li&gt;
&lt;li&gt;比较“减小 $\epsilon$”与“减小 $\alpha$”对训练后期波动的不同作用。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;TD 不需要等待完整回合，只需一个转移即可更新，因此可用于没有自然终止点的持续任务。&lt;/li&gt;
&lt;li&gt;三者分别使用 $v_t(s_{t+1})$、$q_t(s_{t+1},a_{t+1})$ 和 $\max_a q_t(s_{t+1},a)$ 自举。&lt;/li&gt;
&lt;li&gt;Expected Sarsa 对下一动作求精确策略期望，消除了采样 $A_{t+1}$ 带来的随机性。&lt;/li&gt;
&lt;li&gt;Q-learning 的目标直接对下一状态动作价值取最大，不依赖实际下一动作。&lt;/li&gt;
&lt;li&gt;异策略允许策略不同，但仍要求行为策略覆盖需要估计的状态动作对。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;判断与计算：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;错。教材的误差是当前值减目标，更新应减去 $\alpha_t\delta_t$。&lt;/li&gt;
&lt;li&gt;TD 目标为 $2+0.9\times5=6.5$，教材误差为 $4-6.5=-2.5$，新值为 $4-0.1(-2.5)=4.25$。&lt;/li&gt;
&lt;li&gt;期望为 $0.2\times3+0.5\times5+0.3\times4=4.3$。&lt;/li&gt;
&lt;li&gt;off-policy online。&lt;/li&gt;
&lt;li&gt;满足：调和级数发散，而平方和收敛。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;推导题应包含的关键点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;把 Bellman 期望移到等号一侧形成求根问题，用单个转移替代期望，再用当前下一状态估计替代未知真值。&lt;/li&gt;
&lt;li&gt;$n=1$ 时目标只有一个奖励加一步自举；完整回合时没有末端自举项，得到 MC 回报。&lt;/li&gt;
&lt;li&gt;对动作价值方程两边对当前动作取最大，并定义 $v(s)=\max_a q(s,a)$。&lt;/li&gt;
&lt;li&gt;探索减弱造成状态动作覆盖不足，许多表项几乎没有更新。&lt;/li&gt;
&lt;li&gt;减小 $\epsilon$ 降低的是行为随机性和探索频率；减小 $\alpha$ 降低的是单次估计更新幅度，二者作用对象不同。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>Chapter 8 - Value Function Methods</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-8-value-function-methods/chapter-8---value-function-methods/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-8-value-function-methods/chapter-8---value-function-methods/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 8 - Value Function Methods&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
前几章把每个状态或状态-动作对的价值存进表格。本章把表格替换为带参数的函数，用较短的参数向量表示大量价值。这样既节省存储，又能把一个样本的信息泛化到相似状态，但也引入了近似误差、特征设计和优化稳定性问题。全章的主线是：先把策略评估写成加权最小二乘问题，再把 TD、Sarsa 和 Q-learning 改写为参数更新，随后在线性情形中分析收敛目标，最后用神经网络、目标网络和经验回放得到 deep Q-learning。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识地图&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-1-roadmap.png&quot; alt=&quot;Figure 8.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Chapter 8 是从表格型强化学习走向现代深度强化学习的桥梁：&lt;/p&gt;
&lt;p&gt;$$
\text{表格型 TD}
\longrightarrow
\text{线性函数近似}
\longrightarrow
\text{状态价值与动作价值近似}
\longrightarrow
\text{神经网络近似}
\longrightarrow
\text{Deep Q-learning}.
$$&lt;/p&gt;
&lt;p&gt;本章要解决四个层次的问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;表示&lt;/strong&gt;：如何用 $\hat v(s,w)$ 或 $\hat q(s,a,w)$ 代替价值表？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;学习&lt;/strong&gt;：如何仅依靠样本更新参数 $w$？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;理论&lt;/strong&gt;：线性 TD 到底收敛到什么，它最小化什么误差？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;工程&lt;/strong&gt;：非线性神经网络下，如何借助目标网络和经验回放稳定训练？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 一句话总览
函数近似把“改一个表项”变成“沿梯度改参数”；参数是共享的，因此一次更新会同时改变许多状态的估计，这既是泛化能力的来源，也是训练不稳定和近似偏差的来源。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;1. 从表格到函数&lt;/h2&gt;
&lt;h3&gt;1.1 两种表示方式&lt;/h3&gt;
&lt;p&gt;若状态集合为 ${s_i}_{i=1}^n$，表格法直接保存：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;状态&lt;/th&gt;
&lt;th&gt;$s_1$&lt;/th&gt;
&lt;th&gt;$s_2$&lt;/th&gt;
&lt;th&gt;$\cdots$&lt;/th&gt;
&lt;th&gt;$s_n$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;估计值&lt;/td&gt;
&lt;td&gt;$\hat v(s_1)$&lt;/td&gt;
&lt;td&gt;$\hat v(s_2)$&lt;/td&gt;
&lt;td&gt;$\cdots$&lt;/td&gt;
&lt;td&gt;$\hat v(s_n)$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;函数近似不保存每一个值，而是选定特征 $\phi(s)$，用参数 $w$ 计算价值。例如一阶函数：&lt;/p&gt;
&lt;h1&gt;$$
\hat v(s,w)
=as+b&lt;/h1&gt;
&lt;p&gt;\begin{bmatrix}s&amp;amp;1\end{bmatrix}
\begin{bmatrix}a\b\end{bmatrix}
=\phi^{T}(s)w.
\tag{8.1}
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-2-function-approximation.png&quot; alt=&quot;Figure 8.2：用直线近似离散状态价值&quot; /&gt;&lt;/p&gt;
&lt;p&gt;这里的“线性函数近似”是指 &lt;strong&gt;关于参数 $w$ 线性&lt;/strong&gt;，并不要求关于状态 $s$ 线性。二阶多项式仍是线性函数近似：&lt;/p&gt;
&lt;h1&gt;$$
\hat v(s,w)
=as^2+bs+c&lt;/h1&gt;
&lt;p&gt;\begin{bmatrix}s^2&amp;amp;s&amp;amp;1\end{bmatrix}
\begin{bmatrix}a\b\c\end{bmatrix}
=\phi^{T}(s)w.
\tag{8.2}
$$&lt;/p&gt;
&lt;h3&gt;1.2 读取、更新与泛化&lt;/h3&gt;
&lt;p&gt;表格法读取一个值只需索引表项；函数法需要输入 $s$，计算 $\phi(s)$ 并执行一次函数前向计算：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-3-value-retrieval.png&quot; alt=&quot;Figure 8.3：函数表示下的价值读取&quot; /&gt;&lt;/p&gt;
&lt;p&gt;两种方法的核心差异如下：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;维度&lt;/th&gt;
&lt;th&gt;表格法&lt;/th&gt;
&lt;th&gt;函数近似法&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;存储&lt;/td&gt;
&lt;td&gt;保存约 $\lvert\mathcal S\rvert$ 个值&lt;/td&gt;
&lt;td&gt;保存通常低维的参数 $w$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;读取&lt;/td&gt;
&lt;td&gt;直接索引&lt;/td&gt;
&lt;td&gt;计算 $\hat v(s,w)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;更新&lt;/td&gt;
&lt;td&gt;直接改一个表项&lt;/td&gt;
&lt;td&gt;改参数 $w$，间接改变价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;泛化&lt;/td&gt;
&lt;td&gt;一个表项通常不影响其他状态&lt;/td&gt;
&lt;td&gt;共享参数使多个状态同时变化&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;误差&lt;/td&gt;
&lt;td&gt;有限表格可精确表示&lt;/td&gt;
&lt;td&gt;受函数族表达能力限制&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;连续状态&lt;/td&gt;
&lt;td&gt;无法直接穷举&lt;/td&gt;
&lt;td&gt;可由特征或神经网络处理&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-4-table-vs-function-update.png&quot; alt=&quot;Figure 8.4：表格更新与函数近似更新的影响范围&quot; /&gt;&lt;/p&gt;
&lt;p&gt;图 8.4 展示了泛化的机制：为改善 $s_3$ 的估计而改变 $w$ 后，$s_1,s_2$ 的估计也可能变化。若特征表达了合理的相似性，这种共享可显著提高样本效率；若特征不合适，则更新也可能错误地干扰其他状态。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解：压缩与偏差
用 $m$ 维参数表示 $n$ 个价值，本质上把价值向量限制在一个低维函数族中。当 $m\ll n$ 时通常能节省存储并获得泛化，但真实价值未必属于该函数族，因此会产生无法靠更多样本消除的近似误差。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;1.3 已知真实价值时的最小二乘&lt;/h3&gt;
&lt;p&gt;若暂时假设真实价值向量 $v_\pi$ 已知，且第 $i$ 行为 $\phi^T(s_i)$ 的特征矩阵为 $\Phi$，可以直接解：&lt;/p&gt;
&lt;p&gt;$$
J_1(w)
=\sum_i\left(\hat v(s_i,w)-v_\pi(s_i)\right)^2
=\lVert\Phi w-v_\pi\rVert_2^2.
$$&lt;/p&gt;
&lt;p&gt;当 $\Phi^T\Phi$ 可逆时，普通最小二乘解为：&lt;/p&gt;
&lt;p&gt;$$
w^*=(\Phi^T\Phi)^{-1}\Phi^T v_\pi.
$$&lt;/p&gt;
&lt;p&gt;强化学习的困难恰在于 $v_\pi$ 未知，只能用交互样本构造替代目标。&lt;/p&gt;
&lt;h2&gt;2. 状态分布与目标函数&lt;/h2&gt;
&lt;h3&gt;2.1 均方价值误差&lt;/h3&gt;
&lt;p&gt;给定策略 $\pi$，最自然的目标是最小化真实价值与估计价值之间的均方误差：&lt;/p&gt;
&lt;p&gt;$$
J(w)
=\mathbb E\left[
\left(v_\pi(S)-\hat v(S,w)\right)^2
\right].
\tag{8.3}
$$&lt;/p&gt;
&lt;p&gt;期望必须基于某个状态分布。若所有状态等权：&lt;/p&gt;
&lt;p&gt;$$
J(w)
=\frac{1}{\lvert\mathcal S\rvert}
\sum_{s\in\mathcal S}
\left(v_\pi(s)-\hat v(s,w)\right)^2.
\tag{8.4}
$$&lt;/p&gt;
&lt;p&gt;更符合策略实际访问频率的选择是稳态分布 $d_\pi$：&lt;/p&gt;
&lt;p&gt;$$
J(w)
=\sum_{s\in\mathcal S}d_\pi(s)
\left(v_\pi(s)-\hat v(s,w)\right)^2.
\tag{8.5}
$$&lt;/p&gt;
&lt;p&gt;这表示经常访问的状态在目标函数中权重更高。&lt;/p&gt;
&lt;h3&gt;2.2 Box 8.1：稳态分布&lt;/h3&gt;
&lt;p&gt;固定策略 $\pi$ 后，MDP 变为转移矩阵 $P_\pi$ 所描述的马尔可夫链。矩阵 $P_\pi^k$ 的第 $(i,j)$ 个元素是从 $s_i$ 经 $k$ 步到达 $s_j$ 的概率：&lt;/p&gt;
&lt;p&gt;$$
\left[P_\pi^k\right]&lt;em&gt;{ij}=p&lt;/em&gt;{ij}^{(k)}.
$$&lt;/p&gt;
&lt;p&gt;若初始分布为 $d_0$，第 $k$ 步访问 $s_i$ 的概率为：&lt;/p&gt;
&lt;p&gt;$$
d_k(s_i)
=\sum_jd_0(s_j)\left[P_\pi^k\right]_{ji}.
\tag{8.6}
$$&lt;/p&gt;
&lt;p&gt;向量形式为：&lt;/p&gt;
&lt;p&gt;$$
d_k^T=d_0^TP_\pi^k.
\tag{8.7}
$$&lt;/p&gt;
&lt;p&gt;对正则马尔可夫链，存在唯一稳态分布 $d_\pi$，且：&lt;/p&gt;
&lt;p&gt;$$
\lim_{k\to\infty}P_\pi^k
=\mathbf 1_n d_\pi^T.
\tag{8.8}
$$&lt;/p&gt;
&lt;p&gt;于是无论初始分布是什么：&lt;/p&gt;
&lt;p&gt;$$
\lim_{k\to\infty}d_k^T
=d_0^T\mathbf 1_n d_\pi^T
=d_\pi^T.
\tag{8.9}
$$&lt;/p&gt;
&lt;p&gt;稳态分布满足：&lt;/p&gt;
&lt;p&gt;$$
d_\pi^T=d_\pi^TP_\pi,
\qquad
d_\pi^T\mathbf 1_n=1.
\tag{8.10}
$$&lt;/p&gt;
&lt;p&gt;也就是说，$d_\pi^T$ 是 $P_\pi$ 对应特征值 $1$ 的左特征向量，并归一化为概率分布。&lt;/p&gt;
&lt;p&gt;相关概念：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;可达&lt;/strong&gt;：若存在某个 $k$ 使 $p_{ij}^{(k)}&amp;gt;0$，则 $s_j$ 可由 $s_i$ 到达。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;互通&lt;/strong&gt;：$s_i$ 可达 $s_j$ 且 $s_j$ 也可达 $s_i$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;不可约&lt;/strong&gt;：任意两状态互通。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;正则&lt;/strong&gt;：存在同一个 $k$，使 $P_\pi^k$ 的所有元素严格为正。&lt;/li&gt;
&lt;li&gt;正则蕴含不可约；不可约链若存在适当的非周期性条件，例如教材示例中每个状态可自转移，则可得到正则性。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;探索性策略通常让更多动作具有正概率，从而更容易使诱导的马尔可夫链不可约或正则。&lt;/p&gt;
&lt;h3&gt;2.3 稳态分布示例&lt;/h3&gt;
&lt;p&gt;教材示例的转移矩阵为：&lt;/p&gt;
&lt;p&gt;$$
P_\pi^T=
\begin{bmatrix}
0.3&amp;amp;0.1&amp;amp;0.1&amp;amp;0\
0.1&amp;amp;0.3&amp;amp;0&amp;amp;0.1\
0.6&amp;amp;0&amp;amp;0.3&amp;amp;0.1\
0&amp;amp;0.6&amp;amp;0.6&amp;amp;0.8
\end{bmatrix}.
$$&lt;/p&gt;
&lt;p&gt;其特征值为 ${-0.0449,0.3,0.4449,1}$，由特征值 $1$ 对应的左特征向量得到：&lt;/p&gt;
&lt;p&gt;$$
d_\pi=
\begin{bmatrix}
0.0345\0.1084\0.1330\0.7241
\end{bmatrix}.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-5-stationary-distribution.png&quot; alt=&quot;Figure 8.5：策略的长期访问比例与理论稳态分布&quot; /&gt;&lt;/p&gt;
&lt;p&gt;图 8.5 中，1000 步轨迹的经验访问比例逐渐接近理论值。轨迹越长，频率估计通常越稳定。&lt;/p&gt;
&lt;h2&gt;3. 基于函数近似的状态价值 TD&lt;/h2&gt;
&lt;h3&gt;3.1 从梯度下降到样本更新&lt;/h3&gt;
&lt;p&gt;对式 (8.3) 求负梯度并把常数 $2$ 吸收到步长中：&lt;/p&gt;
&lt;p&gt;$$
w_{k+1}
=w_k+2\alpha_k
\mathbb E\left[
\left(v_\pi(S)-\hat v(S,w_k)\right)
\nabla_w\hat v(S,w_k)
\right].
\tag{8.11}
$$&lt;/p&gt;
&lt;p&gt;以样本 $s_t$ 代替期望可得随机梯度形式：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t+\alpha_t
\left[v_\pi(s_t)-\hat v(s_t,w_t)\right]
\nabla_w\hat v(s_t,w_t).
\tag{8.12}
$$&lt;/p&gt;
&lt;p&gt;但 $v_\pi(s_t)$ 仍未知。可以有两种替代：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Monte Carlo：用完整回报 $g_t$ 替代 $v_\pi(s_t)$；&lt;/li&gt;
&lt;li&gt;TD：用一步目标 $r_{t+1}+\gamma\hat v(s_{t+1},w_t)$ 替代。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此得到一般的函数近似 TD 更新：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t+\alpha_t
\left[
r_{t+1}+\gamma\hat v(s_{t+1},w_t)-\hat v(s_t,w_t)
\right]
\nabla_w\hat v(s_t,w_t).
\tag{8.13}
$$&lt;/p&gt;
&lt;p&gt;定义 TD 误差：&lt;/p&gt;
&lt;p&gt;$$
\delta_t
=r_{t+1}+\gamma\hat v(s_{t+1},w_t)-\hat v(s_t,w_t),
$$&lt;/p&gt;
&lt;p&gt;则参数更新只有一个骨架：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}=w_t+\alpha_t\delta_t\nabla_w\hat v(s_t,w_t).
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解：为什么常称为半梯度
在 TD 更新中，目标本身含有当前参数产生的下一状态估计，但算法只对当前状态的估计项取梯度，并把目标暂时视为常数。现代文献常称这种更新为 semi-gradient。教材正文主要直接从采样替代的角度推导，不依赖这一术语。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.2 Algorithm 8.1：TD with function approximation&lt;/h3&gt;
&lt;pre&gt;&lt;code&gt;输入：固定策略 π，初始参数 w0，步长序列 {αt}
对每个回合：
    生成初始状态 s0
    当尚未终止：
        按 π 在 st 选择 at
        与环境交互，得到 rt+1, st+1
        δt &amp;lt;- rt+1 + γ v_hat(st+1, wt) - v_hat(st, wt)
        wt+1 &amp;lt;- wt + αt δt grad_w v_hat(st, wt)
        st &amp;lt;- st+1
输出：v_hat(s, w)
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;终止状态的后继价值按 $0$ 处理。&lt;/p&gt;
&lt;h3&gt;3.3 线性 TD&lt;/h3&gt;
&lt;p&gt;选择：&lt;/p&gt;
&lt;p&gt;$$
\hat v(s,w)=\phi^T(s)w,
\qquad
\nabla_w\hat v(s,w)=\phi(s).
$$&lt;/p&gt;
&lt;p&gt;代入式 (8.13)：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t+\alpha_t
\left[
r_{t+1}
+\gamma\phi^T(s_{t+1})w_t
-\phi^T(s_t)w_t
\right]\phi(s_t).
\tag{8.14}
$$&lt;/p&gt;
&lt;p&gt;这就是 TD-Linear。它每一步只需计算两个特征向量和一个向量加法，复杂度随特征维数 $m$ 增长，而不是随状态数增长。&lt;/p&gt;
&lt;h3&gt;3.4 Box 8.2：表格 TD 是线性 TD 的特例&lt;/h3&gt;
&lt;p&gt;为每个状态选 one-hot 特征：&lt;/p&gt;
&lt;p&gt;$$
\phi(s)=e_s,
$$&lt;/p&gt;
&lt;p&gt;其中 $e_s$ 仅在状态 $s$ 对应位置为 $1$。则：&lt;/p&gt;
&lt;p&gt;$$
\hat v(s,w)=e_s^Tw=w(s).
$$&lt;/p&gt;
&lt;p&gt;式 (8.14) 变为：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t+\alpha_t
\left[r_{t+1}+\gamma w_t(s_{t+1})-w_t(s_t)\right]e_{s_t}.
$$&lt;/p&gt;
&lt;p&gt;只有 $s_t$ 对应分量发生变化：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}(s_t)
=w_t(s_t)+\alpha_t
\left[r_{t+1}+\gamma w_t(s_{t+1})-w_t(s_t)\right],
$$&lt;/p&gt;
&lt;p&gt;这正是表格型 TD。因此，表格法不是另一套互不相干的方法，而是函数近似中使用 one-hot 特征的特殊情形。&lt;/p&gt;
&lt;h2&gt;4. 特征选择与示例&lt;/h2&gt;
&lt;h3&gt;4.1 示例设置&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-6-gridworld-and-true-values.png&quot; alt=&quot;Figure 8.6：待评估策略、真实状态价值表与价值曲面&quot; /&gt;&lt;/p&gt;
&lt;p&gt;教材使用 $5\times5$ 网格世界。给定策略在每个状态以 $0.2$ 的概率选择任一动作。实验使用：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每次训练 500 个回合，每回合 500 步；&lt;/li&gt;
&lt;li&gt;初始状态与动作均匀随机；&lt;/li&gt;
&lt;li&gt;$w$ 按标准正态分布初始化；&lt;/li&gt;
&lt;li&gt;$r_{\text{forbidden}}=r_{\text{boundary}}=-1$，$r_{\text{target}}=1$；&lt;/li&gt;
&lt;li&gt;$\gamma=0.9$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;4.2 多项式特征&lt;/h3&gt;
&lt;p&gt;令状态二维坐标为 $(x,y)$。一次特征：&lt;/p&gt;
&lt;p&gt;$$
\phi(s)=\begin{bmatrix}1&amp;amp;x&amp;amp;y\end{bmatrix}^T\in\mathbb R^3.
\tag{8.15}
$$&lt;/p&gt;
&lt;p&gt;二次特征：&lt;/p&gt;
&lt;p&gt;$$
\phi(s)
=\begin{bmatrix}1&amp;amp;x&amp;amp;y&amp;amp;x^2&amp;amp;y^2&amp;amp;xy\end{bmatrix}^T
\in\mathbb R^6.
\tag{8.16}
$$&lt;/p&gt;
&lt;p&gt;三次特征：&lt;/p&gt;
&lt;p&gt;$$
\phi(s)
=\begin{bmatrix}
1&amp;amp;x&amp;amp;y&amp;amp;x^2&amp;amp;y^2&amp;amp;xy&amp;amp;x^3&amp;amp;y^3&amp;amp;x^2y&amp;amp;xy^2
\end{bmatrix}^T
\in\mathbb R^{10}.
\tag{8.17}
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-7-polynomial-features.png&quot; alt=&quot;Figure 8.7：不同阶数多项式特征的 TD-Linear 结果&quot; /&gt;&lt;/p&gt;
&lt;p&gt;维数越高，拟合曲面越灵活，误差平台通常越低；但三种误差都没有降到零，说明误差平台可能是函数族的表达能力限制，而非优化尚未结束。&lt;/p&gt;
&lt;h3&gt;4.3 Fourier 特征&lt;/h3&gt;
&lt;p&gt;先把 $x,y$ 归一化至 $[0,1]$。令 $c_1,c_2\in{0,1,\ldots,q}$，Fourier 特征的各分量为：&lt;/p&gt;
&lt;h1&gt;$$
\phi(s)&lt;/h1&gt;
&lt;p&gt;\begin{bmatrix}
\vdots\
\cos!\left(\pi(c_1x+c_2y)\right)\
\vdots
\end{bmatrix}
\in\mathbb R^{(q+1)^2}.
\tag{8.18}
$$&lt;/p&gt;
&lt;p&gt;例如 $q=1$ 时：&lt;/p&gt;
&lt;p&gt;$$
\phi(s)=
\begin{bmatrix}
1\
\cos(\pi y)\
\cos(\pi x)\
\cos(\pi(x+y))
\end{bmatrix}
\in\mathbb R^4.
$$&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-8-fourier-features.png&quot; alt=&quot;Figure 8.8：不同阶数 Fourier 特征的 TD-Linear 结果&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当 $q=1,2,3$ 时，特征维数分别为 $4,9,16$。实验同样显示，增加频率基函数可提升表达能力并降低误差，但也增加存储、计算以及选择超参数的负担。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 特征设计的实用判断
特征应让“价值相近或动力学相近”的状态拥有相近表示。多项式偏向全局平滑，Fourier 基能表示不同空间频率，one-hot 完全不泛化。不存在对所有任务都最好的固定特征。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;5. TD-Linear 的理论分析&lt;/h2&gt;
&lt;h3&gt;5.1 期望更新&lt;/h3&gt;
&lt;p&gt;为分析平均行为，把随机样本更新替换为条件期望：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t+\alpha_t
\mathbb E\left[
\left(
R+\gamma\phi^T(S&apos;)w_t-\phi^T(S)w_t
\right)\phi(S)
\right].
\tag{8.19}
$$&lt;/p&gt;
&lt;p&gt;设共有 $n$ 个状态、$m$ 个特征：&lt;/p&gt;
&lt;p&gt;$$
\Phi=
\begin{bmatrix}
\phi^T(s_1)\
\phi^T(s_2)\
\vdots\
\phi^T(s_n)
\end{bmatrix}
\in\mathbb R^{n\times m},
\qquad
D=\operatorname{diag}
\left(d_\pi(s_1),\ldots,d_\pi(s_n)\right).
\tag{8.20}
$$&lt;/p&gt;
&lt;h3&gt;5.2 Lemma 8.1：期望更新是线性系统&lt;/h3&gt;
&lt;p&gt;式 (8.19) 中的期望可写成 $b-Aw_t$，其中：&lt;/p&gt;
&lt;p&gt;$$
A=\Phi^TD(I-\gamma P_\pi)\Phi,
\qquad
b=\Phi^TDr_\pi.
\tag{8.21}
$$&lt;/p&gt;
&lt;p&gt;于是确定性平均迭代为：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}=w_t+\alpha_t(b-Aw_t).
\tag{8.22}
$$&lt;/p&gt;
&lt;p&gt;若 $A$ 可逆，固定点是：&lt;/p&gt;
&lt;p&gt;$$
w^*=A^{-1}b.
$$&lt;/p&gt;
&lt;p&gt;当 $\Phi=I$，即表格表示时：&lt;/p&gt;
&lt;p&gt;$$
w^*
=\left[D(I-\gamma P_\pi)\right]^{-1}Dr_\pi
=(I-\gamma P_\pi)^{-1}r_\pi
=v_\pi.
\tag{8.23}
$$&lt;/p&gt;
&lt;p&gt;函数近似的一般情形中，$\Phi w^*$ 通常不等于 $v_\pi$，而是某个投影固定点。&lt;/p&gt;
&lt;h3&gt;5.3 Box 8.3：Lemma 8.1 的推导&lt;/h3&gt;
&lt;p&gt;利用全期望公式，奖励部分为：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[R\phi(S)]
=\sum_s d_\pi(s)\phi(s)r_\pi(s)
=\Phi^TDr_\pi=b.
\tag{8.24}
$$&lt;/p&gt;
&lt;p&gt;当前状态价值项为：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\phi(S)\phi^T(S)w_t]
=\Phi^TD\Phi w_t.
\tag{8.25}
$$&lt;/p&gt;
&lt;p&gt;下一状态价值项为：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E[\phi(S)\phi^T(S&apos;)w_t]
=\Phi^TDP_\pi\Phi w_t.
\tag{8.26}
$$&lt;/p&gt;
&lt;p&gt;合并三项：&lt;/p&gt;
&lt;p&gt;$$
\mathbb E\left[
\left(R+\gamma\phi^T(S&apos;)w_t-\phi^T(S)w_t\right)\phi(S)
\right]
=b-Aw_t.
\tag{8.27}
$$&lt;/p&gt;
&lt;h3&gt;5.4 Box 8.4：$A$ 的正定性&lt;/h3&gt;
&lt;p&gt;假设 $P_\pi$ 正则，使 $d_\pi(s)&amp;gt;0$；再假设 $\Phi$ 满列秩。令：&lt;/p&gt;
&lt;p&gt;$$
M=D(I-\gamma P_\pi).
\tag{8.28}
$$&lt;/p&gt;
&lt;p&gt;教材通过对称部分 $M+M^T$ 的严格对角占优说明 $M$ 为正定矩阵。关键关系是：&lt;/p&gt;
&lt;p&gt;$$
(M+M^T)\mathbf 1_n
=2(1-\gamma)d_\pi&amp;gt;0.
\tag{8.29}
$$&lt;/p&gt;
&lt;p&gt;于是对任意非零 $x$，令 $y=\Phi x\ne0$：&lt;/p&gt;
&lt;p&gt;$$
x^TAx
=x^T\Phi^TM\Phi x
=y^TMy&amp;gt;0.
$$&lt;/p&gt;
&lt;p&gt;因此 $A$ 正定并可逆，固定点唯一。&lt;/p&gt;
&lt;h3&gt;5.5 两种收敛论证&lt;/h3&gt;
&lt;p&gt;定义参数误差 $\widetilde w_t=w_t-w^&lt;em&gt;$。由 $Aw^&lt;/em&gt;=b$：&lt;/p&gt;
&lt;p&gt;$$
\widetilde w_{t+1}
=(I-\alpha_tA)\widetilde w_t.
$$&lt;/p&gt;
&lt;p&gt;教材给出两条思路：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;小常数步长的确定性迭代&lt;/strong&gt;：当步长足够小时，线性映射 $I-\alpha A$ 产生收缩，平均迭代趋向 $w^*$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;随机逼近&lt;/strong&gt;：对真实随机更新，若噪声满足适当条件，且&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$$
\sum_{t=0}^{\infty}\alpha_t=\infty,
\qquad
\sum_{t=0}^{\infty}\alpha_t^2&amp;lt;\infty,
$$&lt;/p&gt;
&lt;p&gt;则可利用 Robbins-Monro 型结果证明几乎处处收敛。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 适用范围
这一节的保证依赖固定策略、线性函数近似、稳态采样、满秩特征以及步长与噪声条件。不能把结论直接推广为“任意非线性函数近似加任意 off-policy TD 都会收敛”。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;6. TD-Linear 到底最小化什么&lt;/h2&gt;
&lt;h3&gt;6.1 三种误差不能混为一谈&lt;/h3&gt;
&lt;p&gt;定义加权范数：&lt;/p&gt;
&lt;p&gt;$$
\lVert x\rVert_D^2=x^TDx
=\lVert D^{1/2}x\rVert_2^2.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;价值估计误差&lt;/strong&gt;：&lt;/p&gt;
&lt;p&gt;$$
J_E(w)
=\lVert\Phi w-v_\pi\rVert_D^2.
$$&lt;/p&gt;
&lt;p&gt;它直接衡量估计价值与真实价值的距离，但真实 $v_\pi$ 未知，通常不能直接优化。&lt;/p&gt;
&lt;p&gt;定义 Bellman 算子：&lt;/p&gt;
&lt;p&gt;$$
T_\pi(x)=r_\pi+\gamma P_\pi x.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Bellman 误差&lt;/strong&gt;：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
J_{\mathrm{BE}}(w)
&amp;amp;=\lVert\Phi w-(r_\pi+\gamma P_\pi\Phi w)\rVert_D^2\
&amp;amp;=\lVert\Phi w-T_\pi(\Phi w)\rVert_D^2.
\end{aligned}
\tag{8.30}
$$&lt;/p&gt;
&lt;p&gt;但 $T_\pi(\Phi w)$ 往往不在 $\Phi$ 的列空间中。定义关于 $D$ 加权内积的投影：&lt;/p&gt;
&lt;p&gt;$$
\mathcal M
=\Phi(\Phi^TD\Phi)^{-1}\Phi^TD.
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;投影 Bellman 误差&lt;/strong&gt;：&lt;/p&gt;
&lt;p&gt;$$
J_{\mathrm{PBE}}(w)
=\lVert\Phi w-\mathcal M T_\pi(\Phi w)\rVert_D^2.
$$&lt;/p&gt;
&lt;p&gt;TD-Linear 的固定点满足投影 Bellman 方程，因此它最小化的是 $J_{\mathrm{PBE}}$，不一定直接最小化 $J_E$ 或 $J_{\mathrm{BE}}$。&lt;/p&gt;
&lt;h3&gt;6.2 Box 8.5：投影 Bellman 固定点&lt;/h3&gt;
&lt;p&gt;固定点条件 $Aw^*=b$ 等价于：&lt;/p&gt;
&lt;p&gt;$$
\Phi^TD
\left[
\Phi w^&lt;em&gt;-T_\pi(\Phi w^&lt;/em&gt;)
\right]=0.
$$&lt;/p&gt;
&lt;p&gt;再左乘 $\Phi(\Phi^TD\Phi)^{-1}$：&lt;/p&gt;
&lt;p&gt;$$
\Phi w^*
=\mathcal M T_\pi(\Phi w^*).
\tag{8.31}
$$&lt;/p&gt;
&lt;p&gt;几何意义是：先做一次 Bellman 更新，再投影回可表示子空间，最终得到的点不再移动。&lt;/p&gt;
&lt;h3&gt;6.3 误差界&lt;/h3&gt;
&lt;p&gt;TD 固定点与最佳可表示价值之间满足教材给出的界：&lt;/p&gt;
&lt;h1&gt;$$
\lVert\Phi w^*-v_\pi\rVert_D
\le
\frac{1}{1-\gamma}
\min_w\lVert\hat v(w)-v_\pi\rVert_D&lt;/h1&gt;
&lt;p&gt;\frac{1}{1-\gamma}
\min_w\sqrt{J_E(w)}.
\tag{8.32}
$$&lt;/p&gt;
&lt;p&gt;这个界说明 TD 误差受函数族最佳近似误差控制，但 $\gamma$ 接近 $1$ 时系数很大，界可能很松。&lt;/p&gt;
&lt;h3&gt;6.4 Box 8.6：误差界的证明骨架&lt;/h3&gt;
&lt;p&gt;利用式 (8.31)、$v_\pi=T_\pi(v_\pi)$ 以及投影的非扩张性：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\lVert\Phi w^&lt;em&gt;-v_\pi\rVert_D
&amp;amp;\le
\lVert\mathcal M T_\pi(\Phi w^&lt;/em&gt;)-\mathcal M v_\pi\rVert_D
+\lVert\mathcal M v_\pi-v_\pi\rVert_D\
&amp;amp;\le
\gamma\lVert\Phi w^*-v_\pi\rVert_D
+\lVert\mathcal M v_\pi-v_\pi\rVert_D.
\end{aligned}
\tag{8.33}
$$&lt;/p&gt;
&lt;p&gt;这里使用了：&lt;/p&gt;
&lt;p&gt;$$
\lVert\mathcal M\rVert_D=1,
\qquad
\lVert P_\pi x\rVert_D\le\lVert x\rVert_D.
$$&lt;/p&gt;
&lt;p&gt;第二个不等式可由 Jensen 不等式和稳态关系 $d_\pi^T=d_\pi^TP_\pi$ 得到。移项后即得式 (8.32)，而 $\mathcal Mv_\pi$ 正是列空间中对 $v_\pi$ 的最佳 $D$ 加权近似。&lt;/p&gt;
&lt;h2&gt;7. Least-Squares TD&lt;/h2&gt;
&lt;p&gt;式 (8.21) 也可写成样本期望：&lt;/p&gt;
&lt;p&gt;$$
A
=\mathbb E\left[
\phi(s_t)
\left(\phi(s_t)-\gamma\phi(s_{t+1})\right)^T
\right],
\qquad
b=\mathbb E[r_{t+1}\phi(s_t)].
$$&lt;/p&gt;
&lt;p&gt;LSTD 用所有已收集样本直接估计 $A,b$：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\hat A_t
&amp;amp;=\sum_{k=0}^{t-1}
\phi(s_k)
\left(\phi(s_k)-\gamma\phi(s_{k+1})\right)^T,\
\hat b_t
&amp;amp;=\sum_{k=0}^{t-1}r_{k+1}\phi(s_k),\
w_t&amp;amp;=\hat A_t^{-1}\hat b_t.
\end{aligned}
\tag{8.34}
$$&lt;/p&gt;
&lt;p&gt;期望中的 $1/t$ 在 $\hat A_t^{-1}\hat b_t$ 中相消，因此教材直接使用求和形式。早期样本少、矩阵可能奇异时，可用：&lt;/p&gt;
&lt;p&gt;$$
\hat A_t+\sigma I,
\qquad \sigma&amp;gt;0
$$&lt;/p&gt;
&lt;p&gt;进行正则化。&lt;/p&gt;
&lt;p&gt;LSTD 的特点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;充分重复利用全部历史样本，常比逐步 TD 更节省样本；&lt;/li&gt;
&lt;li&gt;避免手工选择梯度步长来缓慢逼近固定点；&lt;/li&gt;
&lt;li&gt;需要维护 $m\times m$ 矩阵；&lt;/li&gt;
&lt;li&gt;直接求逆通常为 $O(m^3)$，高维时开销大；&lt;/li&gt;
&lt;li&gt;可利用矩阵求逆引理递推更新逆矩阵，避免每步从头求逆；&lt;/li&gt;
&lt;li&gt;本节形式针对线性状态价值近似。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2&gt;8. 基于函数近似的动作价值学习&lt;/h2&gt;
&lt;h3&gt;8.1 Sarsa with function approximation&lt;/h3&gt;
&lt;p&gt;把 $q(s,a)$ 替换为 $\hat q(s,a,w)$，on-policy Sarsa 更新为：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t+\alpha_t
\left[
r_{t+1}
+\gamma\hat q(s_{t+1},a_{t+1},w_t)
-\hat q(s_t,a_t,w_t)
\right]
\nabla_w\hat q(s_t,a_t,w_t).
\tag{8.35}
$$&lt;/p&gt;
&lt;p&gt;若为线性近似 $\hat q(s,a,w)=\phi^T(s,a)w$，梯度就是 $\phi(s,a)$。&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;Algorithm 8.2：Sarsa with function approximation
初始化 w0 与 ε-greedy 策略 π0
对每个回合：
    生成 s0，并按 π0 选择 a0
    当尚未到达目标：
        执行 at，观察 rt+1, st+1
        按当前策略在 st+1 选择 at+1
        用式 (8.35) 更新 w
        令 πt+1 对更新后的 q_hat 采取 ε-greedy
        st &amp;lt;- st+1，at &amp;lt;- at+1
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-9-sarsa-function-approximation.png&quot; alt=&quot;Figure 8.9：线性函数近似 Sarsa 的学习结果&quot; /&gt;&lt;/p&gt;
&lt;p&gt;示例参数为 $\gamma=0.9$、$\epsilon=0.1$、$r_{\text{boundary}}=r_{\text{forbidden}}=-10$、$r_{\text{target}}=1$、$\alpha=0.001$，并使用五阶 Fourier 特征。总回报上升、回合长度下降，最终策略能到达目标。&lt;/p&gt;
&lt;h3&gt;8.2 Q-learning with function approximation&lt;/h3&gt;
&lt;p&gt;Q-learning 用贪心下一状态价值替换实际采样的 $a_{t+1}$：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}
=w_t+\alpha_t
\left[
r_{t+1}
+\gamma\max_{a\in\mathcal A(s_{t+1})}
\hat q(s_{t+1},a,w_t)
-\hat q(s_t,a_t,w_t)
\right]
\nabla_w\hat q(s_t,a_t,w_t).
\tag{8.36}
$$&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;Algorithm 8.3：Q-learning with function approximation（on-policy 采样版本）
初始化 w0 与 ε-greedy 策略 π0
对每个回合：
    当尚未到达目标：
        按 πt 在 st 选择 at
        执行 at，观察 rt+1, st+1
        以 max_a q_hat(st+1, a, wt) 构造目标并更新 w
        用更新后的 q_hat 改进 ε-greedy 策略
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-10-q-learning-function-approximation.png&quot; alt=&quot;Figure 8.10：线性函数近似 Q-learning 的学习结果&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 教材的编号重复
教材把本节的函数近似 Q-learning 标为 Algorithm 8.3，后面的 Deep Q-learning 又再次标为 Algorithm 8.3。本文保留原编号，并用算法名称区分二者。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;尽管价值已经用函数表示，Algorithm 8.2 和这里的 Algorithm 8.3 中，策略 $\pi(a\mid s)$ 仍按状态保存在表格中，所以仍隐含有限状态与有限动作的假设。下一章才进一步把策略本身也参数化。&lt;/p&gt;
&lt;h2&gt;9. Deep Q-learning&lt;/h2&gt;
&lt;h3&gt;9.1 从 Q-learning 到 DQN&lt;/h3&gt;
&lt;p&gt;用神经网络 $\hat q(s,a,w)$ 近似最优动作价值，基本平方 TD 目标为：&lt;/p&gt;
&lt;p&gt;$$
J(w)
=\mathbb E\left[
\left(
R+\gamma\max_{a\in\mathcal A(S&apos;)}
\hat q(S&apos;,a,w)
-\hat q(S,A,w)
\right)^2
\right].
\tag{8.37}
$$&lt;/p&gt;
&lt;p&gt;若目标和当前估计都由同一个快速变化的网络产生，训练目标会随每次参数更新一起移动。DQN 使用两套参数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;主网络参数 $w$：每次迭代更新；&lt;/li&gt;
&lt;li&gt;目标网络参数 $w_T$：在一段时间内固定，每隔 $C$ 次迭代复制 $w_T\leftarrow w$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;固定目标网络后，单个样本的目标为：&lt;/p&gt;
&lt;p&gt;$$
y_T
=r+\gamma\max_{a\in\mathcal A(s&apos;)}
\hat q(s&apos;,a,w_T).
$$&lt;/p&gt;
&lt;p&gt;把 $w_T$ 视为常数，忽略不影响方向的常数因子，梯度为：&lt;/p&gt;
&lt;p&gt;$$
\nabla_wJ
=-\mathbb E\left[
\left(
R+\gamma\max_{a\in\mathcal A(S&apos;)}
\hat q(S&apos;,a,w_T)
-\hat q(S,A,w)
\right)
\nabla_w\hat q(S,A,w)
\right].
\tag{8.38}
$$&lt;/p&gt;
&lt;p&gt;主网络实际通过神经网络训练工具，在 mini-batch 上最小化：&lt;/p&gt;
&lt;p&gt;$$
\frac{1}{B}\sum_{i=1}^{B}
\left(y_{T,i}-\hat q(s_i,a_i,w)\right)^2.
$$&lt;/p&gt;
&lt;h3&gt;9.2 经验回放&lt;/h3&gt;
&lt;p&gt;经验样本写作 $(s,a,r,s&apos;)$，存入回放缓冲区：&lt;/p&gt;
&lt;p&gt;$$
\mathcal B={(s,a,r,s&apos;)}.
$$&lt;/p&gt;
&lt;p&gt;训练时不按生成顺序使用数据，而是从 $\mathcal B$ 中均匀抽取 mini-batch。教材强调两点作用：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;打破连续轨迹样本之间的强相关性，使批次更接近目标函数所假定的抽样方式；&lt;/li&gt;
&lt;li&gt;一个样本可被重复使用，提高数据效率。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解：均匀回放的边界
教材用均匀分布解释基本经验回放。实际算法也可采用非均匀采样，但这会改变采样分布，通常需要额外校正；这不属于本章基本 DQN 的讨论范围。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;9.3 Algorithm 8.3：Deep Q-learning，off-policy 版本&lt;/h3&gt;
&lt;pre&gt;&lt;code&gt;初始化：主网络 w，目标网络 wT &amp;lt;- w，回放缓冲区 B
由行为策略 πb 收集转移 (s, a, r, s&apos;) 并存入 B
对每次训练迭代：
    从 B 中均匀抽取 mini-batch
    对每个样本计算：
        yT &amp;lt;- r + γ max_a q_hat(s&apos;, a, wT)
    更新主网络 w，使 (yT - q_hat(s, a, w))^2 的批均值下降
    每隔 C 次迭代令 wT &amp;lt;- w
输出：近似最优动作价值与相应贪心策略
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;该算法是 off-policy：产生经验的行为策略 $\pi_b$ 与目标贪心策略可以不同。&lt;/p&gt;
&lt;h3&gt;9.4 示例一：覆盖充分&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-11-deep-q-learning-sufficient-data.png&quot; alt=&quot;Figure 8.11：1000 步经验下的 Deep Q-learning&quot; /&gt;&lt;/p&gt;
&lt;p&gt;实验设置：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;行为策略在每个状态对所有动作等概率，探索充分；&lt;/li&gt;
&lt;li&gt;单条轨迹 1000 步，回放缓冲区含 1000 个样本；&lt;/li&gt;
&lt;li&gt;mini-batch 大小为 100；&lt;/li&gt;
&lt;li&gt;主网络和目标网络均有一个 100 神经元的隐藏层；&lt;/li&gt;
&lt;li&gt;输入为归一化的行索引、列索引、动作索引，共 3 维；输出为一个动作价值；&lt;/li&gt;
&lt;li&gt;$\gamma=0.9$，边界和禁区奖励为 $-10$，目标奖励为 $1$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;训练损失和真实价值 RMSE 都趋近于零，最终贪心策略正确。函数近似的泛化与样本重复利用，使 1000 步数据在该示例中已经足够。&lt;/p&gt;
&lt;h3&gt;9.5 示例二：覆盖不足与过拟合&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-8-12-deep-q-learning-insufficient-data.png&quot; alt=&quot;Figure 8.12：100 步经验下损失收敛但价值误差不收敛&quot; /&gt;&lt;/p&gt;
&lt;p&gt;第二个示例只有 100 步经验，mini-batch 大小为 50。结果是：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练损失仍趋近于零；&lt;/li&gt;
&lt;li&gt;真实动作价值误差停在较高水平；&lt;/li&gt;
&lt;li&gt;最终策略在未充分覆盖的状态中表现错误。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这揭示了一个重要诊断原则：&lt;/p&gt;
&lt;p&gt;$$
\text{低训练 TD 损失}
\not\Rightarrow
\text{真实价值准确}
\not\Rightarrow
\text{策略最优}.
$$&lt;/p&gt;
&lt;p&gt;网络只证明自己拟合了缓冲区中的样本；若数据没有覆盖关键状态-动作对，训练损失无法反映全局价值误差。&lt;/p&gt;
&lt;h2&gt;10. 方法关系与选择&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方法&lt;/th&gt;
&lt;th&gt;估计对象&lt;/th&gt;
&lt;th&gt;表示&lt;/th&gt;
&lt;th&gt;目标来源&lt;/th&gt;
&lt;th&gt;主要特点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;表格 TD&lt;/td&gt;
&lt;td&gt;$v_\pi$&lt;/td&gt;
&lt;td&gt;每状态一个表项&lt;/td&gt;
&lt;td&gt;一步 TD&lt;/td&gt;
&lt;td&gt;无跨状态泛化&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TD-Linear&lt;/td&gt;
&lt;td&gt;$v_\pi$&lt;/td&gt;
&lt;td&gt;$\phi^T(s)w$&lt;/td&gt;
&lt;td&gt;一步 TD&lt;/td&gt;
&lt;td&gt;理论清晰，依赖特征&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LSTD&lt;/td&gt;
&lt;td&gt;$v_\pi$&lt;/td&gt;
&lt;td&gt;$\phi^T(s)w$&lt;/td&gt;
&lt;td&gt;线性方程样本估计&lt;/td&gt;
&lt;td&gt;样本高效，矩阵开销大&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Sarsa + FA&lt;/td&gt;
&lt;td&gt;$q_\pi$ 或改进策略&lt;/td&gt;
&lt;td&gt;$\hat q(s,a,w)$&lt;/td&gt;
&lt;td&gt;实际下一动作&lt;/td&gt;
&lt;td&gt;on-policy&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Q-learning + FA&lt;/td&gt;
&lt;td&gt;$q_*$&lt;/td&gt;
&lt;td&gt;$\hat q(s,a,w)$&lt;/td&gt;
&lt;td&gt;下一状态最大值&lt;/td&gt;
&lt;td&gt;控制目标与行为可分离&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DQN&lt;/td&gt;
&lt;td&gt;$q_*$&lt;/td&gt;
&lt;td&gt;神经网络&lt;/td&gt;
&lt;td&gt;固定一段时间的目标网络&lt;/td&gt;
&lt;td&gt;回放、mini-batch、非线性泛化&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 三条贯穿全章的权衡&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;表示维数越低，存储越省，但可能产生更大近似偏差。&lt;/li&gt;
&lt;li&gt;泛化越强，一个样本影响越广，既可能提高样本效率，也可能扩大错误更新。&lt;/li&gt;
&lt;li&gt;训练目标越自举、函数越非线性，越需要稳定目标与更合理的数据分布。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2&gt;11. 本章 Q&amp;amp;A&lt;/h2&gt;
&lt;h3&gt;Q1：表格法与函数近似法有什么区别？&lt;/h3&gt;
&lt;p&gt;表格法直接读取和改写对应表项；函数近似法输入状态计算价值，并通过修改共享参数间接改变价值。后者需要前向计算，也会使一个状态的更新影响其他状态。&lt;/p&gt;
&lt;h3&gt;Q2：函数近似相对表格法有什么优势？&lt;/h3&gt;
&lt;p&gt;第一，参数维数通常远小于状态数，存储更高效；第二，共享参数带来跨状态泛化，使一个状态的经验帮助估计其他状态；第三，可处理无法穷举的连续或巨大状态空间。代价是近似误差和训练稳定性问题。&lt;/p&gt;
&lt;h3&gt;Q3：两种方法能统一吗？&lt;/h3&gt;
&lt;p&gt;能。取 $\phi(s)=e_s$ 的 one-hot 特征时，线性函数近似退化为价值表，TD-Linear 退化为表格 TD，见 Box 8.2。&lt;/p&gt;
&lt;h3&gt;Q4：什么是稳态分布，为什么重要？&lt;/h3&gt;
&lt;p&gt;固定策略长期运行后，状态访问概率若收敛到与初始分布无关的 $d_\pi$，它就是稳态分布。它描述策略实际将时间花在哪里，并为均方价值误差提供自然的状态权重；后续策略梯度方法也会再次使用该概念。&lt;/p&gt;
&lt;h3&gt;Q5：线性函数近似的优缺点是什么？&lt;/h3&gt;
&lt;p&gt;优点是形式简单、计算便宜、理论可较完整分析，并且包含表格法这一特例。缺点是表达能力有限，而且复杂任务中选择合适特征并不容易。神经网络表达力更强，但优化和理论更复杂。&lt;/p&gt;
&lt;h3&gt;Q6：为什么 Deep Q-learning 需要经验回放？&lt;/h3&gt;
&lt;p&gt;顺序轨迹样本高度相关，从缓冲区随机抽样可削弱相关性并更接近训练目标假定的抽样分布；同一经验还能被多次利用，提高数据效率。&lt;/p&gt;
&lt;h3&gt;Q7：表格 Q-learning 能使用经验回放吗？&lt;/h3&gt;
&lt;p&gt;可以。表格 Q-learning 本身并不要求按数据生成顺序更新，其 off-policy 性质允许重放由行为策略收集的样本。它不一定需要回放，但可以借此重复使用数据。&lt;/p&gt;
&lt;h3&gt;Q8：为什么 DQN 要维护两套网络？&lt;/h3&gt;
&lt;p&gt;参数 $w$ 同时出现在当前估计和自举目标中，会让目标随更新快速移动。目标网络在一段时间内冻结 $w_T$，使主网络面对相对稳定的回归目标；随后周期性复制主网络参数，避免目标永久过时。&lt;/p&gt;
&lt;h3&gt;Q9：神经网络作为非线性近似器时，如何更新参数？&lt;/h3&gt;
&lt;p&gt;把 mini-batch 的目标值 $y_T$ 和网络输出组成均方损失，使用成熟的反向传播与优化器更新主网络，而不是把标量网络参数误当成表项直接改写。目标网络则按周期整体复制参数。&lt;/p&gt;
&lt;h2&gt;12. 一页复习提纲&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;表示&lt;/strong&gt;：$\hat v(s,w)$、$\hat q(s,a,w)$ 用参数替代价值表。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;线性不等于关于状态线性&lt;/strong&gt;：只要 $\hat v=\phi^Tw$ 对 $w$ 线性即可。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;目标权重&lt;/strong&gt;：$d_\pi$ 是策略长期访问分布，决定哪些状态误差更重要。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TD 参数更新&lt;/strong&gt;：$w\leftarrow w+\alpha\delta\nabla_w\hat v$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TD-Linear&lt;/strong&gt;：梯度等于特征 $\phi(s)$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;表格统一&lt;/strong&gt;：one-hot 特征使函数近似退化为表格。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;理论固定点&lt;/strong&gt;：$Aw^*=b$，其中 $A=\Phi^TD(I-\gamma P_\pi)\Phi$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;真正的优化对象&lt;/strong&gt;：TD-Linear 对应投影 Bellman 固定点，而非一般意义下直接最小化价值误差。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;误差来源&lt;/strong&gt;：采样误差、优化误差、函数族近似误差必须区分。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;LSTD&lt;/strong&gt;：用样本累计估计 $A,b$ 并解线性方程。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;动作价值&lt;/strong&gt;：Sarsa 使用实际下一动作；Q-learning 使用下一状态最大动作价值。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DQN 稳定组件&lt;/strong&gt;：目标网络稳定目标，经验回放改变样本使用方式。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;诊断警告&lt;/strong&gt;：低 TD 训练损失不保证真实价值准确，数据覆盖同样关键。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;13. 公式速查&lt;/h2&gt;
&lt;h3&gt;表示与目标&lt;/h3&gt;
&lt;p&gt;$$
\hat v(s,w)=\phi^T(s)w,
\qquad
J_E(w)=\lVert\Phi w-v_\pi\rVert_D^2.
$$&lt;/p&gt;
&lt;h3&gt;状态价值 TD&lt;/h3&gt;
&lt;p&gt;$$
\delta_t=r_{t+1}+\gamma\hat v(s_{t+1},w_t)-\hat v(s_t,w_t),
$$&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}=w_t+\alpha_t\delta_t\nabla_w\hat v(s_t,w_t).
$$&lt;/p&gt;
&lt;p&gt;线性时：&lt;/p&gt;
&lt;p&gt;$$
w_{t+1}=w_t+\alpha_t\delta_t\phi(s_t).
$$&lt;/p&gt;
&lt;h3&gt;线性 TD 固定点&lt;/h3&gt;
&lt;p&gt;$$
A=\Phi^TD(I-\gamma P_\pi)\Phi,
\qquad
b=\Phi^TDr_\pi,
\qquad
w^*=A^{-1}b.
$$&lt;/p&gt;
&lt;h3&gt;投影 Bellman 方程&lt;/h3&gt;
&lt;p&gt;$$
\mathcal M=\Phi(\Phi^TD\Phi)^{-1}\Phi^TD,
$$&lt;/p&gt;
&lt;p&gt;$$
\Phi w^&lt;em&gt;=\mathcal MT_\pi(\Phi w^&lt;/em&gt;).
$$&lt;/p&gt;
&lt;h3&gt;Sarsa 与 Q-learning&lt;/h3&gt;
&lt;p&gt;$$
\delta_t^{\text{Sarsa}}
=r_{t+1}+\gamma\hat q(s_{t+1},a_{t+1},w_t)-\hat q(s_t,a_t,w_t),
$$&lt;/p&gt;
&lt;p&gt;$$
\delta_t^{\text{Q}}
=r_{t+1}+\gamma\max_a\hat q(s_{t+1},a,w_t)-\hat q(s_t,a_t,w_t).
$$&lt;/p&gt;
&lt;h3&gt;DQN 目标&lt;/h3&gt;
&lt;p&gt;$$
y_T=r+\gamma\max_a\hat q(s&apos;,a,w_T),
\qquad
L(w)=\frac{1}{B}\sum_i\left(y_{T,i}-\hat q(s_i,a_i,w)\right)^2.
$$&lt;/p&gt;
&lt;h2&gt;14. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$\hat v(s,w)$&lt;/td&gt;
&lt;td&gt;参数为 $w$ 的状态价值近似&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\hat q(s,a,w)$&lt;/td&gt;
&lt;td&gt;参数为 $w$ 的动作价值近似&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\phi(s)$&lt;/td&gt;
&lt;td&gt;状态特征向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Phi$&lt;/td&gt;
&lt;td&gt;以 $\phi^T(s_i)$ 为行的特征矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$d_\pi$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 诱导的稳态分布&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$D$&lt;/td&gt;
&lt;td&gt;$d_\pi$ 构成的对角权重矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$P_\pi$&lt;/td&gt;
&lt;td&gt;固定策略后的状态转移矩阵&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$r_\pi$&lt;/td&gt;
&lt;td&gt;固定策略下的期望即时奖励向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$T_\pi$&lt;/td&gt;
&lt;td&gt;策略 Bellman 算子&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathcal M$&lt;/td&gt;
&lt;td&gt;到 $\Phi$ 列空间的 $D$ 加权投影&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$A,b$&lt;/td&gt;
&lt;td&gt;线性 TD 平均更新中的矩阵和向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$w_T$&lt;/td&gt;
&lt;td&gt;DQN 目标网络参数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathcal B$&lt;/td&gt;
&lt;td&gt;经验回放缓冲区&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$C$&lt;/td&gt;
&lt;td&gt;目标网络同步间隔&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$B$&lt;/td&gt;
&lt;td&gt;mini-batch 大小&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;15. 易错点与辨析&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;“线性近似”不是“价值关于状态坐标只能是一条直线”&lt;/strong&gt;。多项式、Fourier 特征都可保持对参数线性。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;稳态分布不是任意指定的均匀分布&lt;/strong&gt;。它由策略和环境转移共同决定，并满足 $d_\pi^T=d_\pi^TP_\pi$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TD-Linear 不直接最小化真实价值误差&lt;/strong&gt;。其固定点对应投影 Bellman 方程。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;更高维特征不保证误差为零&lt;/strong&gt;。真实价值可能仍不在特征张成的子空间中。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;低训练损失不等于策略正确&lt;/strong&gt;。图 8.12 展示了数据覆盖不足时的反例。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;目标网络不是第二个独立智能体&lt;/strong&gt;。它只是主网络参数的延迟副本，用来形成较稳定目标。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;经验回放不是凭空创造信息&lt;/strong&gt;。它提高样本复用率，却无法补足从未覆盖的关键状态-动作对。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;函数近似价值不代表策略也已函数化&lt;/strong&gt;。本章 Sarsa 和线性 Q-learning 的策略仍用表格表示。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Sarsa 与 Q-learning 的区别仍在目标&lt;/strong&gt;。是否使用函数近似不会改变 on-policy 与 off-policy 的基本区别。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;教材存在 Algorithm 8.3 重复编号&lt;/strong&gt;。一个是函数近似 Q-learning，另一个是 Deep Q-learning，应按名称识别。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;16. 自测题&lt;/h2&gt;
&lt;h3&gt;概念题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;为什么共享参数同时带来样本效率和干扰风险？&lt;/li&gt;
&lt;li&gt;为什么目标函数需要指定状态分布？选择 $d_\pi$ 有什么含义？&lt;/li&gt;
&lt;li&gt;为什么 one-hot 特征没有跨状态泛化？&lt;/li&gt;
&lt;li&gt;TD-Linear 的固定点为什么通常不等于真实 $v_\pi$？&lt;/li&gt;
&lt;li&gt;投影 Bellman 误差与 Bellman 误差的区别是什么？&lt;/li&gt;
&lt;li&gt;为什么 $\gamma$ 接近 $1$ 时式 (8.32) 的界会变松？&lt;/li&gt;
&lt;li&gt;LSTD 与逐步 TD 在样本使用和计算开销上如何权衡？&lt;/li&gt;
&lt;li&gt;目标网络冻结过久或同步过频分别可能带来什么问题？&lt;/li&gt;
&lt;li&gt;为什么图 8.12 中训练损失为零却仍学不到正确价值？&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;推导题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;从式 (8.19) 展开全期望，推导 $b-Aw_t$。&lt;/li&gt;
&lt;li&gt;令 $\Phi=I$，从式 (8.21) 推导 $w^*=v_\pi$。&lt;/li&gt;
&lt;li&gt;从 $Aw^*=b$ 推导投影 Bellman 固定点式 (8.31)。&lt;/li&gt;
&lt;li&gt;使用 $\lVert\mathcal M\rVert_D=1$ 和 $\lVert P_\pi x\rVert_D\le\lVert x\rVert_D$ 推导式 (8.32)。&lt;/li&gt;
&lt;li&gt;分别写出 Sarsa、Q-learning 和 DQN 的一步目标，并指出哪一个参数被视为固定。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;实践题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;在同一网格世界中比较 one-hot、多项式与 Fourier 特征的学习曲线和最终误差。&lt;/li&gt;
&lt;li&gt;固定网络结构，逐渐缩短经验轨迹，观察训练损失与全状态动作价值 RMSE 何时开始分离。&lt;/li&gt;
&lt;li&gt;改变目标网络同步间隔 $C$，比较训练振荡、收敛速度与最终策略。&lt;/li&gt;
&lt;li&gt;对 LSTD 加入不同正则化系数 $\sigma$，观察早期矩阵条件数和价值误差。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;17. 本章结论&lt;/h2&gt;
&lt;p&gt;本章把强化学习价值估计重写成了一个参数化优化问题。表格法被包含在线性函数近似之中；稳态分布给出了误差权重；TD-Linear 的平均更新归结为 $Aw=b$，其真正目标是投影 Bellman 固定点；LSTD 通过直接估计线性方程提高样本利用率；Sarsa 和 Q-learning 把相同思想扩展到动作价值；DQN 又用神经网络扩大表示能力，并用目标网络与经验回放缓解移动目标和相关样本问题。&lt;/p&gt;
&lt;p&gt;最值得带入后续章节的认识是：&lt;strong&gt;函数近似不是简单地把表格换成神经网络，而是同时改变了表示空间、误差定义、样本分布、优化动力学和泛化方式。&lt;/strong&gt;&lt;/p&gt;
</content:encoded></item><item><title>Chapter 9 - Policy Gradient Methods</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-9-policy-gradient-methods/chapter-9---policy-gradient-methods/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E8%87%AA%E5%B7%B1%E5%AD%A6%E7%9A%84%E4%B8%9C%E8%A5%BF/reinforcement-learning/chapter-9-policy-gradient-methods/chapter-9---policy-gradient-methods/</guid><pubDate>Tue, 11 Aug 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 9 - Policy Gradient Methods&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!abstract] 本章导读
Chapter 8 用参数化函数表示价值，本章进一步用参数化函数直接表示策略（policy）。这使强化学习第一次从以价值为中心的方法转向以策略为中心的方法。主线非常清楚：先选择一个衡量策略优劣的标量指标 $J(\theta)$，再推导其关于策略参数 $\theta$ 的梯度，最后用经验样本近似真实梯度，得到 Monte Carlo policy gradient，也就是 REINFORCE。真正困难之处在于，策略变化会同时改变动作概率、状态价值和长期状态分布，因此教材分别处理折扣与无折扣情形，并用 Policy Gradient Theorem 将它们统一起来。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;0. 本章知识结构&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-9-1-roadmap.png&quot; alt=&quot;Figure 9.1：本章在全书中的位置&quot; /&gt;&lt;/p&gt;
&lt;p&gt;本章在全书中的逻辑位置是：&lt;/p&gt;
&lt;p&gt;$$
\text{价值函数近似}
\longrightarrow
\text{策略函数近似}
\longrightarrow
\text{策略梯度}
\longrightarrow
\text{REINFORCE}
\longrightarrow
\text{Actor-Critic}.
$$&lt;/p&gt;
&lt;p&gt;策略梯度方法围绕三个问题展开：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;优化什么？&lt;/strong&gt; 选择标量指标 $J(\theta)$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;梯度是什么？&lt;/strong&gt; 推导 $\nabla_\theta J(\theta)$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;怎样用样本计算？&lt;/strong&gt; 用随机梯度替代未知期望。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;最基本的梯度上升骨架为：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t+\alpha\nabla_\theta J(\theta_t),
\qquad \alpha&amp;gt;0.
$$&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] 一句话总览
Policy Gradient Theorem 把一个看似需要对环境动力学和状态分布求导的问题，化成“得分函数 $\nabla_\theta\ln\pi(A\mid S,\theta)$ 乘动作价值 $q_\pi(S,A)$”的期望，从而可以直接用轨迹样本优化策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;1. 策略表示：从表格到函数&lt;/h2&gt;
&lt;h3&gt;1.1 表格型策略&lt;/h3&gt;
&lt;p&gt;若有 9 个状态，每个状态有 5 个动作，Table 9.1 的策略表示可转换为：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;状态&lt;/th&gt;
&lt;th&gt;$a_1$&lt;/th&gt;
&lt;th&gt;$a_2$&lt;/th&gt;
&lt;th&gt;$a_3$&lt;/th&gt;
&lt;th&gt;$a_4$&lt;/th&gt;
&lt;th&gt;$a_5$&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$s_1$&lt;/td&gt;
&lt;td&gt;$\pi(a_1\mid s_1)$&lt;/td&gt;
&lt;td&gt;$\pi(a_2\mid s_1)$&lt;/td&gt;
&lt;td&gt;$\pi(a_3\mid s_1)$&lt;/td&gt;
&lt;td&gt;$\pi(a_4\mid s_1)$&lt;/td&gt;
&lt;td&gt;$\pi(a_5\mid s_1)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\vdots$&lt;/td&gt;
&lt;td&gt;$\vdots$&lt;/td&gt;
&lt;td&gt;$\vdots$&lt;/td&gt;
&lt;td&gt;$\vdots$&lt;/td&gt;
&lt;td&gt;$\vdots$&lt;/td&gt;
&lt;td&gt;$\vdots$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$s_9$&lt;/td&gt;
&lt;td&gt;$\pi(a_1\mid s_9)$&lt;/td&gt;
&lt;td&gt;$\pi(a_2\mid s_9)$&lt;/td&gt;
&lt;td&gt;$\pi(a_3\mid s_9)$&lt;/td&gt;
&lt;td&gt;$\pi(a_4\mid s_9)$&lt;/td&gt;
&lt;td&gt;$\pi(a_5\mid s_9)$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;表格中的每一行是给定状态后的动作概率分布，每行概率之和为 $1$。&lt;/p&gt;
&lt;h3&gt;1.2 参数化策略&lt;/h3&gt;
&lt;p&gt;本章将策略写成：&lt;/p&gt;
&lt;p&gt;$$
\pi(a\mid s,\theta),
\qquad
\theta\in\mathbb R^m.
$$&lt;/p&gt;
&lt;p&gt;教材也使用 $\pi_\theta(a\mid s)$、$\pi_\theta(a,s)$ 或 $\pi(a,s,\theta)$ 等等价写法。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;assets/figure-9-2-policy-function-representations.png&quot; alt=&quot;Figure 9.2：参数化策略的两种函数结构&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;图解：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;图 9.2(a)：输入状态 $s$ 和动作 $a$，输出一个动作概率 $\pi(a\mid s,\theta)$。&lt;/li&gt;
&lt;li&gt;图 9.2(b)：只输入状态 $s$，一次输出全部动作概率。&lt;/li&gt;
&lt;li&gt;两种结构表达同一策略，区别只是函数接口和网络输出方式。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;1.3 从表格到函数后，三个问题发生变化&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;问题&lt;/th&gt;
&lt;th&gt;表格表示&lt;/th&gt;
&lt;th&gt;函数表示&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;如何定义最优策略&lt;/td&gt;
&lt;td&gt;同时最大化每个状态价值&lt;/td&gt;
&lt;td&gt;最大化选定的标量指标&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;如何更新策略&lt;/td&gt;
&lt;td&gt;直接修改表项&lt;/td&gt;
&lt;td&gt;修改共享参数 $\theta$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;如何读取动作概率&lt;/td&gt;
&lt;td&gt;查表&lt;/td&gt;
&lt;td&gt;执行函数前向计算&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;函数表示的优势是可应对更大的状态或动作空间，并利用共享参数进行泛化；相应代价是策略只能在参数化函数族内搜索，而且优化目标必须压缩为标量。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
“最大化每个状态价值”给出了逐状态的偏序，而梯度法需要一个标量目标。引入 $J(\theta)$ 的实质，是先说明哪些状态更重要，再把整张价值图压缩为一个可优化的数。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;2. 定义最优策略的标量指标&lt;/h2&gt;
&lt;h3&gt;2.1 Metric 1：平均状态价值&lt;/h3&gt;
&lt;p&gt;给每个状态一个非负权重 $d(s)$，且 $\sum_{s\in\mathcal S}d(s)=1$。平均状态价值（average state value）定义为：&lt;/p&gt;
&lt;p&gt;$$
\bar v_\pi
=\sum_{s\in\mathcal S}d(s)v_\pi(s)
=\mathbb E_{S\sim d}[v_\pi(S)].
$$&lt;/p&gt;
&lt;p&gt;状态分布有两种选择。&lt;/p&gt;
&lt;h4&gt;情形 A：$d$ 与策略无关&lt;/h4&gt;
&lt;p&gt;此时记作 $d_0$，对应指标记作 $\bar v_\pi^0$。常见例子：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;所有状态等权：$d_0(s)=1/\lvert\mathcal S\rvert$；&lt;/li&gt;
&lt;li&gt;只关心固定起点 $s_0$：&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
d_0(s_0)=1,
\qquad
d_0(s)=0\quad(s\ne s_0).
$$&lt;/p&gt;
&lt;h4&gt;情形 B：$d$ 依赖策略&lt;/h4&gt;
&lt;p&gt;常取策略 $\pi$ 诱导的稳态分布 $d_\pi$：&lt;/p&gt;
&lt;p&gt;$$
d_\pi^TP_\pi=d_\pi^T.
$$&lt;/p&gt;
&lt;p&gt;长期访问频繁的状态权重更高，罕见状态权重更低。此时 $\bar v_\pi=d_\pi^Tv_\pi$。&lt;/p&gt;
&lt;h3&gt;2.2 平均状态价值的轨迹表达&lt;/h3&gt;
&lt;p&gt;对折扣回报，教材给出常见指标：&lt;/p&gt;
&lt;p&gt;$$
J(\theta)
=\lim_{n\to\infty}
\mathbb E\left[\sum_{t=0}^{n}\gamma^tR_{t+1}\right]
=\mathbb E\left[\sum_{t=0}^{\infty}\gamma^tR_{t+1}\right].
\tag{9.1}
$$&lt;/p&gt;
&lt;p&gt;由全期望公式：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E\left[\sum_{t=0}^{\infty}\gamma^tR_{t+1}\right]
&amp;amp;=\sum_{s\in\mathcal S}d(s)
\mathbb E\left[\sum_{t=0}^{\infty}\gamma^tR_{t+1}\mid S_0=s\right]\
&amp;amp;=\sum_{s\in\mathcal S}d(s)v_\pi(s)
=\bar v_\pi.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;因此，“期望折扣累计奖励”就是按初始状态分布加权的平均状态价值。&lt;/p&gt;
&lt;h3&gt;2.3 Metric 2：平均奖励&lt;/h3&gt;
&lt;p&gt;平均一步奖励（average one-step reward），简称平均奖励（average reward），定义为：&lt;/p&gt;
&lt;p&gt;$$
\bar r_\pi
:=\sum_{s\in\mathcal S}d_\pi(s)r_\pi(s)
=\mathbb E_{S\sim d_\pi}[r_\pi(S)].
\tag{9.2}
$$&lt;/p&gt;
&lt;p&gt;其中，给定状态后的期望即时奖励为：&lt;/p&gt;
&lt;p&gt;$$
r_\pi(s)
:=\sum_{a\in\mathcal A}\pi(a\mid s,\theta)r(s,a)
=\mathbb E_{A\sim\pi(s,\theta)}[r(s,A)\mid s].
\tag{9.3}
$$&lt;/p&gt;
&lt;p&gt;并且：&lt;/p&gt;
&lt;p&gt;$$
r(s,a)
:=\mathbb E[R\mid s,a]
=\sum_r r,p(r\mid s,a).
$$&lt;/p&gt;
&lt;p&gt;它的轨迹表达是长期时间平均：&lt;/p&gt;
&lt;p&gt;$$
J(\theta)
=\lim_{n\to\infty}\frac{1}{n}
\mathbb E\left[\sum_{t=0}^{n-1}R_{t+1}\right].
\tag{9.4}
$$&lt;/p&gt;
&lt;p&gt;在满足教材所用稳态条件时：&lt;/p&gt;
&lt;p&gt;$$
\lim_{n\to\infty}\frac{1}{n}
\mathbb E\left[\sum_{t=0}^{n-1}R_{t+1}\right]
=\sum_{s\in\mathcal S}d_\pi(s)r_\pi(s)
=\bar r_\pi.
\tag{9.5}
$$&lt;/p&gt;
&lt;p&gt;向量形式为：&lt;/p&gt;
&lt;p&gt;$$
\bar v_\pi=d^Tv_\pi,
\qquad
\bar r_\pi=d_\pi^Tr_\pi.
$$&lt;/p&gt;
&lt;h3&gt;2.4 Box 9.1：式 (9.5) 的证明&lt;/h3&gt;
&lt;p&gt;证明分两步。&lt;/p&gt;
&lt;h4&gt;Step 1：任意固定起点都得到同一长期平均奖励&lt;/h4&gt;
&lt;p&gt;对任意 $s_0\in\mathcal S$：&lt;/p&gt;
&lt;p&gt;$$
\bar r_\pi
=\lim_{n\to\infty}\frac{1}{n}
\mathbb E\left[\sum_{t=0}^{n-1}R_{t+1}\mid S_0=s_0\right].
\tag{9.6}
$$&lt;/p&gt;
&lt;p&gt;把期望移入有限和，并使用 Cesaro mean 的性质：若 $a_t$ 收敛，则其算术平均也收敛到同一极限，得到：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\lim_{n\to\infty}\frac{1}{n}
\mathbb E\left[\sum_{t=0}^{n-1}R_{t+1}\mid S_0=s_0\right]
&amp;amp;=\lim_{n\to\infty}\frac{1}{n}
\sum_{t=0}^{n-1}\mathbb E[R_{t+1}\mid S_0=s_0]\
&amp;amp;=\lim_{t\to\infty}\mathbb E[R_{t+1}\mid S_0=s_0].
\end{aligned}
\tag{9.7}
$$&lt;/p&gt;
&lt;p&gt;再按时刻 $t$ 的状态分解：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\mathbb E[R_{t+1}\mid S_0=s_0]
&amp;amp;=\sum_{s\in\mathcal S}
\mathbb E[R_{t+1}\mid S_t=s,S_0=s_0]p^{(t)}(s\mid s_0)\
&amp;amp;=\sum_{s\in\mathcal S}r_\pi(s)p^{(t)}(s\mid s_0).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;马尔可夫无记忆性使下一奖励只依赖当前状态；又因为 $p^{(t)}(s\mid s_0)\to d_\pi(s)$：&lt;/p&gt;
&lt;p&gt;$$
\lim_{t\to\infty}\mathbb E[R_{t+1}\mid S_0=s_0]
=\sum_s r_\pi(s)d_\pi(s)
=\bar r_\pi.
$$&lt;/p&gt;
&lt;p&gt;这说明长期平均与起点无关。&lt;/p&gt;
&lt;h4&gt;Step 2：推广到任意初始分布&lt;/h4&gt;
&lt;p&gt;对任意初始分布 $d$ 使用全期望：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\lim_{n\to\infty}\frac{1}{n}
\mathbb E\left[\sum_{t=0}^{n-1}R_{t+1}\right]
&amp;amp;=\sum_sd(s)
\lim_{n\to\infty}\frac{1}{n}
\mathbb E\left[\sum_{t=0}^{n-1}R_{t+1}\mid S_0=s\right]\
&amp;amp;=\sum_sd(s)\bar r_\pi
=\bar r_\pi.
\end{aligned}
$$&lt;/p&gt;
&lt;h3&gt;2.5 Table 9.2：指标的等价表达&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;指标&lt;/th&gt;
&lt;th&gt;Expression 1&lt;/th&gt;
&lt;th&gt;Expression 2&lt;/th&gt;
&lt;th&gt;Expression 3&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$\bar v_\pi$&lt;/td&gt;
&lt;td&gt;$\sum_s d(s)v_\pi(s)$&lt;/td&gt;
&lt;td&gt;$\mathbb E_{S\sim d}[v_\pi(S)]$&lt;/td&gt;
&lt;td&gt;$\lim_{n\to\infty}\mathbb E[\sum_{t=0}^{n}\gamma^tR_{t+1}]$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\bar r_\pi$&lt;/td&gt;
&lt;td&gt;$\sum_s d_\pi(s)r_\pi(s)$&lt;/td&gt;
&lt;td&gt;$\mathbb E_{S\sim d_\pi}[r_\pi(S)]$&lt;/td&gt;
&lt;td&gt;$\lim_{n\to\infty}\frac{1}{n}\mathbb E[\sum_{t=0}^{n-1}R_{t+1}]$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三类标量指标是：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\bar v_\pi^0$：用与策略无关的 $d_0$ 加权；&lt;/li&gt;
&lt;li&gt;$\bar v_\pi$：用稳态分布 $d_\pi$ 加权；&lt;/li&gt;
&lt;li&gt;$\bar r_\pi$：稳态下的平均一步奖励。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;它们都是 $\pi$ 的函数，而 $\pi$ 又由 $\theta$ 参数化，所以都可以作为 $J(\theta)$ 进行梯度优化。&lt;/p&gt;
&lt;h2&gt;3. Policy Gradient Theorem&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Theorem 9.1 - Policy Gradient Theorem
本章不同指标、不同折扣设定下的策略梯度都可以概括为相似形式。具体的 $J(\theta)$、状态权重 $\eta$ 以及等号是严格成立还是近似成立，要分别查看 Theorem 9.2、9.3 和 9.5。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;求和形式为：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta J(\theta)
=\sum_{s\in\mathcal S}\eta(s)
\sum_{a\in\mathcal A}
\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a).
\tag{9.8}
$$&lt;/p&gt;
&lt;p&gt;期望形式为：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta J(\theta)
=\mathbb E_{S\sim\eta,,A\sim\pi(S,\theta)}
\left[
\nabla_\theta\ln\pi(A\mid S,\theta)q_\pi(S,A)
\right].
\tag{9.9}
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$\eta$：由具体指标和折扣情形决定的状态权重；&lt;/li&gt;
&lt;li&gt;$A\sim\pi(S,\theta)$：动作必须按当前策略分布抽取；&lt;/li&gt;
&lt;li&gt;$\nabla_\theta\ln\pi(A\mid S,\theta)$：score function，指出怎样改变参数能提高所选动作概率；&lt;/li&gt;
&lt;li&gt;$q_\pi(S,A)$：为这个方向赋予正负和大小。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3.1 从求和式到期望式&lt;/h3&gt;
&lt;p&gt;按期望定义，式 (9.8) 可写成：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta J(\theta)
=\mathbb E_{S\sim\eta}
\left[
\sum_{a\in\mathcal A}
\nabla_\theta\pi(a\mid S,\theta)q_\pi(S,a)
\right].
\tag{9.10}
$$&lt;/p&gt;
&lt;p&gt;对数导数恒等式为：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta\ln\pi(a\mid s,\theta)
=\frac{\nabla_\theta\pi(a\mid s,\theta)}
{\pi(a\mid s,\theta)}.
$$&lt;/p&gt;
&lt;p&gt;因而：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta\pi(a\mid s,\theta)
=\pi(a\mid s,\theta)
\nabla_\theta\ln\pi(a\mid s,\theta).
\tag{9.11}
$$&lt;/p&gt;
&lt;p&gt;代入式 (9.10)，内层求和正好成为对 $A\sim\pi(S,\theta)$ 的期望，从而得到式 (9.9)。这一步把无法直接枚举的真实梯度转化为可采样形式。&lt;/p&gt;
&lt;h3&gt;3.2 Softmax 策略&lt;/h3&gt;
&lt;p&gt;为了使 $\ln\pi(a\mid s,\theta)$ 对所有状态-动作对都有效，需要 $\pi(a\mid s,\theta)&amp;gt;0$。教材采用 softmax：&lt;/p&gt;
&lt;p&gt;$$
\pi(a\mid s,\theta)
=\frac{e^{h(s,a,\theta)}}
{\sum_{a&apos;\in\mathcal A}e^{h(s,a&apos;,\theta)}},
\qquad a\in\mathcal A.
\tag{9.12}
$$&lt;/p&gt;
&lt;p&gt;$h(s,a,\theta)$ 是在状态 $s$ 选择动作 $a$ 的偏好（preference）。Softmax 保证：&lt;/p&gt;
&lt;p&gt;$$
0&amp;lt;\pi(a\mid s,\theta)&amp;lt;1,
\qquad
\sum_a\pi(a\mid s,\theta)=1.
$$&lt;/p&gt;
&lt;p&gt;策略因此是随机且具有探索性的；它不直接返回唯一动作，而是返回采样动作所依据的概率分布。神经网络实现时，可输入 $s$，用输出层 softmax 同时产生所有动作概率。&lt;/p&gt;
&lt;h2&gt;4. 折扣情形下的梯度推导&lt;/h2&gt;
&lt;p&gt;本节设 $\gamma\in(0,1)$，价值定义为：&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s)
=\mathbb E[R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots\mid S_t=s],
$$&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s,a)
=\mathbb E[R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots
\mid S_t=s,A_t=a].
$$&lt;/p&gt;
&lt;p&gt;并且 $v_\pi(s)=\sum_a\pi(a\mid s,\theta)q_\pi(s,a)$。&lt;/p&gt;
&lt;h3&gt;4.1 Lemma 9.1：$\bar v_\pi$ 与 $\bar r_\pi$ 等价&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Lemma 9.1 - 折扣情形下两个指标的关系&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;$$
\bar r_\pi=(1-\gamma)\bar v_\pi.
\tag{9.13}
$$&lt;/p&gt;
&lt;p&gt;证明从 Bellman 方程开始：&lt;/p&gt;
&lt;p&gt;$$
v_\pi=r_\pi+\gamma P_\pi v_\pi.
$$&lt;/p&gt;
&lt;p&gt;左乘 $d_\pi^T$，利用 $d_\pi^TP_\pi=d_\pi^T$：&lt;/p&gt;
&lt;p&gt;$$
\bar v_\pi
=\bar r_\pi+\gamma d_\pi^TP_\pi v_\pi
=\bar r_\pi+\gamma\bar v_\pi,
$$&lt;/p&gt;
&lt;p&gt;移项即得式 (9.13)。因此在折扣情形下，最大化其中一个也会最大化另一个。&lt;/p&gt;
&lt;h3&gt;4.2 Lemma 9.2：单个状态价值的梯度&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!theorem] Lemma 9.2 - $\nabla_\theta v_\pi(s)$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;$$
\nabla_\theta v_\pi(s)
=\sum_{s&apos;\in\mathcal S}\Pr_\pi(s&apos;\mid s)
\sum_{a\in\mathcal A}
\nabla_\theta\pi(a\mid s&apos;,\theta)q_\pi(s&apos;,a).
\tag{9.14}
$$&lt;/p&gt;
&lt;p&gt;这里：&lt;/p&gt;
&lt;p&gt;$$
\Pr_\pi(s&apos;\mid s)
:=\sum_{k=0}^{\infty}\gamma^k[P_\pi^k]&lt;em&gt;{ss&apos;}
=\left[(I_n-\gamma P&lt;/em&gt;\pi)^{-1}\right]_{ss&apos;}
$$&lt;/p&gt;
&lt;p&gt;是从 $s$ 出发、经过任意步数到达 $s&apos;$ 的折扣总转移权重。&lt;/p&gt;
&lt;h3&gt;4.3 Box 9.2：Lemma 9.2 的证明&lt;/h3&gt;
&lt;p&gt;对 $v_\pi(s)=\sum_a\pi(a\mid s,\theta)q_\pi(s,a)$ 求导：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta v_\pi(s)
&amp;amp;=\nabla_\theta
\left[\sum_{a\in\mathcal A}\pi(a\mid s,\theta)q_\pi(s,a)\right]\
&amp;amp;=\sum_{a\in\mathcal A}
\left[
\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a)
+\pi(a\mid s,\theta)\nabla_\theta q_\pi(s,a)
\right].
\end{aligned}
\tag{9.15}
$$&lt;/p&gt;
&lt;p&gt;动作价值满足：&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s,a)
=r(s,a)+\gamma\sum_{s&apos;}p(s&apos;\mid s,a)v_\pi(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;环境奖励和转移模型不依赖 $\theta$，所以：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta q_\pi(s,a)
=\gamma\sum_{s&apos;}p(s&apos;\mid s,a)\nabla_\theta v_\pi(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;令：&lt;/p&gt;
&lt;p&gt;$$
u(s):=\sum_a\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a),
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\pi(s)
=u(s)+\gamma\sum_{s&apos;}p(s&apos;\mid s)\nabla_\theta v_\pi(s&apos;).
\tag{9.16}
$$&lt;/p&gt;
&lt;p&gt;因为每个 $\nabla_\theta v_\pi(s)$ 是 $m$ 维向量，堆叠后使用 Kronecker product：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\pi
=u+\gamma(P_\pi\otimes I_m)\nabla_\theta v_\pi.
$$&lt;/p&gt;
&lt;p&gt;解该线性方程：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta v_\pi
&amp;amp;=(I_{nm}-\gamma P_\pi\otimes I_m)^{-1}u\
&amp;amp;=\left[(I_n-\gamma P_\pi)^{-1}\otimes I_m\right]u.
\end{aligned}
\tag{9.17}
$$&lt;/p&gt;
&lt;p&gt;取对应状态 $s$ 的分块：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta v_\pi(s)
&amp;amp;=\sum_{s&apos;}
\left[(I_n-\gamma P_\pi)^{-1}\right]&lt;em&gt;{ss&apos;}u(s&apos;)\
&amp;amp;=\sum&lt;/em&gt;{s&apos;}
\left[(I_n-\gamma P_\pi)^{-1}\right]&lt;em&gt;{ss&apos;}
\sum_a\nabla&lt;/em&gt;\theta\pi(a\mid s&apos;,\theta)q_\pi(s&apos;,a).
\end{aligned}
\tag{9.18}
$$&lt;/p&gt;
&lt;p&gt;最后使用 Neumann series：&lt;/p&gt;
&lt;p&gt;$$
(I_n-\gamma P_\pi)^{-1}
=I_n+\gamma P_\pi+\gamma^2P_\pi^2+\cdots,
$$&lt;/p&gt;
&lt;p&gt;便得到式 (9.14) 的概率解释。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] 推导的核心思想
对策略求导后，$\nabla_\theta v_\pi$ 会再次出现在下一状态价值中。把递归关系写成线性方程，再用 $(I-\gamma P_\pi)^{-1}$ 汇总所有未来传播路径，就能消除递归。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.4 Theorem 9.2：$\bar v_\pi^0$ 的严格梯度&lt;/h3&gt;
&lt;p&gt;当 $d_0$ 与策略无关时：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta\bar v_\pi^0
=\mathbb E
\left[
\nabla_\theta\ln\pi(A\mid S,\theta)q_\pi(S,A)
\right],
$$&lt;/p&gt;
&lt;p&gt;其中 $S\sim\rho_\pi$、$A\sim\pi(S,\theta)$，且：&lt;/p&gt;
&lt;p&gt;$$
\rho_\pi(s)
=\sum_{s&apos;\in\mathcal S}d_0(s&apos;)\Pr_\pi(s\mid s&apos;),
\qquad s\in\mathcal S.
\tag{9.19}
$$&lt;/p&gt;
&lt;h3&gt;4.5 Box 9.3：Theorem 9.2 的证明&lt;/h3&gt;
&lt;p&gt;因为 $d_0$ 不依赖 $\theta$：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta\bar v_\pi^0
=\sum_sd_0(s)\nabla_\theta v_\pi(s).
$$&lt;/p&gt;
&lt;p&gt;代入 Lemma 9.2，交换 $s,s&apos;$ 的求和次序：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta\bar v_\pi^0
&amp;amp;=\sum_{s&apos;}
\left(\sum_sd_0(s)\Pr_\pi(s&apos;\mid s)\right)
\sum_a\nabla_\theta\pi(a\mid s&apos;,\theta)q_\pi(s&apos;,a)\
&amp;amp;=\sum_{s&apos;}\rho_\pi(s&apos;)
\sum_a\nabla_\theta\pi(a\mid s&apos;,\theta)q_\pi(s&apos;,a).
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;再用式 (9.11) 和期望定义得到定理结论。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 推论：$\rho_\pi$ 更像折扣访问权重
按式 (9.19) 和教材对 $\Pr_\pi$ 的定义可推出 $\sum_s\rho_\pi(s)=1/(1-\gamma)$。因此它不是通常归一化为 1 的概率分布，而是未归一化的 discounted occupancy weights。教材仍使用 $S\sim\rho_\pi$ 和 expectation 的记号，未另行讨论归一化；本文保留原式，不擅自加入缺失的归一化因子。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.6 Theorem 9.3：$\bar r_\pi$ 与 $\bar v_\pi$ 的近似梯度&lt;/h3&gt;
&lt;p&gt;折扣情形下：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta\bar r_\pi
&amp;amp;=(1-\gamma)\nabla_\theta\bar v_\pi\
&amp;amp;\approx\sum_sd_\pi(s)
\sum_a\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a)\
&amp;amp;=\mathbb E
\left[
\nabla_\theta\ln\pi(A\mid S,\theta)q_\pi(S,A)
\right],
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;其中 $S\sim d_\pi$、$A\sim\pi(S,\theta)$。该近似在 $\gamma$ 更接近 $1$ 时更准确。&lt;/p&gt;
&lt;h3&gt;4.7 Box 9.4：近似从哪里产生&lt;/h3&gt;
&lt;p&gt;因为 $d_\pi$ 也依赖策略：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta\bar v_\pi
&amp;amp;=\nabla_\theta\sum_sd_\pi(s)v_\pi(s)\
&amp;amp;=\sum_s\nabla_\theta d_\pi(s)v_\pi(s)
+\sum_sd_\pi(s)\nabla_\theta v_\pi(s).
\end{aligned}
\tag{9.20}
$$&lt;/p&gt;
&lt;p&gt;第二项代入式 (9.17)：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\sum_sd_\pi(s)\nabla_\theta v_\pi(s)
&amp;amp;=(d_\pi^T\otimes I_m)\nabla_\theta v_\pi\
&amp;amp;=\left[d_\pi^T(I_n-\gamma P_\pi)^{-1}\otimes I_m\right]u.
\end{aligned}
\tag{9.21}
$$&lt;/p&gt;
&lt;p&gt;由稳态关系可验证：&lt;/p&gt;
&lt;p&gt;$$
d_\pi^T(I_n-\gamma P_\pi)^{-1}
=\frac{1}{1-\gamma}d_\pi^T.
$$&lt;/p&gt;
&lt;p&gt;所以第二项带有 $1/(1-\gamma)$。教材在 $\gamma\to1$ 时把它视为主导项，并忽略式 (9.20) 中含 $\nabla_\theta d_\pi$ 的第一项，从而得到 Theorem 9.3 的近似。教材明确指出，这要求被忽略的第一项在 $\gamma\to1$ 时不发散。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点
$\bar r_\pi=(1-\gamma)\bar v_\pi$ 是严格关系，因此两边的梯度关系也是严格的；近似发生在用稳态分布加权的 score-function 表达去替代完整梯度时，而不是发生在 Lemma 9.1 本身。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;5. 无折扣情形：差分价值与 Poisson 方程&lt;/h2&gt;
&lt;p&gt;本节设 $\gamma=1$。直接累加 $R_{t+1}+R_{t+2}+\cdots$ 可能发散，因此需要减去长期平均奖励。&lt;/p&gt;
&lt;h3&gt;5.1 重新定义状态价值和动作价值&lt;/h3&gt;
&lt;p&gt;$$
v_\pi(s)
:=\mathbb E\left[
\sum_{k=1}^{\infty}(R_{t+k}-\bar r_\pi)
\mid S_t=s
\right],
$$&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s,a)
:=\mathbb E\left[
\sum_{k=1}^{\infty}(R_{t+k}-\bar r_\pi)
\mid S_t=s,A_t=a
\right].
$$&lt;/p&gt;
&lt;p&gt;教材指出，这种 $v_\pi$ 在文献中也称 differential reward 或 bias。&lt;/p&gt;
&lt;p&gt;它满足 Bellman-like equation：&lt;/p&gt;
&lt;p&gt;$$
v_\pi(s)
=\sum_a\pi(a\mid s,\theta)
\left[
\sum_rp(r\mid s,a)(r-\bar r_\pi)
+\sum_{s&apos;}p(s&apos;\mid s,a)v_\pi(s&apos;)
\right].
\tag{9.22}
$$&lt;/p&gt;
&lt;p&gt;矩阵形式称为 Poisson equation：&lt;/p&gt;
&lt;p&gt;$$
v_\pi
=r_\pi-\bar r_\pi\mathbf 1_n+P_\pi v_\pi.
\tag{9.23}
$$&lt;/p&gt;
&lt;h3&gt;5.2 Theorem 9.4：Poisson 方程的解&lt;/h3&gt;
&lt;p&gt;定义：&lt;/p&gt;
&lt;p&gt;$$
v_\pi^*
=\left(I_n-P_\pi+\mathbf 1_nd_\pi^T\right)^{-1}r_\pi.
\tag{9.24}
$$&lt;/p&gt;
&lt;p&gt;则 $v_\pi^*$ 是 Poisson 方程的一个解，而且任意解都可写成：&lt;/p&gt;
&lt;p&gt;$$
v_\pi=v_\pi^*+c\mathbf 1_n,
\qquad c\in\mathbb R.
$$&lt;/p&gt;
&lt;p&gt;所以无折扣差分价值只确定到一个加性常数。&lt;/p&gt;
&lt;h3&gt;5.3 Box 9.5：Theorem 9.4 的证明结构&lt;/h3&gt;
&lt;h4&gt;Step 1：验证给出的向量确实是解&lt;/h4&gt;
&lt;p&gt;令：&lt;/p&gt;
&lt;p&gt;$$
A:=I_n-P_\pi+\mathbf 1_nd_\pi^T.
$$&lt;/p&gt;
&lt;p&gt;将 $v_\pi^*=A^{-1}r_\pi$ 代入式 (9.23)，再使用 $d_\pi^Tr_\pi=\bar r_\pi$、$d_\pi^TP_\pi=d_\pi^T$ 与 $P_\pi\mathbf 1_n=\mathbf 1_n$，可验证等式成立。&lt;/p&gt;
&lt;h4&gt;Step 2：说明解为什么不唯一&lt;/h4&gt;
&lt;p&gt;代入 $\bar r_\pi=d_\pi^Tr_\pi$：&lt;/p&gt;
&lt;p&gt;$$
v_\pi
=r_\pi-\mathbf 1_nd_\pi^Tr_\pi+P_\pi v_\pi.
\tag{9.25}
$$&lt;/p&gt;
&lt;p&gt;整理为：&lt;/p&gt;
&lt;p&gt;$$
(I_n-P_\pi)v_\pi
=(I_n-\mathbf 1_nd_\pi^T)r_\pi.
\tag{9.26}
$$&lt;/p&gt;
&lt;p&gt;由于 $(I_n-P_\pi)\mathbf 1_n=0$，矩阵 $I_n-P_\pi$ 奇异。若 $P_\pi$ 不可约，则：&lt;/p&gt;
&lt;p&gt;$$
\operatorname{Null}(I_n-P_\pi)
=\operatorname{span}{\mathbf 1_n}.
$$&lt;/p&gt;
&lt;p&gt;因此给任意一个解加上 $c\mathbf 1_n$ 仍是解。&lt;/p&gt;
&lt;h4&gt;Step 3：证明 $A$ 可逆&lt;/h4&gt;
&lt;p&gt;这一步由 Lemma 9.3 完成。&lt;/p&gt;
&lt;h3&gt;5.4 Lemma 9.3：矩阵逆的级数表达&lt;/h3&gt;
&lt;p&gt;矩阵 $I_n-P_\pi+\mathbf 1_nd_\pi^T$ 可逆，且：&lt;/p&gt;
&lt;p&gt;$$
\left[I_n-(P_\pi-\mathbf 1_nd_\pi^T)\right]^{-1}
=\sum_{k=1}^{\infty}(P_\pi^k-\mathbf 1_nd_\pi^T)+I_n.
$$&lt;/p&gt;
&lt;p&gt;关键恒等式是：&lt;/p&gt;
&lt;p&gt;$$
(P_\pi-\mathbf 1_nd_\pi^T)^k
=P_\pi^k-\mathbf 1_nd_\pi^T,
\qquad k\ge1.
\tag{9.27}
$$&lt;/p&gt;
&lt;p&gt;它可由归纳法证明。又因为 $P_\pi^k\to\mathbf 1_nd_\pi^T$：&lt;/p&gt;
&lt;p&gt;$$
(P_\pi-\mathbf 1_nd_\pi^T)^k\to0.
$$&lt;/p&gt;
&lt;p&gt;故该矩阵谱半径小于 $1$，Neumann series 收敛，矩阵可逆。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 教材对参考文献的更正
教材明确指出参考文献 [66] 中把逆矩阵写成 $\sum_{k=0}^{\infty}(P_\pi^k-\mathbf 1_nd_\pi^T)$ 是不准确的，因为该和式乘 $\mathbf 1_n$ 为零，因而奇异。Lemma 9.3 的正确表达额外保留了 $I_n$，等价于从 $k=1$ 开始求和再加 $I_n$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.5 为什么平均奖励唯一而差分价值不唯一&lt;/h3&gt;
&lt;p&gt;由 Poisson 方程：&lt;/p&gt;
&lt;p&gt;$$
\bar r_\pi\mathbf 1_n
=r_\pi+(P_\pi-I_n)v_\pi.
$$&lt;/p&gt;
&lt;p&gt;若 $v_\pi=v_\pi^*+c\mathbf 1_n$，则：&lt;/p&gt;
&lt;p&gt;$$
(P_\pi-I_n)c\mathbf 1_n=0.
$$&lt;/p&gt;
&lt;p&gt;未定常数被消掉，所以 $\bar r_\pi$ 唯一；但 $v_\pi$ 和 $\bar v_\pi$ 在未增加归一化约束时不唯一。因此教材只研究无折扣情形下 $\bar r_\pi$ 的梯度。&lt;/p&gt;
&lt;h3&gt;5.6 Theorem 9.5：平均奖励的严格梯度&lt;/h3&gt;
&lt;p&gt;无折扣情形下：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta\bar r_\pi
&amp;amp;=\sum_sd_\pi(s)
\sum_a\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a)\
&amp;amp;=\mathbb E
\left[
\nabla_\theta\ln\pi(A\mid S,\theta)q_\pi(S,A)
\right],
\end{aligned}
\tag{9.28}
$$&lt;/p&gt;
&lt;p&gt;其中 $S\sim d_\pi$、$A\sim\pi(S,\theta)$。与 Theorem 9.3 不同，这里是严格等式。&lt;/p&gt;
&lt;h3&gt;5.7 Box 9.6：Theorem 9.5 的证明&lt;/h3&gt;
&lt;p&gt;再次从乘积求导开始：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta v_\pi(s)
&amp;amp;=\nabla_\theta
\left[\sum_a\pi(a\mid s,\theta)q_\pi(s,a)\right]\
&amp;amp;=\sum_a
\left[
\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a)
+\pi(a\mid s,\theta)\nabla_\theta q_\pi(s,a)
\right].
\end{aligned}
\tag{9.29}
$$&lt;/p&gt;
&lt;p&gt;无折扣动作价值满足：&lt;/p&gt;
&lt;p&gt;$$
q_\pi(s,a)
=r(s,a)-\bar r_\pi
+\sum_{s&apos;}p(s&apos;\mid s,a)v_\pi(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;所以：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta q_\pi(s,a)
=-\nabla_\theta\bar r_\pi
+\sum_{s&apos;}p(s&apos;\mid s,a)\nabla_\theta v_\pi(s&apos;).
$$&lt;/p&gt;
&lt;p&gt;代回式 (9.29)，并使用 $\sum_a\pi(a\mid s,\theta)=1$：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\nabla_\theta v_\pi(s)
&amp;amp;=\sum_a\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a)
-\nabla_\theta\bar r_\pi\
&amp;amp;\quad+\sum_a\pi(a\mid s,\theta)
\sum_{s&apos;}p(s&apos;\mid s,a)\nabla_\theta v_\pi(s&apos;).
\end{aligned}
\tag{9.30}
$$&lt;/p&gt;
&lt;p&gt;令 $u(s)=\sum_a\nabla_\theta\pi(a\mid s,\theta)q_\pi(s,a)$，堆叠成向量后：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta v_\pi
=u-\mathbf 1_n\otimes\nabla_\theta\bar r_\pi
+(P_\pi\otimes I_m)\nabla_\theta v_\pi.
$$&lt;/p&gt;
&lt;p&gt;整理并左乘 $d_\pi^T\otimes I_m$。因为：&lt;/p&gt;
&lt;p&gt;$$
d_\pi^T\mathbf 1_n=1,
\qquad
d_\pi^TP_\pi=d_\pi^T,
$$&lt;/p&gt;
&lt;p&gt;含 $\nabla_\theta v_\pi$ 的两项相互抵消，得到：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta\bar r_\pi
=\sum_sd_\pi(s)u(s),
$$&lt;/p&gt;
&lt;p&gt;也就是式 (9.28)。&lt;/p&gt;
&lt;h2&gt;6. 三种策略梯度情形的统一与区别&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;情形&lt;/th&gt;
&lt;th&gt;指标 $J(\theta)$&lt;/th&gt;
&lt;th&gt;状态权重&lt;/th&gt;
&lt;th&gt;结论性质&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;折扣，固定 $d_0$&lt;/td&gt;
&lt;td&gt;$\bar v_\pi^0$&lt;/td&gt;
&lt;td&gt;$\rho_\pi$&lt;/td&gt;
&lt;td&gt;Theorem 9.2，严格形式&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;折扣，稳态 $d_\pi$&lt;/td&gt;
&lt;td&gt;$\bar r_\pi$ 或 $\bar v_\pi$&lt;/td&gt;
&lt;td&gt;$d_\pi$&lt;/td&gt;
&lt;td&gt;Theorem 9.3，score-function 形式为近似，$\gamma\to1$ 时更准&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;无折扣，平均奖励&lt;/td&gt;
&lt;td&gt;$\bar r_\pi$&lt;/td&gt;
&lt;td&gt;$d_\pi$&lt;/td&gt;
&lt;td&gt;Theorem 9.5，严格形式&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三者都能写成 Theorem 9.1 的外观，但不能忽略状态权重和严格性条件。&lt;/p&gt;
&lt;h2&gt;7. Monte Carlo Policy Gradient：REINFORCE&lt;/h2&gt;
&lt;h3&gt;7.1 从真实梯度到随机梯度&lt;/h3&gt;
&lt;p&gt;真实梯度上升为：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\theta_{t+1}
&amp;amp;=\theta_t+\alpha\nabla_\theta J(\theta_t)\
&amp;amp;=\theta_t+\alpha\mathbb E
\left[
\nabla_\theta\ln\pi(A\mid S,\theta_t)q_\pi(S,A)
\right].
\end{aligned}
\tag{9.31}
$$&lt;/p&gt;
&lt;p&gt;期望未知时，用样本 $(s_t,a_t)$ 以及动作价值估计 $q_t(s_t,a_t)$ 替代：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t+\alpha
\nabla_\theta\ln\pi(a_t\mid s_t,\theta_t)
q_t(s_t,a_t).
\tag{9.32}
$$&lt;/p&gt;
&lt;p&gt;当 $q_t$ 用完整回合的 Monte Carlo return 估计时，该算法称为 REINFORCE 或 Monte Carlo policy gradient。&lt;/p&gt;
&lt;h3&gt;7.2 更新的数学解释&lt;/h3&gt;
&lt;p&gt;使用对数导数恒等式：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t+\alpha
\frac{q_t(s_t,a_t)}{\pi(a_t\mid s_t,\theta_t)}
\nabla_\theta\pi(a_t\mid s_t,\theta_t).
$$&lt;/p&gt;
&lt;p&gt;定义：&lt;/p&gt;
&lt;p&gt;$$
\beta_t
:=\frac{q_t(s_t,a_t)}{\pi(a_t\mid s_t,\theta_t)},
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;p&gt;$$
\theta_{t+1}
=\theta_t+\alpha\beta_t
\nabla_\theta\pi(a_t\mid s_t,\theta_t).
\tag{9.33}
$$&lt;/p&gt;
&lt;p&gt;当步长足够小时，对 $\pi(a_t\mid s_t,\theta_{t+1})$ 作一阶 Taylor 展开：&lt;/p&gt;
&lt;p&gt;$$
\begin{aligned}
\pi(a_t\mid s_t,\theta_{t+1})
&amp;amp;\approx\pi(a_t\mid s_t,\theta_t)
+\left(\nabla_\theta\pi(a_t\mid s_t,\theta_t)\right)^T
(\theta_{t+1}-\theta_t)\
&amp;amp;=\pi(a_t\mid s_t,\theta_t)
+\alpha\beta_t
\left\lVert\nabla_\theta\pi(a_t\mid s_t,\theta_t)\right\rVert_2^2.
\end{aligned}
$$&lt;/p&gt;
&lt;p&gt;因此：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;若 $\beta_t\ge0$，所选动作概率增大；&lt;/li&gt;
&lt;li&gt;若 $\beta_t&amp;lt;0$，所选动作概率减小；&lt;/li&gt;
&lt;li&gt;$\lvert\beta_t\rvert$ 越大，局部改变越强。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;教材还从 $\beta_t=q_t/\pi$ 解释探索与利用：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$q_t$ 较大时，提高高价值动作概率，体现 exploitation；&lt;/li&gt;
&lt;li&gt;在 $q_t&amp;gt;0$ 时，原概率较小会使 $\beta_t$ 较大，从而更强地提高低概率动作，体现一定程度的 exploration。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;7.3 Algorithm 9.1：Policy Gradient by Monte Carlo&lt;/h3&gt;
&lt;h4&gt;目标&lt;/h4&gt;
&lt;p&gt;学习最大化 $J(\theta)$ 的策略。&lt;/p&gt;
&lt;h4&gt;输入&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;初始参数 $\theta$；&lt;/li&gt;
&lt;li&gt;折扣因子 $\gamma\in(0,1)$；&lt;/li&gt;
&lt;li&gt;学习率 $\alpha&amp;gt;0$。&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;核心步骤&lt;/h4&gt;
&lt;pre&gt;&lt;code&gt;对每个回合：
    按当前策略 π(θ) 生成完整回合
        {s0, a0, r1, ..., sT-1, aT-1, rT}

    对 t = 0, 1, ..., T-1：
        q_t(st, at) &amp;lt;- Σ_{k=t+1}^{T} γ^(k-t-1) r_k
        θ &amp;lt;- θ + α grad_θ ln π(at | st, θ) q_t(st, at)
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;完整 Monte Carlo 回报为：&lt;/p&gt;
&lt;p&gt;$$
q_t(s_t,a_t)
=\sum_{k=t+1}^{T}\gamma^{k-t-1}r_k.
$$&lt;/p&gt;
&lt;h4&gt;输出&lt;/h4&gt;
&lt;p&gt;优化后的随机策略 $\pi(a\mid s,\theta)$。&lt;/p&gt;
&lt;h4&gt;停止条件&lt;/h4&gt;
&lt;p&gt;教材按回合重复，没有指定唯一停止规则；实现中可使用固定回合数、指标稳定或参数变化足够小等外部条件。&lt;/p&gt;
&lt;h3&gt;7.4 怎样采样 $S$ 和 $A$&lt;/h3&gt;
&lt;p&gt;理论期望要求：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;$S$ 服从 $\eta$，即 $d_\pi$ 或式 (9.19) 的 $\rho_\pi$；&lt;/li&gt;
&lt;li&gt;$A$ 服从当前策略 $\pi(A\mid S,\theta)$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此基本策略梯度是 &lt;strong&gt;on-policy&lt;/strong&gt;。实践中的 Algorithm 9.1 先按当前策略生成整条回合，再复用回合中的每个样本多次更新参数。教材指出，这提高了样本利用率，但并不严格遵循每一步都从理想长期分布重新独立采样的方式。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] 补充理解
REINFORCE 的价值估计来自完整回报，因此无需价值网络，但必须等回合结束，而且 Monte Carlo 回报通常方差较大。下一章 Actor-Critic 将引入 critic，用学习到的价值估计替代完整回报。这一联系由教材在总结中指出；有关方差降低的具体技术不在本章展开。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;8. 本章 Q&amp;amp;A&lt;/h2&gt;
&lt;h3&gt;Q1：策略梯度方法的基本思想是什么？&lt;/h3&gt;
&lt;p&gt;定义合适的标量指标，推导其梯度，再用梯度上升优化策略参数。最关键的理论结果是 Theorem 9.1。&lt;/p&gt;
&lt;h3&gt;Q2：最复杂的部分是什么？&lt;/h3&gt;
&lt;p&gt;不是梯度上升本身，而是对不同指标以及折扣、无折扣情形分别推导梯度。Theorem 9.1 统一了这些结果的外观。&lt;/p&gt;
&lt;h3&gt;Q3：可以使用哪些指标？&lt;/h3&gt;
&lt;p&gt;教材介绍 $\bar v_\pi$、$\bar v_\pi^0$ 和 $\bar r_\pi$。它们都能导出相似的策略梯度。文献中尤其常见式 (9.1) 的期望折扣回报和式 (9.4) 的长期平均奖励。&lt;/p&gt;
&lt;h3&gt;Q4：策略梯度中为什么有自然对数？&lt;/h3&gt;
&lt;p&gt;因为：&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta\pi
=\pi\nabla_\theta\ln\pi.
$$&lt;/p&gt;
&lt;p&gt;它把对概率的梯度改写成策略分布下的期望，使真实梯度可以用随机样本近似。&lt;/p&gt;
&lt;h3&gt;Q5：为什么还要研究无折扣情形？&lt;/h3&gt;
&lt;p&gt;平均奖励 $\bar r_\pi$ 对折扣和无折扣情形都有效。折扣情形的稳态 score-function 表达在教材中是近似，而无折扣平均奖励梯度的 Theorem 9.5 是严格等式。&lt;/p&gt;
&lt;h3&gt;Q6：式 (9.32) 在数学上做了什么？&lt;/h3&gt;
&lt;p&gt;它沿 $\nabla_\theta\pi(a_t\mid s_t,\theta_t)$ 的方向调整参数。系数 $\beta_t$ 为正时提高所选动作概率，为负时降低概率，绝对值决定局部更新强度。&lt;/p&gt;
&lt;h2&gt;9. 本章总结&lt;/h2&gt;
&lt;p&gt;本章从表格型策略在大空间中难以存储和泛化的问题出发，把策略参数化为 $\pi(a\mid s,\theta)$。参数化之后，“最优”必须由一个标量指标定义，于是引入平均状态价值和平均奖励。策略变化会改变动作概率、价值以及状态访问分布，导致梯度推导复杂；Policy Gradient Theorem 最终把这些依赖压缩成 score function 与动作价值的乘积期望。折扣情形下，教材分别给出固定初始分布的严格梯度和稳态分布下的近似梯度；无折扣情形通过差分价值和 Poisson 方程得到平均奖励的严格梯度。最后，用轨迹回报近似 $q_\pi$，便得到 REINFORCE。&lt;/p&gt;
&lt;p&gt;整章的因果链是：&lt;/p&gt;
&lt;p&gt;$$
\text{参数化策略}
\to
\text{标量指标}
\to
\text{Policy Gradient Theorem}
\to
\text{样本化梯度}
\to
\text{REINFORCE}.
$$&lt;/p&gt;
&lt;h2&gt;10. 一页式复习&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;策略函数：$\pi(a\mid s,\theta)$，参数为 $\theta$。&lt;/li&gt;
&lt;li&gt;策略梯度三步：选指标、求梯度、用样本近似。&lt;/li&gt;
&lt;li&gt;平均状态价值：$\bar v_\pi=\sum_sd(s)v_\pi(s)$。&lt;/li&gt;
&lt;li&gt;平均奖励：$\bar r_\pi=\sum_sd_\pi(s)r_\pi(s)$。&lt;/li&gt;
&lt;li&gt;折扣情形：$\bar r_\pi=(1-\gamma)\bar v_\pi$。&lt;/li&gt;
&lt;li&gt;核心定理：$\nabla J=\mathbb E[\nabla\ln\pi,q_\pi]$。&lt;/li&gt;
&lt;li&gt;Softmax 保证所有动作概率为正且和为 1。&lt;/li&gt;
&lt;li&gt;Theorem 9.2：固定 $d_0$ 的 $\bar v_\pi^0$ 梯度为严格形式，状态权重是 $\rho_\pi$。&lt;/li&gt;
&lt;li&gt;Theorem 9.3：稳态折扣梯度的 score-function 表达是近似，$\gamma$ 接近 1 时更准确。&lt;/li&gt;
&lt;li&gt;无折扣价值要减去 $\bar r_\pi$，并满足 Poisson 方程。&lt;/li&gt;
&lt;li&gt;差分价值只确定到常数 $c\mathbf 1_n$，平均奖励仍唯一。&lt;/li&gt;
&lt;li&gt;Theorem 9.5：无折扣平均奖励梯度是严格等式。&lt;/li&gt;
&lt;li&gt;REINFORCE：$\theta\leftarrow\theta+\alpha\nabla\ln\pi,G_t$。&lt;/li&gt;
&lt;li&gt;基本 REINFORCE 是 on-policy，并使用完整回报。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2&gt;11. 公式清单&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;公式&lt;/th&gt;
&lt;th&gt;名称&lt;/th&gt;
&lt;th&gt;作用&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$\bar v_\pi=\sum_sd(s)v_\pi(s)$&lt;/td&gt;
&lt;td&gt;平均状态价值&lt;/td&gt;
&lt;td&gt;把逐状态价值压缩成标量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\bar r_\pi=\sum_sd_\pi(s)r_\pi(s)$&lt;/td&gt;
&lt;td&gt;平均奖励&lt;/td&gt;
&lt;td&gt;衡量稳态长期一步奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\bar r_\pi=(1-\gamma)\bar v_\pi$&lt;/td&gt;
&lt;td&gt;指标等价关系&lt;/td&gt;
&lt;td&gt;连接折扣平均价值与平均奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\nabla_\theta\pi=\pi\nabla_\theta\ln\pi$&lt;/td&gt;
&lt;td&gt;Log-derivative trick&lt;/td&gt;
&lt;td&gt;把求和式化为可采样期望&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\nabla J=\mathbb E[\nabla\ln\pi,q_\pi]$&lt;/td&gt;
&lt;td&gt;Policy Gradient Theorem&lt;/td&gt;
&lt;td&gt;给出策略参数的上升方向&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$v_\pi=r_\pi-\bar r_\pi\mathbf1_n+P_\pi v_\pi$&lt;/td&gt;
&lt;td&gt;Poisson equation&lt;/td&gt;
&lt;td&gt;描述无折扣差分价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\theta_{t+1}=\theta_t+\alpha\nabla\ln\pi(a_t\mid s_t,\theta_t)q_t$&lt;/td&gt;
&lt;td&gt;REINFORCE update&lt;/td&gt;
&lt;td&gt;用单个样本近似真实梯度&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;12. 符号表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$\theta\in\mathbb R^m$&lt;/td&gt;
&lt;td&gt;策略函数的参数向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\pi(a\mid s,\theta)$&lt;/td&gt;
&lt;td&gt;参数化随机策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$h(s,a,\theta)$&lt;/td&gt;
&lt;td&gt;Softmax 中的动作偏好&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$J(\theta)$&lt;/td&gt;
&lt;td&gt;要最大化的标量策略指标&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$d_0$&lt;/td&gt;
&lt;td&gt;与策略无关的状态分布&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$d_\pi$&lt;/td&gt;
&lt;td&gt;策略诱导的稳态分布&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\rho_\pi$&lt;/td&gt;
&lt;td&gt;由 $d_0$ 与折扣总转移权重得到的状态权重&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\eta$&lt;/td&gt;
&lt;td&gt;Theorem 9.1 中概括性的状态权重&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\bar v_\pi^0$&lt;/td&gt;
&lt;td&gt;按 $d_0$ 加权的平均状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\bar v_\pi$&lt;/td&gt;
&lt;td&gt;按 $d_\pi$ 加权的平均状态价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\bar r_\pi$&lt;/td&gt;
&lt;td&gt;稳态平均一步奖励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$q_\pi(s,a)$&lt;/td&gt;
&lt;td&gt;策略 $\pi$ 下的动作价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\Pr_\pi(s&apos;\mid s)$&lt;/td&gt;
&lt;td&gt;从 $s$ 到 $s&apos;$ 的折扣总转移权重&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\otimes$&lt;/td&gt;
&lt;td&gt;Kronecker product&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\mathbf 1_n$&lt;/td&gt;
&lt;td&gt;$n$ 维全 1 向量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$\beta_t$&lt;/td&gt;
&lt;td&gt;$q_t(s_t,a_t)/\pi(a_t\mid s_t,\theta_t)$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;13. 术语表&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;English&lt;/th&gt;
&lt;th&gt;中文&lt;/th&gt;
&lt;th&gt;简要解释&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;policy-based method&lt;/td&gt;
&lt;td&gt;基于策略的方法&lt;/td&gt;
&lt;td&gt;直接表示和优化策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;policy gradient&lt;/td&gt;
&lt;td&gt;策略梯度&lt;/td&gt;
&lt;td&gt;指标对策略参数的梯度&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;average state value&lt;/td&gt;
&lt;td&gt;平均状态价值&lt;/td&gt;
&lt;td&gt;按状态分布加权的价值均值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;average reward&lt;/td&gt;
&lt;td&gt;平均奖励&lt;/td&gt;
&lt;td&gt;稳态下每一步奖励的长期平均&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;score function&lt;/td&gt;
&lt;td&gt;得分函数&lt;/td&gt;
&lt;td&gt;$\nabla_\theta\ln\pi(a\mid s,\theta)$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;softmax policy&lt;/td&gt;
&lt;td&gt;Softmax 策略&lt;/td&gt;
&lt;td&gt;将偏好归一化为正概率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;discounted total probability&lt;/td&gt;
&lt;td&gt;折扣总转移权重&lt;/td&gt;
&lt;td&gt;对各步转移概率按 $\gamma^k$ 加权求和&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;differential reward&lt;/td&gt;
&lt;td&gt;差分奖励价值&lt;/td&gt;
&lt;td&gt;以 $R-\bar r_\pi$ 为增量定义的价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;bias&lt;/td&gt;
&lt;td&gt;偏差函数&lt;/td&gt;
&lt;td&gt;无折扣差分状态价值的另一名称&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Poisson equation&lt;/td&gt;
&lt;td&gt;Poisson 方程&lt;/td&gt;
&lt;td&gt;无折扣差分价值的 Bellman-like 方程&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;REINFORCE&lt;/td&gt;
&lt;td&gt;REINFORCE&lt;/td&gt;
&lt;td&gt;用 Monte Carlo 回报更新策略的算法&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;on-policy&lt;/td&gt;
&lt;td&gt;同策略&lt;/td&gt;
&lt;td&gt;生成样本的策略就是被优化的策略&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;14. 常见误区&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 1：策略梯度不是对动作求梯度
梯度变量是策略参数 $\theta$，不是离散动作 $a$。动作由策略概率分布采样。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 2：Theorem 9.1 的所有实例并非都严格相等
Theorem 9.2 和无折扣 Theorem 9.5 给出严格结果；Theorem 9.3 的稳态 score-function 表达在教材中是 $\gamma\to1$ 时的近似。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 3：$\bar v_\pi^0$ 与 $\bar v_\pi$ 的权重不同
前者使用与策略无关的 $d_0$，后者使用会随参数变化的 $d_\pi$。对后者求导必须注意 $\nabla_\theta d_\pi$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 4：对数不是改变了优化目标
$\ln\pi$ 来自恒等式 $\nabla\pi=\pi\nabla\ln\pi$，用于把梯度写成策略分布下的期望。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 5：无折扣价值不能直接定义为无限奖励和
该和可能发散，必须使用中心化奖励 $R-\bar r_\pi$。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 6：Poisson 方程的价值解不唯一
$v_\pi$ 可以整体平移 $c\mathbf 1_n$，但这不影响唯一的平均奖励。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 易错点 7：REINFORCE 不是 value-based 方法
虽然更新中使用 $q_\pi$ 的估计，真正被直接参数化和优化的是策略；Chapter 10 才把 policy-based actor 与 value-based critic 结合起来。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;15. 自测题&lt;/h2&gt;
&lt;h3&gt;15.1 概念题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;为什么把策略从表格换成函数后，需要标量指标定义“最优”？&lt;/li&gt;
&lt;li&gt;$d_0$ 与 $d_\pi$ 的区别是什么？&lt;/li&gt;
&lt;li&gt;为什么 log-derivative trick 能让策略梯度可采样？&lt;/li&gt;
&lt;li&gt;Softmax 策略为什么天然是随机策略？&lt;/li&gt;
&lt;li&gt;Theorem 9.3 的近似来自哪一项被忽略？&lt;/li&gt;
&lt;li&gt;为什么无折扣差分价值不唯一，而平均奖励唯一？&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;梯度法一次只能优化标量，函数参数又被多个状态共享，因此必须先用状态分布把各状态表现汇总为 $J(\theta)$。&lt;/li&gt;
&lt;li&gt;$d_0$ 不随策略参数变化，$d_\pi$ 是策略诱导的稳态分布，会随 $\theta$ 改变。&lt;/li&gt;
&lt;li&gt;$\nabla\pi=\pi\nabla\ln\pi$ 把动作求和写成 $A\sim\pi$ 的期望，进而能用动作样本估计。&lt;/li&gt;
&lt;li&gt;有限偏好经过 softmax 后每个动作概率都严格为正，且所有概率之和为 1。&lt;/li&gt;
&lt;li&gt;式 (9.20) 中的 $\sum_s\nabla_\theta d_\pi(s)v_\pi(s)$ 被忽略，另一项在 $\gamma\to1$ 时含主导因子 $1/(1-\gamma)$。&lt;/li&gt;
&lt;li&gt;$I-P_\pi$ 的零空间包含 $\mathbf1_n$，所以价值可整体平移；在平均奖励公式中 $(P_\pi-I)c\mathbf1_n=0$，常数被消掉。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;15.2 判断题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;只要使用函数表示策略，Policy Gradient Theorem 的期望式在所有情形都严格成立。&lt;/li&gt;
&lt;li&gt;在基本 REINFORCE 中，动作应由当前策略采样。&lt;/li&gt;
&lt;li&gt;若 $\beta_t&amp;lt;0$，式 (9.33) 的局部效果是降低所选动作概率。&lt;/li&gt;
&lt;li&gt;无折扣 Poisson 方程总能唯一确定 $v_\pi$。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;错。Theorem 9.3 中教材给出的稳态 score-function 形式是近似。&lt;/li&gt;
&lt;li&gt;对，因此基本算法是 on-policy。&lt;/li&gt;
&lt;li&gt;对，在一阶 Taylor 近似和足够小步长下成立。&lt;/li&gt;
&lt;li&gt;错。任意解加 $c\mathbf1_n$ 仍是解。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;15.3 推导题&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;从 Bellman 方程推导 $\bar r_\pi=(1-\gamma)\bar v_\pi$。&lt;/li&gt;
&lt;li&gt;从 $\nabla_\theta\pi=\pi\nabla_\theta\ln\pi$ 推导式 (9.9)。&lt;/li&gt;
&lt;li&gt;从式 (9.16) 写出矩阵方程并推导式 (9.17)。&lt;/li&gt;
&lt;li&gt;证明 $(P_\pi-\mathbf1_nd_\pi^T)^2=P_\pi^2-\mathbf1_nd_\pi^T$。&lt;/li&gt;
&lt;li&gt;从式 (9.30) 左乘 $d_\pi^T\otimes I_m$，说明为什么价值梯度项抵消。&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;左乘 $d_\pi^T$ 并使用 $d_\pi^TP_\pi=d_\pi^T$。&lt;/li&gt;
&lt;li&gt;在式 (9.8) 中乘入 $\pi(a\mid s,\theta)$，再把动作求和识别为条件期望。&lt;/li&gt;
&lt;li&gt;堆叠各状态的 $m$ 维梯度，得到 $\nabla v=u+\gamma(P_\pi\otimes I_m)\nabla v$。&lt;/li&gt;
&lt;li&gt;展开平方，并使用 $P_\pi\mathbf1_n=\mathbf1_n$、$d_\pi^TP_\pi=d_\pi^T$、$d_\pi^T\mathbf1_n=1$。&lt;/li&gt;
&lt;li&gt;同样使用稳态关系，$(d_\pi^TP_\pi)\otimes I_m$ 与 $d_\pi^T\otimes I_m$ 产生相同项。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;15.4 算法题&lt;/h3&gt;
&lt;p&gt;给定长度为 $T$ 的回合，写出 REINFORCE 在时刻 $t$ 的回报和参数更新，并说明为什么必须等回合结束后才能得到该教材版本的 $q_t$。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success]- 点击查看答案&lt;/p&gt;
&lt;p&gt;$$
q_t(s_t,a_t)=\sum_{k=t+1}^{T}\gamma^{k-t-1}r_k,
$$&lt;/p&gt;
&lt;p&gt;$$
\theta\leftarrow\theta
+\alpha\nabla_\theta\ln\pi(a_t\mid s_t,\theta)q_t(s_t,a_t).
$$&lt;/p&gt;
&lt;p&gt;$q_t$ 包含从 $t+1$ 到终点 $T$ 的全部未来奖励，因此在完整回合结束前无法精确计算。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>ECO2011 期末复习：Multiple Choice Questions</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/aabfinal/%E5%BE%AE%E8%A7%82%E7%BB%8F%E6%B5%8E%E5%AD%A6_mcq_%E6%9C%9F%E6%9C%AB%E5%86%B2%E5%88%BA%E6%8C%87%E5%8D%97/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/aabfinal/%E5%BE%AE%E8%A7%82%E7%BB%8F%E6%B5%8E%E5%AD%A6_mcq_%E6%9C%9F%E6%9C%AB%E5%86%B2%E5%88%BA%E6%8C%87%E5%8D%97/</guid><pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;微观经济学 Multiple Choice Questions 期末冲刺指南&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;适用范围：&lt;code&gt;Notes&lt;/code&gt; 文件夹中的 12 章，以及 &lt;code&gt;Multiple Choice Questions&lt;/code&gt; 文件夹中的 25 道期末题和 20 道 Midterm Sample Questions。&lt;/p&gt;
&lt;p&gt;核心目标：不靠死背题目，而是看到关键词后，立刻知道该画什么图、用什么公式、按什么顺序排除选项。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;一、先说结论：这套选择题到底喜欢考什么&lt;/h2&gt;
&lt;p&gt;这 45 道题的风格非常稳定，主要是五类：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;定义辨认题&lt;/strong&gt;：producer surplus、price ceiling、marginal cost、dominant strategy 等。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;曲线移动题&lt;/strong&gt;：某个事件使 demand 还是 supply 移动，均衡价格和数量如何变化。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;表格/计算题&lt;/strong&gt;：机会成本、弹性、平均成本、行业总产量、短缺或过剩。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;图形规则题&lt;/strong&gt;：价格上限/下限、税收楔子、成本曲线、垄断者定价。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;制度比较题&lt;/strong&gt;：完全竞争、垄断、垄断竞争、寡头、外部性的效率结论。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;题库最常见的陷阱不是计算难，而是：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;把 &lt;strong&gt;curve shift（曲线移动）&lt;/strong&gt; 和 &lt;strong&gt;movement along a curve（沿曲线移动）&lt;/strong&gt; 混淆；&lt;/li&gt;
&lt;li&gt;把 &lt;strong&gt;demand（需求）&lt;/strong&gt; 和 &lt;strong&gt;quantity demanded（需求量）&lt;/strong&gt; 混淆；&lt;/li&gt;
&lt;li&gt;看到两个变化同时发生时，忘记有一个结果可能是 &lt;strong&gt;ambiguous（不确定）&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;把 &lt;strong&gt;average（平均）&lt;/strong&gt;、&lt;strong&gt;marginal（边际）&lt;/strong&gt; 和 &lt;strong&gt;total（总量）&lt;/strong&gt; 混淆；&lt;/li&gt;
&lt;li&gt;用“谁向政府交税”判断税负，而不是用弹性判断；&lt;/li&gt;
&lt;li&gt;垄断题先找价格，而不是先用 &lt;code&gt;MR = MC&lt;/code&gt; 找数量；&lt;/li&gt;
&lt;li&gt;博弈题凭感觉选“大家都更好”的结果，而不逐格找最佳反应。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;二、考场统一流程：任何选择题先做这五步&lt;/h2&gt;
&lt;h3&gt;第一步：圈出题目中的任务词&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;increase / decrease&lt;/code&gt;：问方向。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;shift / movement along&lt;/code&gt;：问曲线移动还是沿线移动。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;NOT / cannot / except&lt;/code&gt;：问错误项，先在题号旁写一个大大的“反”。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;short run / long run&lt;/code&gt;：短期和长期规则不同。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;elastic / inelastic&lt;/code&gt;：通常要联想到总收益、税负或数量反应。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;efficient / social&lt;/code&gt;：通常要比较私人边际量与社会边际量。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;第二步：判断是哪一个模型&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;两种商品、放弃多少 → PPF / opportunity cost。&lt;/li&gt;
&lt;li&gt;买者、卖者、均衡 → supply and demand。&lt;/li&gt;
&lt;li&gt;面积、WTP、最低愿售价格 → surplus。&lt;/li&gt;
&lt;li&gt;最高价、最低价、短缺、过剩 → price controls。&lt;/li&gt;
&lt;li&gt;百分比变化、收入变化、替代品 → elasticity。&lt;/li&gt;
&lt;li&gt;政府税收、买卖双方价格不同 → tax wedge。&lt;/li&gt;
&lt;li&gt;FC、VC、MC、ATC、AVC → production and costs。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;P = MC&lt;/code&gt;、进入退出 → perfect competition。&lt;/li&gt;
&lt;li&gt;单一企业、&lt;code&gt;MR &amp;lt; P&lt;/code&gt; → monopoly。&lt;/li&gt;
&lt;li&gt;多企业、产品不同、广告 → monopolistic competition。&lt;/li&gt;
&lt;li&gt;少数企业、收益矩阵 → oligopoly / game theory。&lt;/li&gt;
&lt;li&gt;第三方、污染、疫苗、公共品 → externalities。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;第三步：只写最小必要公式或画最小图&lt;/h3&gt;
&lt;p&gt;选择题不需要画艺术品。通常只要：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;写 &lt;code&gt;D→&lt;/code&gt;、&lt;code&gt;S←&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;写 &lt;code&gt;Qd - Qs&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;写 &lt;code&gt;MR = MC&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;写 &lt;code&gt;P ? AVC&lt;/code&gt; 或 &lt;code&gt;P ? ATC&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;画一个 2×2 收益矩阵并圈最佳反应。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;第四步：先判断“必然方向”，再看选项&lt;/h3&gt;
&lt;p&gt;例如 demand 右移、supply 左移：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;两者都推高价格，所以 &lt;code&gt;P↑&lt;/code&gt; 必然；&lt;/li&gt;
&lt;li&gt;一个推高数量、一个压低数量，所以 &lt;code&gt;Q?&lt;/code&gt; 不确定。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;不要因为选项写得长就被带跑。先自己得出 &lt;code&gt;P↑, Q?&lt;/code&gt;，再去匹配。&lt;/p&gt;
&lt;h3&gt;第五步：最后检查题目是不是问 NOT&lt;/h3&gt;
&lt;p&gt;这套题多次使用 &lt;code&gt;NOT correct&lt;/code&gt;、&lt;code&gt;cannot be caused&lt;/code&gt;、&lt;code&gt;would not occur&lt;/code&gt;。很多失分不是不会，而是把正确项选成答案。&lt;/p&gt;
&lt;hr /&gt;
&lt;h1&gt;三、12 章题型与通用解题套路&lt;/h1&gt;
&lt;h2&gt;Chapter 1：Economic Models、PPF、Opportunity Cost、Comparative Advantage&lt;/h2&gt;
&lt;h3&gt;常考题型 1：从表格求机会成本&lt;/h3&gt;
&lt;p&gt;套路：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;找到起点和终点；&lt;/li&gt;
&lt;li&gt;看为了增加目标商品，放弃了多少另一种商品；&lt;/li&gt;
&lt;li&gt;机会成本只写“放弃的东西”，不需要货币成本。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;例如题库中 wheat 从 90 增加到 120，computers 从 60 减少到 40：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;机会成本 = 60 - 40 = 20 台电脑&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;通俗理解：你为了多拿 30 袋麦子，把 20 台电脑扔掉了，所以代价就是 20 台电脑。&lt;/p&gt;
&lt;h3&gt;常考题型 2：比较优势&lt;/h3&gt;
&lt;p&gt;比较优势看 &lt;strong&gt;机会成本低&lt;/strong&gt;，绝对优势看 &lt;strong&gt;做得快/产得多&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;若题目给“生产一个产品需要几小时”：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;生产 X 的机会成本 = 生产 X 所需时间 ÷ 生产 Y 所需时间（单位 Y）&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;谁的这个比值更小，谁在 X 上有比较优势。&lt;/p&gt;
&lt;p&gt;口诀：&lt;strong&gt;绝对优势比效率，比较优势比放弃。&lt;/strong&gt;&lt;/p&gt;
&lt;h3&gt;PPF 必背判断&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;PPF 上：可行且生产有效率。&lt;/li&gt;
&lt;li&gt;PPF 内：可行但无效率。&lt;/li&gt;
&lt;li&gt;PPF 外：当前不可行。&lt;/li&gt;
&lt;li&gt;技术或资源增加：PPF 向外。&lt;/li&gt;
&lt;li&gt;向外凸 PPF：机会成本递增。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 2：Supply and Demand&lt;/h2&gt;
&lt;p&gt;这是整套选择题最重要的一章。&lt;/p&gt;
&lt;h3&gt;1. 沿曲线移动还是曲线平移&lt;/h3&gt;
&lt;p&gt;唯一能让需求曲线上“沿线移动”的，是 &lt;strong&gt;该商品自身价格变化&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;唯一能让供给曲线上“沿线移动”的，也是 &lt;strong&gt;该商品自身价格变化&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;除此之外，一般都是曲线整体移动。&lt;/p&gt;
&lt;p&gt;需求移动因素：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;收入；&lt;/li&gt;
&lt;li&gt;替代品或互补品价格；&lt;/li&gt;
&lt;li&gt;偏好；&lt;/li&gt;
&lt;li&gt;对未来价格或收入的预期；&lt;/li&gt;
&lt;li&gt;买者人数。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;供给移动因素：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;投入品价格；&lt;/li&gt;
&lt;li&gt;技术；&lt;/li&gt;
&lt;li&gt;相关产品价格；&lt;/li&gt;
&lt;li&gt;生产者预期；&lt;/li&gt;
&lt;li&gt;卖者人数；&lt;/li&gt;
&lt;li&gt;税收、补贴、自然灾害等。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;口诀：&lt;strong&gt;自己价格沿线走，其他因素整条搬。&lt;/strong&gt;&lt;/p&gt;
&lt;h3&gt;2. 替代品、互补品&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;替代品 A 价格上涨 → 人们改买 B → B 的 demand 右移。&lt;/li&gt;
&lt;li&gt;互补品 A 价格上涨 → A 买得少，连带 B 也少 → B 的 demand 左移。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;例：米饭是面条的替代品。米饭涨价，面条需求增加。&lt;/p&gt;
&lt;h3&gt;3. 正常品与低档品&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;正常品：收入增加 → demand 右移。&lt;/li&gt;
&lt;li&gt;低档品：收入增加 → demand 左移。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;注意：“低档”不是质量差，而是收入越高越少买，例如某些情况下的方便面或公交出行。&lt;/p&gt;
&lt;h3&gt;4. 单条曲线移动的结果&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;变化&lt;/th&gt;
&lt;th&gt;均衡价格&lt;/th&gt;
&lt;th&gt;均衡数量&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Demand 右移&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Demand 左移&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Supply 右移&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Supply 左移&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;5. 两条曲线同时移动&lt;/h3&gt;
&lt;p&gt;最稳的方法：分别写两个效果。&lt;/p&gt;
&lt;p&gt;例：面粉涨价使面条 &lt;code&gt;S←&lt;/code&gt;，米饭涨价使面条 &lt;code&gt;D→&lt;/code&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;S←&lt;/code&gt;：&lt;code&gt;P↑, Q↓&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;D→&lt;/code&gt;：&lt;code&gt;P↑, Q↑&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;合并：&lt;code&gt;P↑&lt;/code&gt;，&lt;code&gt;Q?&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;通用规则：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;两个变化对某变量方向相同 → 该变量确定；&lt;/li&gt;
&lt;li&gt;两个变化对某变量方向相反 → 该变量不确定。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;6. Shortage 与 Surplus&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;价格低于均衡价：&lt;code&gt;Qd &amp;gt; Qs&lt;/code&gt;，shortage。&lt;/li&gt;
&lt;li&gt;价格高于均衡价：&lt;code&gt;Qs &amp;gt; Qd&lt;/code&gt;，surplus。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;短缺量：&lt;code&gt;Qd - Qs&lt;/code&gt;；过剩量：&lt;code&gt;Qs - Qd&lt;/code&gt;。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 3：Consumer Surplus、Producer Surplus、Efficiency&lt;/h2&gt;
&lt;h3&gt;三个核心定义&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Consumer Surplus：&lt;code&gt;WTP - 实付价格&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;Producer Surplus：&lt;code&gt;实收价格 - 最低愿售价格/成本&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;Total Surplus：&lt;code&gt;CS + PS&lt;/code&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;图上：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CS = demand 下方、价格线上方的面积；&lt;/li&gt;
&lt;li&gt;PS = 价格线下方、supply 上方的面积；&lt;/li&gt;
&lt;li&gt;TS = demand 与 supply 之间、直到交易量为止的面积。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;通俗理解：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;你最多愿付 100，实际只付 70，赚到的“心理便宜”是 30。&lt;/li&gt;
&lt;li&gt;商家最低 40 才愿卖，实际收到 70，卖方剩余是 30。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;效率题&lt;/h3&gt;
&lt;p&gt;无外部性且市场竞争时，均衡量使：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Marginal Benefit = Marginal Cost&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;也就是 demand 与 supply 相交，total surplus 最大。&lt;/p&gt;
&lt;p&gt;注意：效率不等于公平。市场可能有效率，但分配不一定公平。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 4：Price Controls and Quotas&lt;/h2&gt;
&lt;h3&gt;Price Ceiling（价格上限）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;法定最高价；&lt;/li&gt;
&lt;li&gt;低于均衡价才 binding；&lt;/li&gt;
&lt;li&gt;binding ceiling → shortage。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;例：租金上限低于市场均衡租金，想租的人多、房东愿意出租的房少。&lt;/p&gt;
&lt;h3&gt;Price Floor（价格下限）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;法定最低价；&lt;/li&gt;
&lt;li&gt;高于均衡价才 binding；&lt;/li&gt;
&lt;li&gt;binding floor → surplus。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;例：最低工资高于均衡工资，劳动供给大于劳动需求，出现失业。&lt;/p&gt;
&lt;h3&gt;非约束性管制&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Ceiling 在均衡价上方：没作用，市场仍在均衡点。&lt;/li&gt;
&lt;li&gt;Floor 在均衡价下方：没作用，市场仍在均衡点。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;口诀：&lt;strong&gt;天花板太高碰不到，地板太低踩不到。&lt;/strong&gt;&lt;/p&gt;
&lt;h3&gt;Quota&lt;/h3&gt;
&lt;p&gt;配额把交易量限制在低于均衡量的位置：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;demand price 高于 supply price；&lt;/li&gt;
&lt;li&gt;两者差额是 wedge；&lt;/li&gt;
&lt;li&gt;若许可证归卖家，差额形成 quota rent；&lt;/li&gt;
&lt;li&gt;交易量减少，产生 deadweight loss。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 5：Elasticity&lt;/h2&gt;
&lt;h3&gt;1. 需求价格弹性&lt;/h3&gt;
&lt;p&gt;&lt;code&gt;PED = |需求量百分比变化 ÷ 价格百分比变化|&lt;/code&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;PED &amp;gt; 1&lt;/code&gt;：elastic。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;PED &amp;lt; 1&lt;/code&gt;：inelastic。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;PED = 1&lt;/code&gt;：unit elastic。&lt;/li&gt;
&lt;li&gt;垂直需求：perfectly inelastic，弹性为 0。&lt;/li&gt;
&lt;li&gt;水平需求：perfectly elastic，弹性趋于无穷。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2. Midpoint Method&lt;/h3&gt;
&lt;p&gt;&lt;code&gt;数量百分比变化 = (Q2-Q1) ÷ [(Q1+Q2)/2]&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;&lt;code&gt;价格百分比变化 = (P2-P1) ÷ [(P1+P2)/2]&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;然后两者相除，并通常取绝对值。&lt;/p&gt;
&lt;h3&gt;3. 弹性与 Total Revenue&lt;/h3&gt;
&lt;p&gt;&lt;code&gt;TR = P × Q&lt;/code&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Demand&lt;/th&gt;
&lt;th&gt;价格上涨时 TR&lt;/th&gt;
&lt;th&gt;价格下降时 TR&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Unit elastic&lt;/td&gt;
&lt;td&gt;不变&lt;/td&gt;
&lt;td&gt;不变&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;直觉：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;弹性大：顾客很容易跑，涨价反而少赚钱。&lt;/li&gt;
&lt;li&gt;弹性小：顾客跑不了，涨价会多赚钱。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;4. 哪些商品弹性大&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;替代品多；&lt;/li&gt;
&lt;li&gt;奢侈品；&lt;/li&gt;
&lt;li&gt;占收入比例大；&lt;/li&gt;
&lt;li&gt;调整时间长；&lt;/li&gt;
&lt;li&gt;市场定义更窄。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;“大米”通常比“某个特定品牌进口米”更缺乏弹性，因为后者替代品更多。&lt;/p&gt;
&lt;h3&gt;5. 交叉价格弹性与收入弹性&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Cross-price elasticity &amp;gt; 0：替代品。&lt;/li&gt;
&lt;li&gt;Cross-price elasticity &amp;lt; 0：互补品。&lt;/li&gt;
&lt;li&gt;Income elasticity &amp;gt; 0：正常品。&lt;/li&gt;
&lt;li&gt;Income elasticity &amp;lt; 0：低档品。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 6：Taxes&lt;/h2&gt;
&lt;h3&gt;1. 税收楔子&lt;/h3&gt;
&lt;p&gt;税后：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;买者支付价格上升；&lt;/li&gt;
&lt;li&gt;卖者实际收到价格下降；&lt;/li&gt;
&lt;li&gt;两者之差等于单位税；&lt;/li&gt;
&lt;li&gt;交易量下降。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2. 谁承担税负&lt;/h3&gt;
&lt;p&gt;不要看法律规定谁交税。看谁更缺乏弹性。&lt;/p&gt;
&lt;p&gt;口诀：&lt;strong&gt;谁更跑不掉，谁承担更多。&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Demand 比 supply 更缺乏弹性 → 消费者承担更多。&lt;/li&gt;
&lt;li&gt;Supply 比 demand 更缺乏弹性 → 生产者承担更多。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3. 税收收入与无谓损失&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Tax Revenue = &lt;code&gt;单位税 × 税后交易量&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;税阻止了一些本来互利的交易，因此产生 DWL。&lt;/li&gt;
&lt;li&gt;demand 或 supply 越有弹性，数量下降越多，DWL 越大。&lt;/li&gt;
&lt;li&gt;若一边完全无弹性，交易量不变，DWL 可为 0。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 7：Production Inputs and Costs&lt;/h2&gt;
&lt;h3&gt;公式总表&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;TC = FC + VC&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;AFC = FC / Q&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;AVC = VC / Q&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;ATC = TC / Q = AFC + AVC&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;MC = ΔTC / ΔQ = ΔVC / ΔQ&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Profit = TR - TC&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;1. Marginal Product 与 Diminishing Returns&lt;/h3&gt;
&lt;p&gt;增加一单位可变投入带来的额外产出是 marginal product。&lt;/p&gt;
&lt;p&gt;固定投入不变，不断增加可变投入时，新增投入越来越拥挤，所以 marginal product 最终下降。这叫 diminishing marginal product。&lt;/p&gt;
&lt;p&gt;它会使 MC 上升：工人越来越不顶用，多生产一件产品需要更多劳动，所以新增一件越来越贵。&lt;/p&gt;
&lt;h3&gt;2. MC 与平均成本的关系&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;MC &amp;lt; ATC&lt;/code&gt; → ATC 被拉低；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;MC &amp;gt; ATC&lt;/code&gt; → ATC 被拉高；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;MC = ATC&lt;/code&gt; → ATC 最低。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;把 ATC 想成你的累计 GPA，MC 想成新一门课成绩：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;新成绩低于平均，平均下降；&lt;/li&gt;
&lt;li&gt;新成绩高于平均，平均上升；&lt;/li&gt;
&lt;li&gt;新成绩等于平均，平均不变。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;MC 同理也从下方穿过 AVC 的最低点。&lt;/p&gt;
&lt;h3&gt;3. 为什么 AVC 永远低于 ATC&lt;/h3&gt;
&lt;p&gt;&lt;code&gt;ATC = AVC + AFC&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;只要 fixed cost 为正，&lt;code&gt;AFC &amp;gt; 0&lt;/code&gt;，所以 &lt;code&gt;ATC &amp;gt; AVC&lt;/code&gt;。二者会越来越接近，但不会相等。&lt;/p&gt;
&lt;h3&gt;4. 短期与长期&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;短期：至少一个投入固定。&lt;/li&gt;
&lt;li&gt;长期：所有投入都可变。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;不要用“几个月”机械判断短期，关键是有没有固定投入。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 8：Perfect Competition&lt;/h2&gt;
&lt;h3&gt;市场特征&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;很多买者和卖者；&lt;/li&gt;
&lt;li&gt;产品标准化；&lt;/li&gt;
&lt;li&gt;企业是 price taker；&lt;/li&gt;
&lt;li&gt;长期自由进入退出。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;企业最优产量&lt;/h3&gt;
&lt;p&gt;所有企业的一般规则：&lt;code&gt;MR = MC&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;完全竞争企业中 &lt;code&gt;MR = P&lt;/code&gt;，所以：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;P = MC&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;注意：这是决定最优产量的规则，不等于“企业一定盈利”。&lt;/p&gt;
&lt;h3&gt;利润与亏损&lt;/h3&gt;
&lt;p&gt;在 &lt;code&gt;P = MC&lt;/code&gt; 决定的产量上比较 P 和 ATC：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;P &amp;gt; ATC&lt;/code&gt;：盈利；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;P = ATC&lt;/code&gt;：零经济利润；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;P &amp;lt; ATC&lt;/code&gt;：亏损。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;利润矩形：&lt;code&gt;(P - ATC) × Q&lt;/code&gt;。&lt;/p&gt;
&lt;h3&gt;短期停业&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;P ≥ AVC&lt;/code&gt;：继续生产，即使亏损，也能覆盖全部 VC 和部分 FC。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;P &amp;lt; AVC&lt;/code&gt;：停业。&lt;/li&gt;
&lt;li&gt;shutdown price = minimum AVC。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;短期个体供给曲线是 &lt;strong&gt;MC 在 AVC 以上的部分&lt;/strong&gt;。&lt;/p&gt;
&lt;h3&gt;长期进入退出&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;有正经济利润 → 新企业进入 → supply 增加 → 价格下降。&lt;/li&gt;
&lt;li&gt;亏损 → 企业退出 → supply 减少 → 价格上升。&lt;/li&gt;
&lt;li&gt;长期均衡：&lt;code&gt;P = MC = minimum ATC&lt;/code&gt;，经济利润为 0。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;零经济利润不是老板一分钱没赚，而是会计利润刚好补偿了包括机会成本在内的全部成本。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 9：Monopoly and Price Discrimination&lt;/h2&gt;
&lt;h3&gt;垄断者做题顺序&lt;/h3&gt;
&lt;p&gt;永远是：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;用 &lt;code&gt;MR = MC&lt;/code&gt; 找数量 &lt;code&gt;Qm&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;从这个数量向上找到 demand curve；&lt;/li&gt;
&lt;li&gt;demand curve 上的高度才是价格 &lt;code&gt;Pm&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;比较价格与 ATC 求利润。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;口诀：&lt;strong&gt;先 MR=MC 找量，再上需求找价。&lt;/strong&gt;&lt;/p&gt;
&lt;h3&gt;为什么 MR &amp;lt; P&lt;/h3&gt;
&lt;p&gt;垄断者要多卖一件，通常必须降低价格，而且不仅新卖的一件降价，原来卖的单位也可能一起降价。因此新增一件带来的边际收益小于售价。&lt;/p&gt;
&lt;h3&gt;与完全竞争比较&lt;/h3&gt;
&lt;p&gt;垄断通常：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;P &amp;gt; MC&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;价格更高；&lt;/li&gt;
&lt;li&gt;数量更少；&lt;/li&gt;
&lt;li&gt;产生 deadweight loss；&lt;/li&gt;
&lt;li&gt;因进入壁垒可长期盈利。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;Natural Monopoly&lt;/h3&gt;
&lt;p&gt;自然垄断的 ATC 在相关产量范围持续下降。一家企业生产比多家分摊生产更便宜。&lt;/p&gt;
&lt;p&gt;若政府规定 &lt;code&gt;P = MC&lt;/code&gt;，由于常有 &lt;code&gt;MC &amp;lt; ATC&lt;/code&gt;，企业会亏损，需要补贴或改用 average-cost pricing。&lt;/p&gt;
&lt;h3&gt;Price Discrimination&lt;/h3&gt;
&lt;p&gt;成功条件通常包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;有 market power；&lt;/li&gt;
&lt;li&gt;能区分不同消费者的 WTP；&lt;/li&gt;
&lt;li&gt;能阻止低价购买后转卖。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;完全价格歧视可消除 DWL，但把 consumer surplus 转为 producer surplus。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 10：Monopolistic Competition&lt;/h2&gt;
&lt;p&gt;特征：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;很多企业；&lt;/li&gt;
&lt;li&gt;产品差异化；&lt;/li&gt;
&lt;li&gt;自由进入退出；&lt;/li&gt;
&lt;li&gt;每家面对向下倾斜需求曲线，有一点 market power。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;短期像垄断：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;MR = MC&lt;/code&gt; 找量；&lt;/li&gt;
&lt;li&gt;demand curve 找价；&lt;/li&gt;
&lt;li&gt;可能盈利或亏损。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;长期：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;进入退出使经济利润归零；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;P = ATC&lt;/code&gt;，但仍然 &lt;code&gt;P &amp;gt; MC&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;企业没有在 minimum ATC 处生产，存在 excess capacity。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;与完全竞争的关键差别：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;完全竞争&lt;/th&gt;
&lt;th&gt;垄断竞争长期&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;P = MC&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;P &amp;gt; MC&lt;/code&gt;，有 mark-up&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;在 min ATC 生产&lt;/td&gt;
&lt;td&gt;产量低于 min ATC 对应产量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;标准化产品&lt;/td&gt;
&lt;td&gt;差异化产品&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 11：Oligopoly and Game Theory&lt;/h2&gt;
&lt;h3&gt;收益矩阵四步法&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;固定对方的一个策略；&lt;/li&gt;
&lt;li&gt;比较自己的两个收益，圈出更大者；&lt;/li&gt;
&lt;li&gt;对对方另一个策略重复；&lt;/li&gt;
&lt;li&gt;双方最佳反应同时出现的格子是 Nash equilibrium。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;Dominant Strategy&lt;/h3&gt;
&lt;p&gt;无论对方怎么选，某个策略都给你更高收益，它就是 dominant strategy。&lt;/p&gt;
&lt;h3&gt;Prisoners&apos; Dilemma&lt;/h3&gt;
&lt;p&gt;典型特征：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;双方都有“背叛/低价”的占优策略；&lt;/li&gt;
&lt;li&gt;结果是 Nash equilibrium；&lt;/li&gt;
&lt;li&gt;但双方合作时都能得到更高收益；&lt;/li&gt;
&lt;li&gt;个体理性导致集体较差结果。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;Collusion&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;合谋目的是限制产量、提高价格、提高共同利润；&lt;/li&gt;
&lt;li&gt;单个企业常有偷偷降价或增产的诱因；&lt;/li&gt;
&lt;li&gt;企业越多，维持合谋通常越困难；&lt;/li&gt;
&lt;li&gt;重复博弈和 tit for tat 可能支持 tacit collusion；&lt;/li&gt;
&lt;li&gt;正式价格合谋通常违反反托拉斯法。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;Chapter 12：Externalities、Public Goods、Common Resources&lt;/h2&gt;
&lt;h3&gt;1. Negative Externality&lt;/h3&gt;
&lt;p&gt;例：污染。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;MSC &amp;gt; private MC&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;市场数量过多：&lt;code&gt;Qmkt &amp;gt; Qopt&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;最优 Pigouvian tax = marginal external cost；&lt;/li&gt;
&lt;li&gt;税使行为者面对真实社会成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2. Positive Externality&lt;/h3&gt;
&lt;p&gt;例：疫苗、教育、技术溢出。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;MSB &amp;gt; private MB&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;市场数量过少：&lt;code&gt;Qmkt &amp;lt; Qopt&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;最优 Pigouvian subsidy = marginal external benefit。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;口诀：&lt;strong&gt;坏事做太多，用税压；好事做太少，用补贴推。&lt;/strong&gt;&lt;/p&gt;
&lt;h3&gt;3. Coase Theorem&lt;/h3&gt;
&lt;p&gt;若产权清楚且 transaction costs 很低，相关双方可能通过私人谈判实现有效结果。&lt;/p&gt;
&lt;p&gt;适合人数少、损害容易衡量的情况；人数多、沟通和法律成本高时不容易成功。&lt;/p&gt;
&lt;h3&gt;4. 四类商品&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Rival&lt;/th&gt;
&lt;th&gt;Nonrival&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Excludable&lt;/td&gt;
&lt;td&gt;Private Good&lt;/td&gt;
&lt;td&gt;Artificially Scarce Good&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nonexcludable&lt;/td&gt;
&lt;td&gt;Common Resource&lt;/td&gt;
&lt;td&gt;Public Good&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;记忆：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;公共品：不能排除，也不抢 → free-rider，供给不足。&lt;/li&gt;
&lt;li&gt;公共资源：不能排除，但会抢 → overuse。&lt;/li&gt;
&lt;li&gt;人为稀缺品：能排除，但不抢 → 正价格造成消费不足。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;公共品的社会边际收益要把个人 MB &lt;strong&gt;纵向相加&lt;/strong&gt;，有效数量满足 &lt;code&gt;MSB = MC&lt;/code&gt;。&lt;/p&gt;
&lt;hr /&gt;
&lt;h1&gt;四、题库中最值得警惕的陷阱&lt;/h1&gt;
&lt;h2&gt;1. 样题有一道题干/答案不严谨&lt;/h2&gt;
&lt;p&gt;Midterm Sample 第一题问：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Which of the following will cause a movement along the demand curve?&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;标准理论答案应是“该商品自身价格变化”，但五个选项中没有这个答案。文件标注答案 C（生产成本变化），可生产成本变化会移动 &lt;strong&gt;supply curve&lt;/strong&gt;，并不造成沿 demand curve 移动。&lt;/p&gt;
&lt;p&gt;考试时应按老师课堂定义作答；复习时不要把这个 C 当成理论知识背下来。&lt;/p&gt;
&lt;h2&gt;2. “Producers react by producing more”不一定是 supply shift&lt;/h2&gt;
&lt;p&gt;外国需求增加使市场价格上升，国内企业沿原有 supply curve 增加 quantity supplied。生产者使用更多投入，是对价格变化的反应，不代表 supply curve 本身右移。&lt;/p&gt;
&lt;h2&gt;3. 两个原因同时出现时，不要强行判断全部结果&lt;/h2&gt;
&lt;p&gt;一个变化使 Q 上升，另一个使 Q 下降时，除非告诉你两者大小，否则 Q 就是 ambiguous。&lt;/p&gt;
&lt;h2&gt;4. Necessity 不等于完全没有反应&lt;/h2&gt;
&lt;p&gt;necessity 通常较缺乏弹性，但不是 perfectly inelastic。只有数量完全不变时，才是弹性 0、需求曲线垂直。&lt;/p&gt;
&lt;h2&gt;5. 零经济利润不等于零收入或零会计利润&lt;/h2&gt;
&lt;p&gt;经济成本包括机会成本。零经济利润表示企业已得到足以让它留在该行业的正常回报。&lt;/p&gt;
&lt;h2&gt;6. “社会更好”的格子不一定是 Nash equilibrium&lt;/h2&gt;
&lt;p&gt;纳什均衡看有没有人想单方面改变，不看总收益是否最大。&lt;/p&gt;
&lt;hr /&gt;
&lt;h1&gt;五、20 道额外例题&lt;/h1&gt;
&lt;p&gt;建议先独立做完，再看后面的答案。&lt;/p&gt;
&lt;h2&gt;题目&lt;/h2&gt;
&lt;h3&gt;1. PPF&lt;/h3&gt;
&lt;p&gt;某经济体从组合 A（40 台机器，20 吨粮食）移动到组合 B（30 台机器，35 吨粮食）。增加 15 吨粮食的机会成本是：&lt;/p&gt;
&lt;p&gt;A. 10 台机器&lt;br /&gt;
B. 15 台机器&lt;br /&gt;
C. 25 台机器&lt;br /&gt;
D. 无法判断&lt;/p&gt;
&lt;h3&gt;2. Comparative Advantage&lt;/h3&gt;
&lt;p&gt;甲生产一杯咖啡需 2 小时，生产一个蛋糕需 4 小时；乙生产一杯咖啡需 3 小时，生产一个蛋糕需 9 小时。谁在蛋糕上有比较优势？&lt;/p&gt;
&lt;p&gt;A. 甲&lt;br /&gt;
B. 乙&lt;br /&gt;
C. 两者相同&lt;br /&gt;
D. 无法判断&lt;/p&gt;
&lt;h3&gt;3. Demand Shift&lt;/h3&gt;
&lt;p&gt;咖啡是茶的替代品。咖啡价格上升，其他条件不变，茶市场将：&lt;/p&gt;
&lt;p&gt;A. demand 左移&lt;br /&gt;
B. demand 右移&lt;br /&gt;
C. supply 左移&lt;br /&gt;
D. 沿茶的 demand curve 向上移动&lt;/p&gt;
&lt;h3&gt;4. Two Shifts&lt;/h3&gt;
&lt;p&gt;智能手机生产技术进步，同时消费者更喜欢智能手机。均衡结果一定是：&lt;/p&gt;
&lt;p&gt;A. P 上升，Q 上升&lt;br /&gt;
B. P 下降，Q 上升&lt;br /&gt;
C. Q 上升，P 不确定&lt;br /&gt;
D. P 上升，Q 不确定&lt;/p&gt;
&lt;h3&gt;5. Surplus&lt;/h3&gt;
&lt;p&gt;小王最多愿意为一本书付 80 元，实际支付 55 元。他的 consumer surplus 是：&lt;/p&gt;
&lt;p&gt;A. 25 元&lt;br /&gt;
B. 55 元&lt;br /&gt;
C. 80 元&lt;br /&gt;
D. 135 元&lt;/p&gt;
&lt;h3&gt;6. Price Ceiling&lt;/h3&gt;
&lt;p&gt;市场均衡价格为 30 元。政府设定 20 元的价格上限。最可能出现：&lt;/p&gt;
&lt;p&gt;A. surplus&lt;br /&gt;
B. shortage&lt;br /&gt;
C. demand 左移&lt;br /&gt;
D. supply 右移&lt;/p&gt;
&lt;h3&gt;7. Nonbinding Control&lt;/h3&gt;
&lt;p&gt;市场均衡工资为每小时 50 元，最低工资定为 40 元。结果是：&lt;/p&gt;
&lt;p&gt;A. 劳动力过剩&lt;br /&gt;
B. 劳动力短缺&lt;br /&gt;
C. 该最低工资不影响均衡&lt;br /&gt;
D. 工资必然上升到 60 元&lt;/p&gt;
&lt;h3&gt;8. Elasticity&lt;/h3&gt;
&lt;p&gt;价格从 10 元上升到 12 元，需求量从 100 下降到 60。需求最可能是：&lt;/p&gt;
&lt;p&gt;A. elastic&lt;br /&gt;
B. inelastic&lt;br /&gt;
C. unit elastic&lt;br /&gt;
D. perfectly inelastic&lt;/p&gt;
&lt;h3&gt;9. Elasticity and Revenue&lt;/h3&gt;
&lt;p&gt;一家企业认为其 demand 是 inelastic。若它略微提高价格，其他条件不变，total revenue 通常：&lt;/p&gt;
&lt;p&gt;A. 上升&lt;br /&gt;
B. 下降&lt;br /&gt;
C. 不变&lt;br /&gt;
D. 必定为零&lt;/p&gt;
&lt;h3&gt;10. Tax Incidence&lt;/h3&gt;
&lt;p&gt;某商品 demand 几乎垂直，supply 正常向上倾斜。对该商品征税后，大部分税负由谁承担？&lt;/p&gt;
&lt;p&gt;A. 消费者&lt;br /&gt;
B. 生产者&lt;br /&gt;
C. 政府&lt;br /&gt;
D. 一定各一半&lt;/p&gt;
&lt;h3&gt;11. Cost&lt;/h3&gt;
&lt;p&gt;当 Q = 20 时，TC = 500；当 Q = 21 时，TC = 530。第 21 单位的 MC 是：&lt;/p&gt;
&lt;p&gt;A. 20&lt;br /&gt;
B. 25&lt;br /&gt;
C. 30&lt;br /&gt;
D. 530&lt;/p&gt;
&lt;h3&gt;12. MC and ATC&lt;/h3&gt;
&lt;p&gt;当前 MC 小于 ATC。企业增加一点产量后，ATC 将：&lt;/p&gt;
&lt;p&gt;A. 上升&lt;br /&gt;
B. 下降&lt;br /&gt;
C. 必定不变&lt;br /&gt;
D. 变为零&lt;/p&gt;
&lt;h3&gt;13. Shutdown&lt;/h3&gt;
&lt;p&gt;完全竞争企业当前 &lt;code&gt;P = 8&lt;/code&gt;，&lt;code&gt;ATC = 12&lt;/code&gt;，&lt;code&gt;AVC = 6&lt;/code&gt;。短期应：&lt;/p&gt;
&lt;p&gt;A. 继续生产但亏损&lt;br /&gt;
B. 立即停业&lt;br /&gt;
C. 退出行业且产量增加&lt;br /&gt;
D. 提价到 12&lt;/p&gt;
&lt;h3&gt;14. Long-Run Competition&lt;/h3&gt;
&lt;p&gt;完全竞争行业长期存在正经济利润，将导致：&lt;/p&gt;
&lt;p&gt;A. 企业退出，supply 左移&lt;br /&gt;
B. 企业进入，supply 右移&lt;br /&gt;
C. demand 左移&lt;br /&gt;
D. 每家企业成为垄断者&lt;/p&gt;
&lt;h3&gt;15. Monopoly&lt;/h3&gt;
&lt;p&gt;垄断者在 &lt;code&gt;MR = MC&lt;/code&gt; 处确定的首先是：&lt;/p&gt;
&lt;p&gt;A. 价格&lt;br /&gt;
B. 产量&lt;br /&gt;
C. ATC&lt;br /&gt;
D. 固定成本&lt;/p&gt;
&lt;h3&gt;16. Natural Monopoly&lt;/h3&gt;
&lt;p&gt;自然垄断企业若被要求设定 &lt;code&gt;P = MC&lt;/code&gt;，常见问题是：&lt;/p&gt;
&lt;p&gt;A. 价格太高且有超额利润&lt;br /&gt;
B. 因 &lt;code&gt;P &amp;lt; ATC&lt;/code&gt; 而亏损&lt;br /&gt;
C. 产量必然为零&lt;br /&gt;
D. consumer surplus 必然为零&lt;/p&gt;
&lt;h3&gt;17. Monopolistic Competition&lt;/h3&gt;
&lt;p&gt;垄断竞争行业长期均衡中，下列哪项通常正确？&lt;/p&gt;
&lt;p&gt;A. 正经济利润且 &lt;code&gt;P = MC&lt;/code&gt;&lt;br /&gt;
B. 零经济利润且 &lt;code&gt;P &amp;gt; MC&lt;/code&gt;&lt;br /&gt;
C. 零经济利润且在 minimum ATC 生产&lt;br /&gt;
D. 只有一家企业&lt;/p&gt;
&lt;h3&gt;18. Game Theory&lt;/h3&gt;
&lt;p&gt;若无论对手选择什么，企业 A 选择 Low Price 的收益都高于 High Price，则 Low Price 是 A 的：&lt;/p&gt;
&lt;p&gt;A. dominant strategy&lt;br /&gt;
B. externality&lt;br /&gt;
C. quota rent&lt;br /&gt;
D. sunk cost&lt;/p&gt;
&lt;h3&gt;19. Negative Externality&lt;/h3&gt;
&lt;p&gt;某工厂生产造成未补偿污染。未干预市场通常：&lt;/p&gt;
&lt;p&gt;A. 产量低于社会最优，因为 MSC &amp;lt; MC&lt;br /&gt;
B. 产量高于社会最优，因为 MSC &amp;gt; private MC&lt;br /&gt;
C. 产量等于社会最优&lt;br /&gt;
D. demand 必然垂直&lt;/p&gt;
&lt;h3&gt;20. Goods Classification&lt;/h3&gt;
&lt;p&gt;开放海域的鱼很难排除捕捞者，但一人捕走后别人就不能再捕。它属于：&lt;/p&gt;
&lt;p&gt;A. Private Good&lt;br /&gt;
B. Public Good&lt;br /&gt;
C. Common Resource&lt;br /&gt;
D. Artificially Scarce Good&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;答案与通俗解析&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。粮食多 15 吨，机器少 10 台；机会成本是放弃的 10 台机器。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。甲做一个蛋糕放弃 &lt;code&gt;4/2 = 2&lt;/code&gt; 杯咖啡；乙放弃 &lt;code&gt;9/3 = 3&lt;/code&gt; 杯。甲机会成本更低。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。咖啡变贵，消费者改买茶，茶的 demand 右移。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C&lt;/strong&gt;。技术进步使 &lt;code&gt;S→&lt;/code&gt;，偏好增强使 &lt;code&gt;D→&lt;/code&gt;；两者都让 Q 上升，但对 P 作用相反。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。&lt;code&gt;CS = 80 - 55 = 25&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。20 低于均衡价 30，是 binding ceiling，导致 &lt;code&gt;Qd &amp;gt; Qs&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C&lt;/strong&gt;。最低工资低于均衡工资，像太低的地板，碰不到市场。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。价格仅上涨约 20%，数量却下降约 40%，数量反应更大，需求有弹性。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。需求缺乏弹性时，涨价的百分比大于销量下降的百分比，TR 上升。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。消费者几乎无法减少购买，“跑不掉”，所以承担大部分税负。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C&lt;/strong&gt;。&lt;code&gt;MC = 530 - 500 = 30&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。新增单位比原平均成本便宜，会把平均值拉低。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。虽然 &lt;code&gt;P &amp;lt; ATC&lt;/code&gt; 而亏损，但 &lt;code&gt;P &amp;gt; AVC&lt;/code&gt;，生产可以覆盖 VC 并贡献部分 FC。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。利润吸引进入，行业 supply 右移，价格最终下降到零经济利润。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。先用 &lt;code&gt;MR = MC&lt;/code&gt; 找数量，再从 demand curve 找价格。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。自然垄断常有 &lt;code&gt;MC &amp;lt; ATC&lt;/code&gt;，按 MC 定价不能覆盖全部成本。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。进入退出使利润为零，但产品差异化仍使 &lt;code&gt;P &amp;gt; MC&lt;/code&gt;，并有 excess capacity。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;A&lt;/strong&gt;。不管别人怎么选都更好的策略，就是 dominant strategy。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;B&lt;/strong&gt;。污染成本未进入企业私人成本，企业面对的成本太低，于是生产过多。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C&lt;/strong&gt;。不可排他但有消费竞争性，是 Common Resource，容易被过度使用。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h1&gt;六、最后 30 分钟速记表&lt;/h1&gt;
&lt;ol&gt;
&lt;li&gt;自己价格变化 → 沿曲线；其他因素 → 曲线移动。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;D→: P↑Q↑&lt;/code&gt;；&lt;code&gt;D←: P↓Q↓&lt;/code&gt;；&lt;code&gt;S→: P↓Q↑&lt;/code&gt;；&lt;code&gt;S←: P↑Q↓&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;两个冲击同向决定一个变量，反向作用的变量不确定。&lt;/li&gt;
&lt;li&gt;Ceiling 低于均衡才 binding → shortage。&lt;/li&gt;
&lt;li&gt;Floor 高于均衡才 binding → surplus。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;PED &amp;gt; 1&lt;/code&gt; elastic；涨价使 TR 降。&lt;/li&gt;
&lt;li&gt;税负：谁更缺乏弹性，谁承担更多。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;TC=FC+VC&lt;/code&gt;；&lt;code&gt;ATC=AFC+AVC&lt;/code&gt;；&lt;code&gt;MC=ΔTC/ΔQ&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;MC &amp;lt; average&lt;/code&gt; 拉低平均；&lt;code&gt;MC &amp;gt; average&lt;/code&gt; 拉高平均。&lt;/li&gt;
&lt;li&gt;完全竞争：&lt;code&gt;P=MR=MC&lt;/code&gt;；短期 &lt;code&gt;P&amp;lt;AVC&lt;/code&gt; 才停业。&lt;/li&gt;
&lt;li&gt;完全竞争长期：&lt;code&gt;P=MC=min ATC&lt;/code&gt;，零经济利润。&lt;/li&gt;
&lt;li&gt;垄断：先 &lt;code&gt;MR=MC&lt;/code&gt; 找 Q，再去 demand 找 P；通常 &lt;code&gt;P&amp;gt;MC&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;垄断竞争长期：零利润，但 &lt;code&gt;P&amp;gt;MC&lt;/code&gt;，有 excess capacity。&lt;/li&gt;
&lt;li&gt;Nash equilibrium：双方都不想单方面改变。&lt;/li&gt;
&lt;li&gt;负外部性生产过多，用税；正外部性生产过少，用补贴。&lt;/li&gt;
&lt;li&gt;Public Good：nonexcludable + nonrival → free rider。&lt;/li&gt;
&lt;li&gt;Common Resource：nonexcludable + rival → overuse。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h2&gt;七、推荐的考前练法&lt;/h2&gt;
&lt;h3&gt;第一轮：只认模型&lt;/h3&gt;
&lt;p&gt;每题不计算，只在旁边标：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;PPF / D-S / Elasticity / Cost / PC / Monopoly / Game / Externality&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;目标是在 5 秒内知道题目属于哪一章。&lt;/p&gt;
&lt;h3&gt;第二轮：只写中间结论&lt;/h3&gt;
&lt;p&gt;例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;S←, D→ ⇒ P↑, Q?&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Pceiling &amp;lt; Pe ⇒ shortage&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;P&amp;gt;AVC but P&amp;lt;ATC ⇒ produce, loss&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;MR=MC ⇒ Q; demand ⇒ P&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;第三轮：限时做题&lt;/h3&gt;
&lt;p&gt;45 道题建议控制在 45–55 分钟：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;定义题约 30 秒；&lt;/li&gt;
&lt;li&gt;方向题约 45 秒；&lt;/li&gt;
&lt;li&gt;计算题约 90 秒；&lt;/li&gt;
&lt;li&gt;收益矩阵和复杂图形题最多 2 分钟，超时先跳过。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;最终检查时只检查三件事：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;有没有漏看 &lt;code&gt;NOT&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;有没有把 shift 和 movement along 搞反；&lt;/li&gt;
&lt;li&gt;有没有把 short run 和 long run 搞反。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h2&gt;附录：扫描版 25 道题答案&lt;/h2&gt;
&lt;p&gt;扫描版 PDF 没有附答案。下表已按配套答案文件校正：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;题号&lt;/th&gt;
&lt;th&gt;答案&lt;/th&gt;
&lt;th&gt;核心考点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;机会成本为放弃的 20 台电脑&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2&lt;/td&gt;
&lt;td&gt;B&lt;/td&gt;
&lt;td&gt;生产成本下降移动 supply，不移动 demand&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;工厂被毁使 supply 左移，不使 demand 左移&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;低档品在收入下降时 demand 右移&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;&lt;code&gt;S←&lt;/code&gt; 与 &lt;code&gt;D→&lt;/code&gt;：P 必升，Q 不确定&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;6&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;demand 增加后，企业沿 supply curve 增产&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;价格上升而购买量大幅下降，符合 elastic demand&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;8&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;demand 越缺乏弹性，涨价越多、数量减少越少&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;9&lt;/td&gt;
&lt;td&gt;E&lt;/td&gt;
&lt;td&gt;Total surplus 等于 consumer surplus 与 producer surplus 之和；A–D 均未完整表述&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;10&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;4 美元时 &lt;code&gt;Qd=16, Qs=8&lt;/code&gt;，shortage 为 8&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;11&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;8 美元处需求富有弹性&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;12&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;&lt;code&gt;MC = ΔTC / ΔQ&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;13&lt;/td&gt;
&lt;td&gt;B&lt;/td&gt;
&lt;td&gt;固定成本为正时 &lt;code&gt;ATC = AVC + AFC &amp;gt; AVC&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;14&lt;/td&gt;
&lt;td&gt;B&lt;/td&gt;
&lt;td&gt;总量 &lt;code&gt;100×50=5000&lt;/code&gt;，长期价格 &lt;code&gt;20000/50=400&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;15&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;行业短期供给是各企业 MC 在 AVC 以上部分的水平加总&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;16&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;企业在 efficient scale 右侧生产时 &lt;code&gt;P=MC&amp;gt;ATC&lt;/code&gt;，正利润吸引进入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;17&lt;/td&gt;
&lt;td&gt;D&lt;/td&gt;
&lt;td&gt;阻止形成垄断的并购可限制 monopoly profit&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;18&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;自然垄断按 &lt;code&gt;P=MC&lt;/code&gt; 定价常因 &lt;code&gt;P&amp;lt;ATC&lt;/code&gt; 而亏损&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;19&lt;/td&gt;
&lt;td&gt;D&lt;/td&gt;
&lt;td&gt;Choice #1 是双方占优策略，形成囚徒困境的较差均衡&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;20&lt;/td&gt;
&lt;td&gt;D&lt;/td&gt;
&lt;td&gt;企业越多，通常越难维持合谋&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;21&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;寡头不进行价格或数量合作可避免合谋限制产量、抬高价格，因而有利于社会整体&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;22&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;垄断竞争行业的企业数量减少时，市场结构更接近 oligopoly&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;23&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;垄断竞争长期仍有 &lt;code&gt;P&amp;gt;MC&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;24&lt;/td&gt;
&lt;td&gt;D&lt;/td&gt;
&lt;td&gt;描述的是 diminishing marginal product&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;25&lt;/td&gt;
&lt;td&gt;B&lt;/td&gt;
&lt;td&gt;补贴 B 的消费没有直接内部化 A 造成的外部成本&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;第 16 题的 C 需要结合完全竞争企业的最优条件理解：企业在 &lt;code&gt;P=MC&lt;/code&gt; 处生产；若该点位于 minimum ATC 的右侧，则 &lt;code&gt;MC&amp;gt;ATC&lt;/code&gt;，所以 &lt;code&gt;P&amp;gt;ATC&lt;/code&gt;，行业存在正利润并吸引新企业进入。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>ECO2011 期末复习：Short Essay</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/aabfinal/%E5%BE%AE%E8%A7%82%E7%BB%8F%E6%B5%8E%E5%AD%A6_short_essay_%E5%86%B2%E5%88%BA%E6%8C%87%E5%8D%97/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/aabfinal/%E5%BE%AE%E8%A7%82%E7%BB%8F%E6%B5%8E%E5%AD%A6_short_essay_%E5%86%B2%E5%88%BA%E6%8C%87%E5%8D%97/</guid><pubDate>Sun, 19 Jul 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;微观经济学 Short Essay 冲刺指南&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;适用范围：&lt;code&gt;Notes&lt;/code&gt; 中 12 个章节，以及 &lt;code&gt;Short Essay Questions&lt;/code&gt; 中的汇总卷和各章 Worksheet。&lt;br /&gt;
目标：不会从头推导也能先识别模型，再按固定步骤拿到过程分。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;0. 时间不够时，先学什么&lt;/h2&gt;
&lt;p&gt;按出现频率和串联能力排序：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;供需曲线移动与关联市场&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;利润最大化：&lt;code&gt;MR = MC&lt;/code&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;税收：税楔、税负、税收收入、DWL&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;弹性与总收益&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;完全竞争、垄断、垄断竞争三种企业图&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;寡头 payoff matrix&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;正负外部性&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;价格管制、配额、消费者/生产者剩余&lt;/li&gt;
&lt;li&gt;PPF、比较优势、成本曲线、公共品&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;最值得死记的九句话：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;坐标轴上的本商品价格变化，造成&lt;strong&gt;沿曲线移动&lt;/strong&gt;；其他因素变化，造成&lt;strong&gt;整条曲线平移&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;均衡变化永远先写：哪条曲线、向哪边移动，再写 &lt;code&gt;P&lt;/code&gt; 和 &lt;code&gt;Q&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;企业利润最大化的总规则是 &lt;code&gt;MR = MC&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;完全竞争企业 &lt;code&gt;P = MR&lt;/code&gt;，所以用 &lt;code&gt;P = MC&lt;/code&gt;；垄断者用 &lt;code&gt;MR = MC&lt;/code&gt; 后，必须回到需求曲线找价格。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Profit = TR - TC = (P - ATC)Q&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;需求越缺乏弹性的一方，越能把税负推给另一方；更准确地说，&lt;strong&gt;较缺乏弹性的一方承担更多税负&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;税收由谁依法上缴，不决定谁真正承担税负。&lt;/li&gt;
&lt;li&gt;负外部性导致市场数量过多；正外部性导致市场数量过少。&lt;/li&gt;
&lt;li&gt;寡头题不要猜，逐格比较 payoff，先找 best response，再找 Nash equilibrium。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h2&gt;1. 所有 Short Essay 都能套的“五步法”&lt;/h2&gt;
&lt;h3&gt;第一步：点名模型&lt;/h3&gt;
&lt;p&gt;开头直接写：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;This is a &lt;strong&gt;[supply shift / monopoly / tax incidence / externality / game theory]&lt;/strong&gt; problem.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;老师一眼就知道你没有跑题。&lt;/p&gt;
&lt;h3&gt;第二步：写出“冲击”&lt;/h3&gt;
&lt;p&gt;不要一上来猜价格。先说发生了什么：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Bad weather raises production costs, so the supply of coffee shifts left.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;第三步：写机制&lt;/h3&gt;
&lt;p&gt;至少写一个 &lt;code&gt;because&lt;/code&gt;：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;At the old price there is excess demand, so buyers bid the price up.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;第四步：写方向或数值结论&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;Therefore, equilibrium price rises and equilibrium quantity falls.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;第五步：补图或福利&lt;/h3&gt;
&lt;p&gt;图中至少标：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;横轴 &lt;code&gt;Q&lt;/code&gt;，纵轴 &lt;code&gt;P&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;原曲线 &lt;code&gt;D1/S1&lt;/code&gt;，新曲线 &lt;code&gt;D2/S2&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;原均衡 &lt;code&gt;E1&lt;/code&gt;，新均衡 &lt;code&gt;E2&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;原、新价格与数量&lt;/li&gt;
&lt;li&gt;若有政策：tax wedge、quota、CS、PS、government revenue、DWL&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;可直接背的四句英文模板&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;The change shifts the &lt;strong&gt;[demand/supply]&lt;/strong&gt; curve &lt;strong&gt;[right/left]&lt;/strong&gt;.&lt;br /&gt;
At the original price, there is a &lt;strong&gt;[shortage/surplus]&lt;/strong&gt;.&lt;br /&gt;
The market moves to a new equilibrium.&lt;br /&gt;
Therefore, equilibrium price &lt;strong&gt;[rises/falls]&lt;/strong&gt; and equilibrium quantity &lt;strong&gt;[rises/falls]&lt;/strong&gt;.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如果结果不确定：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;The effect on price/quantity is ambiguous because the two shifts push it in opposite directions. The final effect depends on the relative size of the shifts.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;“不确定”不是不会做；只要两个力量方向相反且题目没给大小，&lt;strong&gt;ambiguous&lt;/strong&gt; 就是标准答案。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;2. 12 章知识地图&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;章&lt;/th&gt;
&lt;th&gt;一句话核心&lt;/th&gt;
&lt;th&gt;Short Essay 常见问法&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;1. Models, PPF and Trade&lt;/td&gt;
&lt;td&gt;稀缺迫使取舍；比较优势取决于较低机会成本&lt;/td&gt;
&lt;td&gt;算机会成本、判断专业化方向、解释贸易收益&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2. Supply and Demand&lt;/td&gt;
&lt;td&gt;外部冲击移动曲线，价格使市场走向均衡&lt;/td&gt;
&lt;td&gt;判断 shift/movement、预测 &lt;code&gt;P/Q&lt;/code&gt;、关联市场&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3. CS and PS&lt;/td&gt;
&lt;td&gt;市场均衡在无市场失灵时最大化总剩余&lt;/td&gt;
&lt;td&gt;画 CS/PS、比较政策前后福利、找 DWL&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;4. Price Controls and Quotas&lt;/td&gt;
&lt;td&gt;有约束力的管制压低交易量并造成 DWL&lt;/td&gt;
&lt;td&gt;上限/下限是否 binding、短缺/过剩、quota rent&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;5. Elasticity&lt;/td&gt;
&lt;td&gt;弹性衡量百分比反应，决定收益变化和税收效果&lt;/td&gt;
&lt;td&gt;中点法、弹性分类、价格与 TR、交叉/收入弹性&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;6. Taxes&lt;/td&gt;
&lt;td&gt;税制造买卖双方价格之间的 wedge&lt;/td&gt;
&lt;td&gt;税负归宿、税收收入、DWL、效率与公平&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;7. Inputs and Costs&lt;/td&gt;
&lt;td&gt;边际产量递减导致 MC 上升；MC 穿过平均成本最低点&lt;/td&gt;
&lt;td&gt;算 FC/VC/ATC/AVC/MC，解释曲线形状&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;8. Perfect Competition&lt;/td&gt;
&lt;td&gt;价格接受者按 &lt;code&gt;P=MC&lt;/code&gt; 生产&lt;/td&gt;
&lt;td&gt;盈亏、停业、短期供给、长期进入退出&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;9. Monopoly&lt;/td&gt;
&lt;td&gt;垄断者限制产量，按 &lt;code&gt;MR=MC&lt;/code&gt; 后从 D 读价格&lt;/td&gt;
&lt;td&gt;函数题、画利润、比较竞争结果、价格歧视&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;10. Monopolistic Competition&lt;/td&gt;
&lt;td&gt;短期像垄断，长期因进入退出利润归零&lt;/td&gt;
&lt;td&gt;长短期图、markup、excess capacity&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;11. Oligopoly and Game Theory&lt;/td&gt;
&lt;td&gt;每家企业必须考虑对手反应&lt;/td&gt;
&lt;td&gt;payoff matrix、dominant strategy、Nash、collusion&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;12. Externalities/Public Goods&lt;/td&gt;
&lt;td&gt;私人成本或收益不等于社会成本或收益&lt;/td&gt;
&lt;td&gt;社会最优量、税/补贴、许可证、商品四分类&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;h2&gt;3. 题型一：供需移动与关联市场&lt;/h2&gt;
&lt;h3&gt;3.1 先问：是 shift 还是 movement along？&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;本商品自身价格改变：沿现有需求或供给曲线移动。&lt;/li&gt;
&lt;li&gt;收入、品味、预期、消费者人数、相关商品价格：需求曲线移动。&lt;/li&gt;
&lt;li&gt;投入价格、技术、生产者人数、预期、自然条件：供给曲线移动。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;看到“价格高、销量也高”不要立刻说违反需求定律。需求定律说的是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;同一条需求曲线上，其他条件不变时&lt;/strong&gt;，价格上升导致需求量下降。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;现实中价格和销量同时上升，往往是需求曲线右移。&lt;/p&gt;
&lt;h3&gt;3.2 单一曲线移动的四个必背结果&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;变化&lt;/th&gt;
&lt;th&gt;均衡价格&lt;/th&gt;
&lt;th&gt;均衡数量&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;D →&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;D ←&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;S →&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;S ←&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;3.3 关联市场的“多米诺骨牌法”&lt;/h3&gt;
&lt;p&gt;每次只处理一环：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;原市场发生什么？&lt;/li&gt;
&lt;li&gt;原商品的价格或消费量如何变化？&lt;/li&gt;
&lt;li&gt;它与第二商品是替代品还是互补品？&lt;/li&gt;
&lt;li&gt;第二市场移动的是需求还是供给？&lt;/li&gt;
&lt;li&gt;再推第二市场的 &lt;code&gt;P/Q&lt;/code&gt;。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;规则：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;X&lt;/code&gt; 的价格上升，&lt;code&gt;X&lt;/code&gt; 的替代品 &lt;code&gt;Y&lt;/code&gt;：&lt;code&gt;D_Y →&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;X&lt;/code&gt; 的价格上升，&lt;code&gt;X&lt;/code&gt; 的互补品 &lt;code&gt;Z&lt;/code&gt;：&lt;code&gt;D_Z ←&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;X&lt;/code&gt; 的消费量下降，专门与 &lt;code&gt;X&lt;/code&gt; 搭配的商品：需求通常下降&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;标准表述：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Coffee supply shifts left, so the price of coffee rises and its quantity falls. Tea is a substitute, so demand for tea shifts right; both its price and quantity rise. Sugar is used with both drinks, so its final demand may be ambiguous unless the question tells us how total drink consumption changes.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.4 供需同时移动&lt;/h3&gt;
&lt;p&gt;可以确定的只写确定的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;D →&lt;/code&gt; 且 &lt;code&gt;S →&lt;/code&gt;：&lt;code&gt;Q ↑&lt;/code&gt;，&lt;code&gt;P&lt;/code&gt; 不确定。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;D ←&lt;/code&gt; 且 &lt;code&gt;S ←&lt;/code&gt;：&lt;code&gt;Q ↓&lt;/code&gt;，&lt;code&gt;P&lt;/code&gt; 不确定。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;D →&lt;/code&gt; 且 &lt;code&gt;S ←&lt;/code&gt;：&lt;code&gt;P ↑&lt;/code&gt;，&lt;code&gt;Q&lt;/code&gt; 不确定。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;D ←&lt;/code&gt; 且 &lt;code&gt;S →&lt;/code&gt;：&lt;code&gt;P ↓&lt;/code&gt;，&lt;code&gt;Q&lt;/code&gt; 不确定。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;4. 题型二：剩余、价格管制与配额&lt;/h2&gt;
&lt;h3&gt;4.1 福利面积&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;CS&lt;/code&gt;：需求曲线下方、买方支付价格上方。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;PS&lt;/code&gt;：卖方收到价格下方、供给曲线上方。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;TS = CS + PS&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;DWL&lt;/code&gt;：政策使本来有利可图的交易消失后，丢掉的总剩余。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;4.2 价格上限 Price Ceiling&lt;/h3&gt;
&lt;p&gt;先判断是否有约束力：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;上限低于均衡价：binding，出现 &lt;code&gt;Qd &amp;gt; Qs&lt;/code&gt; 的短缺。&lt;/li&gt;
&lt;li&gt;上限高于均衡价：non-binding，没有实际影响。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;实际交易量由市场“短边”决定，即 &lt;code&gt;min(Qd, Qs)&lt;/code&gt;，所以 binding ceiling 下交易量是 &lt;code&gt;Qs&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;答题至少写：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;A binding price ceiling creates a shortage, lowers the quantity traded, causes inefficient allocation and non-price rationing, and creates deadweight loss.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.3 价格下限 Price Floor&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;下限高于均衡价：binding，出现 &lt;code&gt;Qs &amp;gt; Qd&lt;/code&gt; 的过剩。&lt;/li&gt;
&lt;li&gt;实际交易量通常是 &lt;code&gt;Qd&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;最低工资是劳动力市场的价格下限；劳动供给超过劳动需求的差额是 unemployment。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;4.4 配额 Quota&lt;/h3&gt;
&lt;p&gt;配额把数量限制在 &lt;code&gt;Qquota &amp;lt; Q*&lt;/code&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;买方愿付价格 &lt;code&gt;PD&lt;/code&gt; 高于卖方供给价格 &lt;code&gt;PS&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Quota rent per unit = PD - PS&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;总 quota rent 为 &lt;code&gt;(PD - PS) × Qquota&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;因交易量太低产生 DWL。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;许可证免费发放不代表没有价值：许可证持有人可以获得 quota rent。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;5. 题型三：弹性&lt;/h2&gt;
&lt;h3&gt;5.1 中点法&lt;/h3&gt;
&lt;p&gt;$$
%\Delta Q=\frac{Q_2-Q_1}{(Q_1+Q_2)/2}\times100%
$$&lt;/p&gt;
&lt;p&gt;$$
%\Delta P=\frac{P_2-P_1}{(P_1+P_2)/2}\times100%
$$&lt;/p&gt;
&lt;p&gt;$$
E_d=\left|\frac{%\Delta Q_d}{%\Delta P}\right|
$$&lt;/p&gt;
&lt;p&gt;需求价格弹性通常取绝对值：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;Ed &amp;gt; 1&lt;/code&gt;：elastic&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Ed = 1&lt;/code&gt;：unit elastic&lt;/li&gt;
&lt;li&gt;&lt;code&gt;0 &amp;lt; Ed &amp;lt; 1&lt;/code&gt;：inelastic&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Ed = 0&lt;/code&gt;：perfectly inelastic&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Ed = ∞&lt;/code&gt;：perfectly elastic&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;5.2 价格、弹性与总收益 TR&lt;/h3&gt;
&lt;p&gt;&lt;code&gt;TR = P × Q&lt;/code&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;需求&lt;/th&gt;
&lt;th&gt;提价后 TR&lt;/th&gt;
&lt;th&gt;降价后 TR&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Unit elastic&lt;/td&gt;
&lt;td&gt;不变&lt;/td&gt;
&lt;td&gt;不变&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;td&gt;↑&lt;/td&gt;
&lt;td&gt;↓&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;通俗理解：提价有“每件多收钱”和“少卖一些”两个效果。哪个更强，由弹性决定。&lt;/p&gt;
&lt;h3&gt;5.3 收入与交叉价格弹性&lt;/h3&gt;
&lt;p&gt;$$
E_I=\frac{%\Delta Q}{%\Delta Income}
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;EI &amp;gt; 0&lt;/code&gt;：normal good&lt;/li&gt;
&lt;li&gt;&lt;code&gt;EI &amp;lt; 0&lt;/code&gt;：inferior good&lt;/li&gt;
&lt;li&gt;&lt;code&gt;EI &amp;gt; 1&lt;/code&gt;：常被视为 luxury&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
E_{XY}=\frac{%\Delta Q_X}{%\Delta P_Y}
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;EXY &amp;gt; 0&lt;/code&gt;：substitutes&lt;/li&gt;
&lt;li&gt;&lt;code&gt;EXY &amp;lt; 0&lt;/code&gt;：complements&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;计算题模板：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;code&gt;%ΔQ = elasticity × %Δ variable&lt;/code&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;不要擅自去掉交叉弹性和收入弹性的正负号。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;6. 题型四：税收&lt;/h2&gt;
&lt;h3&gt;6.1 图怎么画&lt;/h3&gt;
&lt;p&gt;从量税 &lt;code&gt;t&lt;/code&gt; 可以画成：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;对卖方征税：供给曲线上移 &lt;code&gt;t&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;对买方征税：需求曲线下移 &lt;code&gt;t&lt;/code&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;二者最终产生相同的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;交易量 &lt;code&gt;Qt&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;买方支付价 &lt;code&gt;PB&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;卖方实收价 &lt;code&gt;PS&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;税楔 &lt;code&gt;PB - PS = t&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;6.2 税负归宿&lt;/h3&gt;
&lt;p&gt;核心不是“谁把钱交给政府”，而是谁较难逃离市场：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;The less elastic side of the market bears more of the tax burden.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ul&gt;
&lt;li&gt;需求更缺乏弹性：消费者承担更多。&lt;/li&gt;
&lt;li&gt;供给更缺乏弹性：生产者承担更多。&lt;/li&gt;
&lt;li&gt;完全无弹性的一方承担全部税负。&lt;/li&gt;
&lt;li&gt;完全弹性的一方不承担税负。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;6.3 三个面积&lt;/h3&gt;
&lt;p&gt;$$
Tax\ Revenue=t\times Q_t
$$&lt;/p&gt;
&lt;p&gt;$$
DWL=\frac12\times t\times(Q_0-Q_t)
$$&lt;/p&gt;
&lt;p&gt;图中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;税收收入是矩形；&lt;/li&gt;
&lt;li&gt;DWL 是数量减少部分对应的三角形；&lt;/li&gt;
&lt;li&gt;买方税负/单位为 &lt;code&gt;PB-P0&lt;/code&gt;；&lt;/li&gt;
&lt;li&gt;卖方税负/单位为 &lt;code&gt;P0-PS&lt;/code&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;6.4 弹性与效率&lt;/h3&gt;
&lt;p&gt;供给或需求越有弹性，税后数量减少越多，DWL 越大。&lt;br /&gt;
土地供给接近完全无弹性，所以土地税扭曲较小；税没有办法让“土地逃走”。&lt;/p&gt;
&lt;h3&gt;6.5 税制分类&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Proportional：平均税率不随收入变化。&lt;/li&gt;
&lt;li&gt;Progressive：收入越高，平均税率越高。&lt;/li&gt;
&lt;li&gt;Regressive：收入越高，平均税率越低。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;统一免税额或统一现金补贴通常使低收入者相对受益更多，使制度更 progressive。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;7. 题型五：成本与完全竞争&lt;/h2&gt;
&lt;h3&gt;7.1 成本公式&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;TC = FC + VC&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;AFC = FC/Q&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;AVC = VC/Q&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;ATC = TC/Q = AFC + AVC&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;MC = ΔTC/ΔQ&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;关系：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;MC &amp;lt; ATC&lt;/code&gt;，ATC 被往下拉。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;MC &amp;gt; ATC&lt;/code&gt;，ATC 被往上拉。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;MC = ATC&lt;/code&gt; 在 ATC 最低点。&lt;/li&gt;
&lt;li&gt;同理，MC 穿过 AVC 最低点。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;边际产量递减意味着：多加一名工人带来的额外产出越来越少，所以每多生产一单位的 MC 最终会上升。&lt;/p&gt;
&lt;h3&gt;7.2 完全竞争六步计算法&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;写 &lt;code&gt;P = MR&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;解 &lt;code&gt;P = MC&lt;/code&gt; 得 &lt;code&gt;Q*&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;检查停业条件。&lt;/li&gt;
&lt;li&gt;算 &lt;code&gt;TR = P×Q&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;算 &lt;code&gt;TC&lt;/code&gt; 或 &lt;code&gt;ATC×Q&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;算 &lt;code&gt;Profit = TR-TC&lt;/code&gt;。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;短期决策：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;P &amp;gt; ATC&lt;/code&gt;：盈利并生产。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;AVC ≤ P &amp;lt; ATC&lt;/code&gt;：亏损但继续生产，因为收入能覆盖 VC 并分担一部分 FC。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;P &amp;lt; min AVC&lt;/code&gt;：停业。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;注意：停业不是退出。短期停业仍支付 FC；长期退出可以避免全部成本。&lt;/p&gt;
&lt;h3&gt;7.3 长期进入退出&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;有经济利润：企业进入，市场供给右移，价格下降，利润归零。&lt;/li&gt;
&lt;li&gt;有经济亏损：企业退出，市场供给左移，价格上升，利润归零。&lt;/li&gt;
&lt;li&gt;长期完全竞争：&lt;code&gt;P = MC = min ATC&lt;/code&gt;，经济利润为零。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Worksheet 中 &lt;code&gt;P=80, MC=-8+4Q&lt;/code&gt;：&lt;/p&gt;
&lt;p&gt;$$
80=-8+4Q\Rightarrow Q=22
$$&lt;/p&gt;
&lt;p&gt;$$
TC=40-8(22)+2(22)^2=832
$$&lt;/p&gt;
&lt;p&gt;$$
Profit=80(22)-832=928
$$&lt;/p&gt;
&lt;p&gt;因此长期有进入，供给增加、价格下降、单个企业利润回到零。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;8. 题型六：垄断与价格歧视&lt;/h2&gt;
&lt;h3&gt;8.1 垄断函数题七步法&lt;/h3&gt;
&lt;p&gt;若给 &lt;code&gt;Q = a-bP&lt;/code&gt;：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;改写成 inverse demand：&lt;code&gt;P=P(Q)&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;TR=P(Q)×Q&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;对 &lt;code&gt;TR&lt;/code&gt; 求边际得到 &lt;code&gt;MR&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;用 &lt;code&gt;MR=MC&lt;/code&gt; 解 &lt;code&gt;Qm&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;把 &lt;code&gt;Qm&lt;/code&gt; 代回&lt;strong&gt;需求函数&lt;/strong&gt;求 &lt;code&gt;Pm&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;计算 &lt;code&gt;TC&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;&lt;code&gt;Profit=TR-TC&lt;/code&gt;。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;最大陷阱：把 &lt;code&gt;MR=MC&lt;/code&gt; 交点的纵坐标当价格。那是 MR，不是消费者付的价格。&lt;/p&gt;
&lt;h3&gt;8.2 为什么垄断的 MR 小于 P&lt;/h3&gt;
&lt;p&gt;垄断者为了多卖一单位，必须降低价格；降价不仅作用于新增单位，也作用于原来所有单位。因此：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;code&gt;MR = 新增一单位的收入 - 原有单位降价造成的收入损失&lt;/code&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;所以向下倾斜的需求下 &lt;code&gt;MR &amp;lt; P&lt;/code&gt;。&lt;/p&gt;
&lt;h3&gt;8.3 与完全竞争比较&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;垄断：&lt;code&gt;Qm&lt;/code&gt; 较低，&lt;code&gt;Pm&lt;/code&gt; 较高，&lt;code&gt;P&amp;gt;MC&lt;/code&gt;，有 DWL。&lt;/li&gt;
&lt;li&gt;完全竞争：&lt;code&gt;Pc&lt;/code&gt; 在 &lt;code&gt;D=MC&lt;/code&gt; 处，数量更高、价格更低。&lt;/li&gt;
&lt;li&gt;单一价格垄断者不会在需求曲线的 inelastic 区域生产，因为减产提价能同时增加 TR、减少 TC，原点不可能利润最大化。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;8.4 价格歧视表格题&lt;/h3&gt;
&lt;p&gt;对每个群体分别计算：&lt;/p&gt;
&lt;p&gt;$$
TR_i=P_iQ_i
$$&lt;/p&gt;
&lt;p&gt;若 MC 为零，选择使每组 &lt;code&gt;TR&lt;/code&gt; 最大的价格。若 MC 不为零，应比较利润或用每组 &lt;code&gt;MR=MC&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;必须满足：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;企业有 market power；&lt;/li&gt;
&lt;li&gt;能区分不同支付意愿群体；&lt;/li&gt;
&lt;li&gt;能阻止低价买入后转卖。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;完全价格歧视会把 CS 转成利润，并可能消除单一价格垄断的 DWL；它提高效率不等于更公平。&lt;/p&gt;
&lt;h3&gt;8.5 汇总卷垄断计算题的答案&lt;/h3&gt;
&lt;p&gt;给定：&lt;/p&gt;
&lt;p&gt;$$
Q=3000-\frac12P,\quad MC=120,\quad FC=100000
$$&lt;/p&gt;
&lt;p&gt;则：&lt;/p&gt;
&lt;p&gt;$$
P=6000-2Q
$$&lt;/p&gt;
&lt;p&gt;$$
TR=6000Q-2Q^2,\quad MR=6000-4Q
$$&lt;/p&gt;
&lt;p&gt;$$
6000-4Q=120\Rightarrow Q=1470
$$&lt;/p&gt;
&lt;p&gt;$$
P=6000-2(1470)=3060
$$&lt;/p&gt;
&lt;p&gt;$$
Profit=3060(1470)-120(1470)-100000=4,221,800
$$&lt;/p&gt;
&lt;p&gt;每单位利润约为：&lt;/p&gt;
&lt;p&gt;$$
4,221,800/1470\approx 2,871.97
$$&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;9. 题型七：垄断竞争&lt;/h2&gt;
&lt;p&gt;识别词：many firms、differentiated products、free entry and exit。&lt;/p&gt;
&lt;h3&gt;短期&lt;/h3&gt;
&lt;p&gt;与垄断完全相同：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;code&gt;MR=MC&lt;/code&gt; 找 &lt;code&gt;Q&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;回需求曲线找 &lt;code&gt;P&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;比较 &lt;code&gt;P&lt;/code&gt; 与 &lt;code&gt;ATC&lt;/code&gt; 判断利润/亏损。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;长期&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;有利润 → 新企业进入 → 单个企业需求和 MR 左移 → 利润下降。&lt;/li&gt;
&lt;li&gt;有亏损 → 企业退出 → 留存企业需求和 MR 右移 → 亏损消失。&lt;/li&gt;
&lt;li&gt;长期均衡：需求曲线与 ATC 在利润最大化产量处相切，&lt;code&gt;P=ATC&lt;/code&gt;，经济利润为零。&lt;/li&gt;
&lt;li&gt;但仍有 &lt;code&gt;P&amp;gt;MC&lt;/code&gt;，且产量低于 min ATC 对应产量，存在 excess capacity。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Worksheet 酒店题中，当前 &lt;code&gt;MR&amp;lt;MC&lt;/code&gt;，说明最后一些房间“增加的成本大于增加的收入”，企业应：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;减少出租房间数量、提高价格，直到 &lt;code&gt;MR=MC&lt;/code&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;行业总量与单个企业数量不要混淆：&lt;/p&gt;
&lt;p&gt;$$
Q_{market}=N\times q_{firm}
$$&lt;/p&gt;
&lt;p&gt;企业进入时，每家企业销量可能下降，但因为 &lt;code&gt;N&lt;/code&gt; 增加，市场总销量仍可能上升。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;10. 题型八：寡头与博弈论&lt;/h2&gt;
&lt;h3&gt;10.1 Payoff matrix 四步法&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;固定对手的第一种策略，比较我的 payoff，圈出我的 best response。&lt;/li&gt;
&lt;li&gt;固定对手的第二种策略，再比较一次。&lt;/li&gt;
&lt;li&gt;对对手重复。&lt;/li&gt;
&lt;li&gt;两人的 best response 同时出现的格子就是 Nash equilibrium。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Dominant strategy：不管对方怎么做，我的同一个策略始终更好。&lt;br /&gt;
Nash equilibrium：给定对方策略，没有人愿意单方面改变。&lt;br /&gt;
两者不是同一个定义；Nash equilibrium 不一定来自 dominant strategies。&lt;/p&gt;
&lt;h3&gt;10.2 囚徒困境&lt;/h3&gt;
&lt;p&gt;常见结论：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;双方合谋可以获得较高总利润；&lt;/li&gt;
&lt;li&gt;但每家都有单方面作弊的诱因；&lt;/li&gt;
&lt;li&gt;最终 Nash equilibrium 可能让双方都更差。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Worksheet 挡风玻璃题 payoff：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;你＼对手&lt;/th&gt;
&lt;th&gt;Low&lt;/th&gt;
&lt;th&gt;High&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Low&lt;/td&gt;
&lt;td&gt;&lt;code&gt;(0,0)&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;(9,-1)&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;High&lt;/td&gt;
&lt;td&gt;&lt;code&gt;(-1,9)&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;(7,7)&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;对你而言：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;对方 Low：你选 Low 得 0，High 得 -1，所以选 Low。&lt;/li&gt;
&lt;li&gt;对方 High：你选 Low 得 9，High 得 7，所以仍选 Low。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此 Low 是双方 dominant strategy，Nash equilibrium 是 &lt;code&gt;(Low, Low)&lt;/code&gt;，双方利润均为 0；尽管 &lt;code&gt;(High, High)&lt;/code&gt; 可让双方各赚 7。&lt;/p&gt;
&lt;h3&gt;10.3 重复博弈&lt;/h3&gt;
&lt;p&gt;如果未来足够重要，作弊会引发未来惩罚，合作可能维持。&lt;br /&gt;
若每年延续概率为 50%，利率近似 0：&lt;/p&gt;
&lt;p&gt;$$
PV(cooperate)=7+0.5(7)+0.5^2(7)+\cdots=\frac7{1-0.5}=14
$$&lt;/p&gt;
&lt;p&gt;一次作弊赚 9，之后价格战赚 0，则：&lt;/p&gt;
&lt;p&gt;$$
PV(cheat)=9
$$&lt;/p&gt;
&lt;p&gt;因为 &lt;code&gt;14&amp;gt;9&lt;/code&gt;，这种惩罚策略下合谋有可能维持。&lt;/p&gt;
&lt;h3&gt;10.4 哪些变化让寡头更竞争&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;企业合并、数量减少：通常竞争更弱，价格更高。&lt;/li&gt;
&lt;li&gt;进入固定成本下降：进入更容易，竞争更强，价格更低。&lt;/li&gt;
&lt;li&gt;产品差异化提高：替代性下降，竞争通常更弱，价格更高。&lt;/li&gt;
&lt;li&gt;消费者更易比较价格质量：竞争更强，价格通常更低。&lt;/li&gt;
&lt;li&gt;企业可快速调整产量：抢夺市场更容易，合谋更难。&lt;/li&gt;
&lt;li&gt;政府增加进入限制：竞争更弱，价格更高。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;11. 题型九：外部性、公共品与公共资源&lt;/h2&gt;
&lt;h3&gt;11.1 负外部性&lt;/h3&gt;
&lt;p&gt;例如污染：&lt;/p&gt;
&lt;p&gt;$$
MSC=MPC+MEC
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;市场只看私人供给/成本 &lt;code&gt;MPC&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;社会成本曲线 &lt;code&gt;MSC&lt;/code&gt; 位于供给曲线上方。&lt;/li&gt;
&lt;li&gt;市场数量 &lt;code&gt;Qmarket&lt;/code&gt; 大于社会最优量 &lt;code&gt;Qsocial&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;最优 Pigouvian tax 等于社会最优量处的边际外部成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;答题句：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Because producers ignore external costs imposed on third parties, marginal private cost is below marginal social cost. The market therefore overproduces the good.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;11.2 正外部性&lt;/h3&gt;
&lt;p&gt;例如教育、疫苗：&lt;/p&gt;
&lt;p&gt;$$
MSB=MPB+MEB
$$&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;社会收益曲线 &lt;code&gt;MSB&lt;/code&gt; 位于私人需求曲线上方。&lt;/li&gt;
&lt;li&gt;市场数量小于社会最优量。&lt;/li&gt;
&lt;li&gt;最优 Pigouvian subsidy 等于社会最优量处的边际外部收益。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.3 配额与税在外部性题中的关系&lt;/h3&gt;
&lt;p&gt;若政府把配额设在 &lt;code&gt;Qsocial&lt;/code&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;许可证市场价格等于需求价与供给价之间的 wedge；&lt;/li&gt;
&lt;li&gt;若次年改为按同样金额出售无限许可证，相当于单位税；&lt;/li&gt;
&lt;li&gt;若税额恰好等于最优 wedge，数量仍可停在 &lt;code&gt;Qsocial&lt;/code&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;11.4 免费实物与补贴为什么不同&lt;/h3&gt;
&lt;p&gt;如果每人本来就会乘超过 3 次 MTR，发 3 次免费票主要产生 income effect：前 3 次免费，但&lt;strong&gt;第 4 次的边际价格没有下降&lt;/strong&gt;。&lt;br /&gt;
每次乘车补贴则降低每一趟的边际价格，能更直接鼓励增加使用量。因此二者通常不等效。&lt;/p&gt;
&lt;h3&gt;11.5 四类商品&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;商品&lt;/th&gt;
&lt;th&gt;可排他？&lt;/th&gt;
&lt;th&gt;消费有竞争性？&lt;/th&gt;
&lt;th&gt;主要问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Private good&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;市场通常可有效供给&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Public good&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;free-rider，私人供给不足&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Common resource&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;overuse / tragedy of commons&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Artificially scarce good&lt;/td&gt;
&lt;td&gt;是&lt;/td&gt;
&lt;td&gt;否&lt;/td&gt;
&lt;td&gt;价格可能导致 underconsumption&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;公共品的市场需求要把个人边际支付意愿&lt;strong&gt;纵向相加&lt;/strong&gt;，因为所有人同时消费同一个数量。&lt;/p&gt;
&lt;p&gt;Coase theorem 的答题条件：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;If property rights are clear and transaction costs are sufficiently low, private bargaining can internalize the externality and reach an efficient outcome. The distribution of surplus depends on the initial property rights.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;12. 汇总卷 5 大题的快速答案&lt;/h2&gt;
&lt;h3&gt;12.1 成人票/儿童票价格歧视&lt;/h3&gt;
&lt;p&gt;成人各价格的最高收入：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;$9×100=$900&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;$8×200=$1,600&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;$7×300=$2,100&lt;/code&gt; ← 最大&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;儿童：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;$5×100=$500&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;$4×200=$800&lt;/code&gt; ← 最大&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所以分别定价为成人 &lt;code&gt;$7&lt;/code&gt;、儿童 &lt;code&gt;$4&lt;/code&gt;：&lt;/p&gt;
&lt;p&gt;$$
Profit=2100+800-2000=900
$$&lt;/p&gt;
&lt;p&gt;禁止价格歧视后，统一价的主要候选：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;$7×300=$2,100&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;$5×400=$2,000&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;$4×500=$2,000&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;故定价 &lt;code&gt;$7&lt;/code&gt;，利润：&lt;/p&gt;
&lt;p&gt;$$
2100-2000=100
$$&lt;/p&gt;
&lt;p&gt;福利变化：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;成人仍付 &lt;code&gt;$7&lt;/code&gt;、人数仍为 300，福利不变。&lt;/li&gt;
&lt;li&gt;儿童不再买票；若 100 名儿童愿付 &lt;code&gt;$5&lt;/code&gt;、另 100 名愿付 &lt;code&gt;$4&lt;/code&gt;，原儿童 CS 为 &lt;code&gt;$100&lt;/code&gt;，现在损失 &lt;code&gt;$100&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;主办者利润减少 &lt;code&gt;$800&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;总剩余减少 &lt;code&gt;$900&lt;/code&gt;，没人因此变得更好。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;12.2 夏季价格低销量少、冬季价格高销量多&lt;/h3&gt;
&lt;p&gt;不违反需求定律。两个观察点不在同一条固定需求曲线上；冬季需求右移且移动幅度足够大，使价格和数量同时上升。可用取暖燃料、冬季外套、滑雪用品举例。&lt;/p&gt;
&lt;h3&gt;12.3 垄断计算&lt;/h3&gt;
&lt;p&gt;答案见第 8.5 节：&lt;code&gt;Q=1470&lt;/code&gt;、&lt;code&gt;P=3060&lt;/code&gt;、总利润 &lt;code&gt;$4,221,800&lt;/code&gt;、单位利润约 &lt;code&gt;$2,871.97&lt;/code&gt;。&lt;/p&gt;
&lt;h3&gt;12.4 三个市场的税&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;普通面条市场：画税后供给上移，买方价上升、卖方净价下降、数量下降；税收是矩形，DWL 是三角形。&lt;/li&gt;
&lt;li&gt;公寓供给缺乏弹性：房东承担较多税负，数量变化和 DWL 较小。&lt;/li&gt;
&lt;li&gt;进口酒供给很有弹性：消费者承担较多税负，数量反应较大，DWL 较大。&lt;/li&gt;
&lt;li&gt;想最小化 DWL：对缺乏弹性的市场征税。&lt;/li&gt;
&lt;li&gt;想最小化消费者负担：对供给缺乏弹性的市场征税。&lt;/li&gt;
&lt;li&gt;通常效率排序：土地税 &amp;gt; 所得税 &amp;gt; 进口关税；理由是被征税活动对税的数量反应依次变大。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;12.5 咖啡、茶、糖&lt;/h3&gt;
&lt;p&gt;坏天气减少咖啡供给：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Coffee：&lt;code&gt;S←&lt;/code&gt;，&lt;code&gt;P↑, Q↓&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;Tea 是替代品：&lt;code&gt;D→&lt;/code&gt;，&lt;code&gt;P↑, Q↑&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;Sugar 同时与两者互补，若没有更多信息，严格答案可以说净效应不确定；若假定每杯用糖相同且饮料总消费因咖啡变贵而下降，则糖需求下降。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;消费者从茶转向咖啡，人数不变且每杯用糖相同：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Coffee：&lt;code&gt;D→&lt;/code&gt;，&lt;code&gt;P↑, Q↑&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;Tea：&lt;code&gt;D←&lt;/code&gt;，&lt;code&gt;P↓, Q↓&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;Sugar：总杯数与每杯用量不变，需求不变，&lt;code&gt;P/Q&lt;/code&gt; 不变。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;13. 额外例题与参考答案&lt;/h2&gt;
&lt;h3&gt;例 1：PPF 与比较优势&lt;/h3&gt;
&lt;p&gt;甲一天可做 8 个面包或 4 件衣服；乙可做 6 个面包或 6 件衣服。谁应专业化什么？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;甲：1 件衣服机会成本为 2 个面包；1 个面包成本为 0.5 件衣服。&lt;/li&gt;
&lt;li&gt;乙：1 件衣服成本为 1 个面包；1 个面包成本为 1 件衣服。&lt;/li&gt;
&lt;li&gt;甲生产面包的机会成本更低，甲对面包有比较优势。&lt;/li&gt;
&lt;li&gt;乙生产衣服的机会成本更低，乙对衣服有比较优势。&lt;/li&gt;
&lt;li&gt;交换比率若在每件衣服换 1 到 2 个面包之间，双方都可获益。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;例 2：供需同时移动&lt;/h3&gt;
&lt;p&gt;智能手机需求增加，同时芯片技术进步降低成本。价格和数量怎样变化？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt; &lt;code&gt;D→&lt;/code&gt; 且 &lt;code&gt;S→&lt;/code&gt;，数量一定增加；需求增加推高价格、供给增加压低价格，所以价格不确定。&lt;/p&gt;
&lt;h3&gt;例 3：价格上限&lt;/h3&gt;
&lt;p&gt;均衡租金为 10,000 元，政府规定最高租金 7,000 元。问结果。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt; 上限低于均衡价，因此 binding；&lt;code&gt;Qd↑&lt;/code&gt;、&lt;code&gt;Qs↓&lt;/code&gt;，出现短缺。实际成交量由 &lt;code&gt;Qs&lt;/code&gt; 决定，并可能出现排队、关系分配、降低维护质量和黑市，且产生 DWL。&lt;/p&gt;
&lt;h3&gt;例 4：弹性与收入&lt;/h3&gt;
&lt;p&gt;电影院把票价提高 10%，观众人数下降 20%。需求弹性和票房收入怎样变化？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt; &lt;code&gt;Ed=20%/10%=2&lt;/code&gt;，需求有弹性；数量下降比例更大，所以总票房下降。&lt;/p&gt;
&lt;h3&gt;例 5：税负&lt;/h3&gt;
&lt;p&gt;胰岛素需求非常缺乏弹性，供给普通。每支征税 20 元，谁承担更多？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt; 消费者承担更多，因为他们对价格变化反应小，难以减少购买。图中消费者支付价格上升接近 20 元，生产者净价下降较少，数量下降也较少。&lt;/p&gt;
&lt;h3&gt;例 6：完全竞争停业&lt;/h3&gt;
&lt;p&gt;一家完全竞争企业面对 &lt;code&gt;P=12&lt;/code&gt;，最优产量处 &lt;code&gt;ATC=15&lt;/code&gt;、&lt;code&gt;AVC=9&lt;/code&gt;。应生产吗？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt; 短期应生产。企业每单位亏 3，总体有经济亏损；但 &lt;code&gt;P&amp;gt;AVC&lt;/code&gt;，收入覆盖全部可变成本并分担部分固定成本，停业反而损失全部固定成本。长期若情况持续则退出。&lt;/p&gt;
&lt;h3&gt;例 7：垄断函数&lt;/h3&gt;
&lt;p&gt;需求 &lt;code&gt;P=100-Q&lt;/code&gt;，&lt;code&gt;MC=20&lt;/code&gt;，固定成本为 400。求最优价格、数量和利润。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
TR=100Q-Q^2,\quad MR=100-2Q
$$&lt;/p&gt;
&lt;p&gt;$$
100-2Q=20\Rightarrow Q=40
$$&lt;/p&gt;
&lt;p&gt;$$
P=100-40=60
$$&lt;/p&gt;
&lt;p&gt;$$
Profit=60(40)-20(40)-400=1200
$$&lt;/p&gt;
&lt;h3&gt;例 8：价格歧视&lt;/h3&gt;
&lt;p&gt;博物馆对游客收 100 元时有 50 人，对学生收 40 元时有 100 人；边际成本为零、固定成本 3,000 元。允许分组定价时利润多少？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;$$
TR=100(50)+40(100)=9000
$$&lt;/p&gt;
&lt;p&gt;$$
Profit=9000-3000=6000
$$&lt;/p&gt;
&lt;p&gt;还应说明：必须能验证学生身份并防止转售。&lt;/p&gt;
&lt;h3&gt;例 9：垄断竞争&lt;/h3&gt;
&lt;p&gt;某餐馆短期有经济利润。长期会发生什么？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt; 利润吸引新餐馆进入，消费者选择增加，原餐馆面对的需求和 MR 左移且更有弹性，价格、销量和利润下降。进入持续到需求曲线与 ATC 相切，&lt;code&gt;P=ATC&lt;/code&gt;、经济利润为零；但仍有 &lt;code&gt;P&amp;gt;MC&lt;/code&gt; 和 excess capacity。&lt;/p&gt;
&lt;h3&gt;例 10：寡头&lt;/h3&gt;
&lt;p&gt;两家企业都可选择广告或不广告。若双方不广告各赚 8；一方广告则广告者赚 10、另一方赚 3；双方广告各赚 5。结果是什么？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt; 无论对方做什么，广告都更优：对方不广告时 &lt;code&gt;10&amp;gt;8&lt;/code&gt;；对方广告时 &lt;code&gt;5&amp;gt;3&lt;/code&gt;。广告是双方 dominant strategy，Nash equilibrium 为双方广告、各赚 5；它是囚徒困境，因为双方不广告可各赚 8。&lt;/p&gt;
&lt;h3&gt;例 11：负外部性&lt;/h3&gt;
&lt;p&gt;化工品市场 &lt;code&gt;MPC=10+Q&lt;/code&gt;，&lt;code&gt;MEC=20&lt;/code&gt;，需求边际收益 &lt;code&gt;MB=100-Q&lt;/code&gt;。求市场量、社会最优量和最优税。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;市场忽略外部成本：&lt;/p&gt;
&lt;p&gt;$$
100-Q=10+Q\Rightarrow Q_{market}=45
$$&lt;/p&gt;
&lt;p&gt;社会边际成本：&lt;/p&gt;
&lt;p&gt;$$
MSC=MPC+MEC=30+Q
$$&lt;/p&gt;
&lt;p&gt;$$
100-Q=30+Q\Rightarrow Q_{social}=35
$$&lt;/p&gt;
&lt;p&gt;最优 Pigouvian tax 为每单位 20，使市场量从 45 降到 35。&lt;/p&gt;
&lt;h3&gt;例 12：公共品&lt;/h3&gt;
&lt;p&gt;甲对一盏路灯的边际支付意愿是 60 元，乙是 40 元，提供成本是 80 元。是否应提供？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案：&lt;/strong&gt; 路灯是非排他、非竞争的公共品，社会边际收益要纵向相加：&lt;code&gt;60+40=100&lt;/code&gt;。因为 &lt;code&gt;100&amp;gt;80&lt;/code&gt;，从社会效率看应提供；但私人市场可能因 free-rider problem 供给不足。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;14. 最常见的失分点&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;把 demand increase 写成 quantity demanded increase。前者是曲线右移，后者通常是沿曲线移动。&lt;/li&gt;
&lt;li&gt;只写“价格涨、数量跌”，不写哪条曲线为什么移动。&lt;/li&gt;
&lt;li&gt;两条曲线同时移动时强行猜不确定的变量。&lt;/li&gt;
&lt;li&gt;垄断题在 MR 曲线上读价格。&lt;/li&gt;
&lt;li&gt;把 zero economic profit 当成老板没有收入。经济利润为零表示收入覆盖显性和隐性机会成本。&lt;/li&gt;
&lt;li&gt;亏损就立刻停业。短期要比较 &lt;code&gt;P&lt;/code&gt; 与 &lt;code&gt;AVC&lt;/code&gt;。&lt;/li&gt;
&lt;li&gt;税由卖方上缴就说卖方承担全部。&lt;/li&gt;
&lt;li&gt;把税收收入当成 DWL。税收收入只是剩余转移，DWL 才是净损失。&lt;/li&gt;
&lt;li&gt;正外部性把社会收益画在需求下方；正确是 &lt;code&gt;MSB&lt;/code&gt; 在私人需求上方。&lt;/li&gt;
&lt;li&gt;Nash equilibrium 凭直觉判断，没有逐行逐列比较 payoff。&lt;/li&gt;
&lt;li&gt;图没有标原、新曲线和均衡点。&lt;/li&gt;
&lt;li&gt;结论没有 &lt;code&gt;because&lt;/code&gt;，导致只有猜测、没有经济机制。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h2&gt;15. 考场最后检查&lt;/h2&gt;
&lt;p&gt;每小问交卷前用 10 秒检查：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;我点名模型了吗？&lt;/li&gt;
&lt;li&gt;我写了曲线移动方向或关键公式吗？&lt;/li&gt;
&lt;li&gt;我解释了为什么吗？&lt;/li&gt;
&lt;li&gt;我把 &lt;code&gt;P&lt;/code&gt;、&lt;code&gt;Q&lt;/code&gt;、profit/welfare 的最终结论写出来了吗？&lt;/li&gt;
&lt;li&gt;图上是否有轴、曲线名、旧新均衡？&lt;/li&gt;
&lt;li&gt;不确定的结果，我是否明确写了 ambiguous 和原因？&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;短文题不要求写长。最稳的答案通常是：&lt;strong&gt;一句模型 + 一句机制 + 一句结论 + 一张标清楚的图&lt;/strong&gt;。&lt;/p&gt;
</content:encoded></item><item><title>ECO2011 C11：Oligopolies and Game Theory</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c11-oligopolies--game-theory/chapter_11_oligopolies--game-theory/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c11-oligopolies--game-theory/chapter_11_oligopolies--game-theory/</guid><pubDate>Mon, 06 Jul 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Oligopolies &amp;amp; Game Theory&lt;/h1&gt;
&lt;p&gt;本章研究寡头 (Oligopoly) 以及理解寡头行为所需的博弈论 (Game Theory)。与完全竞争 (Perfect Competition) 不同，寡头市场中企业数量很少，每个企业的决策都会显著影响市场价格和其他企业利润；与垄断 (Monopoly) 不同，寡头企业又必须持续考虑竞争者会如何反应。因此，本章的核心不是单个企业如何在真空中定价，而是企业之间的相互依赖 (Interdependence)。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;
&lt;img src=&quot;Assets/slide_2.png&quot; alt=&quot;slide 2&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;1. Oligopoly 的含义与市场位置&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：寡头 (Oligopoly)
Oligopoly 是一种只有少数生产者的市场结构。行业中没有单个企业完全垄断市场，但每个主要企业都能影响市场价格，因此属于不完全竞争 (Imperfect Competition)。寡头市场中的企业称为寡头企业 (Oligopolist)。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Oligopoly 与垄断竞争 (Monopolistic Competition) 都属于 Imperfect Competition：企业有竞争者，但仍拥有市场力量 (Market Power)。它通常由与垄断相似的力量形成，例如规模经济、进入壁垒、固定成本、关键资源控制或网络效应；只是这些力量不足以让一家企业独占市场，而是让少数企业占据主要份额。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;p&gt;衡量市场集中度的常用指标是 Herfindahl-Hirschman Index (HHI)。它把行业中每家企业的市场份额平方后相加。HHI 越大，说明市场越集中，竞争越弱。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：Herfindahl-Hirschman Index (HHI)
HHI = sum of the squares of each firm&apos;s share of market sales。若三家企业市场份额分别为 60%, 25%, 15%，则 HHI = 60^2 + 25^2 + 15^2 = 4,450。一般而言，HHI &amp;lt; 1000 表示竞争性较强，HHI &amp;gt; 1800 常被视为寡头特征明显。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Market Shares&lt;/th&gt;
&lt;th&gt;HHI Calculation&lt;/th&gt;
&lt;th&gt;Interpretation&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;60%, 25%, 15%&lt;/td&gt;
&lt;td&gt;60^2 + 25^2 + 15^2 = 4,450&lt;/td&gt;
&lt;td&gt;市场高度集中，竞争较弱&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;HHI &amp;lt; 1000&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;Competitive industry&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;HHI &amp;gt; 1800&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;Oligopoly&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;2. Strategic Interaction：寡头为何难以分析&lt;/h2&gt;
&lt;p&gt;在完全竞争或垄断模型中，企业主要根据自身成本与需求曲线决策；但在 Oligopoly 中，企业利润强烈依赖其他大企业采取什么行动。这种情形称为战略互动 (Strategic Interaction)：任何一家企业的产量、价格、广告或投资决策，都会显著改变其他企业的利润。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：战略互动 (Strategic Interaction)
Strategic Interaction 指一个经济主体的最优行动取决于其他经济主体会如何行动。在寡头市场中，企业不能只问“我想怎么做”，还必须问“竞争者会如何回应”。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;最简单的寡头是双头垄断 (Duopoly)，即行业中只有两家企业。Duopoly 能把 Oligopoly 的关键逻辑压缩到最清楚的形式：如果两家企业都限制产量，市场价格可以保持较高；但每家企业又都有动机偷偷多生产，以抢占更大市场份额。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;3. Collusion, Cartel 与 Noncooperative Behavior&lt;/h2&gt;
&lt;p&gt;两家或少数几家企业如果意识到“大家都少生产会更赚钱”，就可能尝试合谋 (Collusion)。合谋的最强形式是卡特尔 (Cartel)：多个生产者正式同意限制产量或维持高价格，从而提高共同利润。若寡头企业能像一个垄断者那样行动，设置垄断价格 (Monopoly Price, P_M) 并分配垄断产量 (Monopoly Quantity, Q_M)，它们就能从市场中获得最高联合利润。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：合谋 (Collusion) 与卡特尔 (Cartel)
Collusion 指企业合作以避免相互压低利润，通常表现为维持高价或限制产量。Cartel 是 Collusion 的强形式，即多个生产者达成协议，遵守产量或价格限制，以提高联合利润。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;p&gt;但合谋本身很不稳定。即使企业加入 Cartel，也有动机作弊 (Cheat)：在其他企业限制产量时，自己多生产一点，就能以较高价格卖出更多数量，短期利润更高。这种只追求自身利润、忽视自己行为对其他企业利润影响的行为，称为非合作行为 (Noncooperative Behavior)。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点：寡头的根本张力
Oligopolists 共同看，最想达到 Monopoly Outcome；单独看，每家企业都想扩大产量或降价抢份额。因此寡头市场常在 Successful Collusion 与 Noncooperative Behavior 之间摇摆。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;4. Quantity Competition 与 Price Competition&lt;/h2&gt;
&lt;p&gt;寡头企业的竞争方式取决于短期是否存在产能约束 (Capacity Constraints)。如果企业短期内不能随意扩大产量，竞争更像数量竞争 (Quantity Competition)，也就是 Cournot Model 的基本逻辑。产能受限时，企业较容易避免过度竞争，因为每家企业都无法无限抢占市场；它们可以在没有正式协议的情况下形成某种“分市场”的结果，价格高于边际成本 (Marginal Cost, MC)，并获得利润。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心概念：Quantity Competition / Cournot Model
Quantity Competition 指企业主要选择产量而不是价格进行竞争。Cournot Model 的核心直觉是：当产能受限时，企业较容易维持价格高于 MC 的结果，但利润通常低于正式 Cartel 下的垄断利润。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;p&gt;如果企业生产的是完全替代品 (Perfect Substitutes)，且有足够产能满足市场需求，则竞争更像价格竞争 (Price Competition)，也就是 Bertrand Model 的逻辑。每家企业都有动机略微低于竞争者价格来抢走需求，于是相互降价会持续到价格接近 MC，结果类似完全竞争。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心概念：Price Competition / Bertrand Model
Price Competition 指企业主要通过价格竞争。Bertrand Model 的关键结论是：若产品完全同质且企业产能不受限，Undercutting 会把价格推向 Marginal Cost。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Competition Mode&lt;/th&gt;
&lt;th&gt;Key Assumption&lt;/th&gt;
&lt;th&gt;Typical Result&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Quantity Competition (Cournot Model)&lt;/td&gt;
&lt;td&gt;短期产能受限&lt;/td&gt;
&lt;td&gt;价格可高于 MC，利润为正，但低于 Cartel 利润&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Price Competition (Bertrand Model)&lt;/td&gt;
&lt;td&gt;产品同质且产能充足&lt;/td&gt;
&lt;td&gt;企业相互压价，Price approaches MC&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;5. 利润最大化：共同利益与个体诱因的冲突&lt;/h2&gt;
&lt;p&gt;如果寡头企业能够合作，它们会选择 Monopoly Outcome：设置 $P_M$，并把 $Q_M$ 分配给各成员。问题是，每家企业从自身角度看，都有诱因提高产量，获取更大市场份额。这样一来，总产量上升，市场价格下降，所有企业的利润都降低。&lt;/p&gt;
&lt;p&gt;随着寡头行业中的卖方数量增加，市场结果会越来越接近竞争性市场：价格接近 MC，产量接近社会有效率水平，利润接近零。因此，寡头企业越少、产品越简单、产能越稳定，合谋越容易；企业越多，维持高价越困难。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;6. Game Theory 与 Payoff Matrix&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：博弈论 (Game Theory)
Game Theory 是研究相互依赖情境下行为的理论工具。它用于预测寡头这类战略环境中的结果，因为每个参与者的收益不仅取决于自己的行动，也取决于其他参与者的行动。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;在博弈中，参与者获得的收益称为收益 (Payoff)。双人博弈常用收益矩阵 (Payoff Matrix) 表示：矩阵中每个格子对应双方行动组合下各自的收益。Payoff Matrix 的价值在于，它把 Interdependence 变成可以逐格比较的结构。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;
&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;ADM 与 Ajinomoto 的 Duopoly Payoff Matrix&lt;/h3&gt;
&lt;p&gt;课件中的 ADM 与 Ajinomoto 例子研究两家赖氨酸生产商的产量选择。两家都选择低产量时，各自利润为 180 million；若一方高产、一方低产，高产者可赚 200 million，低产者只赚 150 million；若双方都高产，各自只有 160 million。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;ADM \ Ajinomoto&lt;/th&gt;
&lt;th&gt;Produce 30 million pounds&lt;/th&gt;
&lt;th&gt;Produce 40 million pounds&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Produce 30 million pounds&lt;/td&gt;
&lt;td&gt;ADM: $180 million; Ajinomoto: $180 million&lt;/td&gt;
&lt;td&gt;ADM: $150 million; Ajinomoto: $200 million&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Produce 40 million pounds&lt;/td&gt;
&lt;td&gt;ADM: $200 million; Ajinomoto: $150 million&lt;/td&gt;
&lt;td&gt;ADM: $160 million; Ajinomoto: $160 million&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这个矩阵揭示了寡头困境：从共同利益看，两家都少生产最好；但从个体利益看，无论对方选择什么，自己多生产都更有吸引力。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;7. Dominant Strategy, Prisoners&apos; Dilemma 与 Nash Equilibrium&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：占优策略 (Dominant Strategy)
Dominant Strategy 是无论对方采取什么行动，自己都最优的策略。不是每个博弈都有 Dominant Strategy；是否存在取决于 Payoff Matrix 的具体收益结构。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当每个参与者的 Dominant Strategy 都是“背叛”或“作弊”，但双方都这样做反而比合作更差时，这个博弈就是囚徒困境 (Prisoners&apos; Dilemma)。它有两个特征：第一，每个参与者都有动机选择让自己受益、让对方受损的行动；第二，当所有人都这样做时，所有人都比合作时更糟。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：囚徒困境 (Prisoners&apos; Dilemma)
Prisoners&apos; Dilemma 是一种博弈：个体理性行动导致集体较差结果。在寡头市场中，它解释了为什么企业明知合作能提高共同利润，却仍可能选择扩大产量或降价竞争。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;p&gt;经典 Prisoners&apos; Dilemma 中，两名囚犯分别决定是否认罪 (Confess)。两人都不认罪时刑期较轻；若一人认罪、一人不认罪，认罪者获得轻判，不认罪者重判；若两人都认罪，双方都得到中等偏重的刑期。共同利益要求两人都不认罪，但个体诱因推动每个人认罪。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Louise \ Thelma&lt;/th&gt;
&lt;th&gt;Don&apos;t confess&lt;/th&gt;
&lt;th&gt;Confess&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Don&apos;t confess&lt;/td&gt;
&lt;td&gt;Louise: 2 years; Thelma: 2 years&lt;/td&gt;
&lt;td&gt;Louise: 20 years; Thelma: 5 years&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Confess&lt;/td&gt;
&lt;td&gt;Louise: 5 years; Thelma: 20 years&lt;/td&gt;
&lt;td&gt;Louise: 15 years; Thelma: 15 years&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：纳什均衡 (Nash Equilibrium)
Nash Equilibrium，也称非合作均衡 (Noncooperative Equilibrium)，是指在给定其他参与者行动的情况下，每个参与者都选择使自己收益最大化的行动，且没有人愿意单方面改变策略。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;在寡头市场中，如果企业只追求自身利润、忽视相互依赖，就会落入 Noncooperative Equilibrium。这个结果未必是共同利润最大的结果，但它是每个企业在给定对方选择时不愿单独改变的结果。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;8. Multiple Nash Equilibrium 与课堂练习&lt;/h2&gt;
&lt;p&gt;并非所有博弈都只有一个 Nash Equilibrium，也并非所有参与者都有 Dominant Strategy。课件中的广告博弈显示，Firm A 和 Firm B 是否做广告，要看对方是否做广告；某些情况下，最佳反应会形成多个稳定结果。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Firm A \ Firm B&lt;/th&gt;
&lt;th&gt;Advertise&lt;/th&gt;
&lt;th&gt;Don&apos;t Advertise&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Advertise&lt;/td&gt;
&lt;td&gt;A: $1800; B: $2200&lt;/td&gt;
&lt;td&gt;A: $2000; B: $2400&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Don&apos;t Advertise&lt;/td&gt;
&lt;td&gt;A: $1500; B: $2000&lt;/td&gt;
&lt;td&gt;A: $2200; B: $2600&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] Class Exercise：广告博弈
如果 Firm A advertises，Firm B 应该怎么做？如果 Firm A does not advertise，Firm B 又应该怎么做？Firm B 是否拥有 Dominant Strategy？这类问题的关键是逐列或逐行比较 Payoff，而不是凭直觉判断广告是否“有用”。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;p&gt;军备竞赛 (Arms Race) 也可以用 Prisoners&apos; Dilemma 分析。双方共同看，可能都不建造导弹更好；但如果一方担心对方建造而自己不建造，就会选择建造。结果可能是双方都建造导弹，资源被浪费，但任何一方单独停止都不划算。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] Class Exercise：Is the Arms Race a Prisoners&apos; Dilemma?
分析步骤：先找出 Nikita 和 Margaret 的总收益最大行动组合，再找出各自个体收益最大行动，最后判断 Nash (Noncooperative) Equilibrium。如果不合作，典型预测是双方都会 build the missile。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;9. Repeated Interaction, Tit for Tat 与 Tacit Collusion&lt;/h2&gt;
&lt;p&gt;一次性 Prisoners&apos; Dilemma 往往走向非合作均衡；但如果博弈重复进行，参与者会考虑未来。企业可能牺牲短期利润来影响对方未来行为，这称为战略行为 (Strategic Behavior)。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：针锋相对 (Tit for Tat)
Tit for Tat 是重复博弈中的策略：第一期先合作，之后模仿对方上一期行动。对方合作时继续合作；对方作弊时下一期惩罚。它既奖励合作，也惩罚背叛。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：默契合谋 (Tacit Collusion)
Tacit Collusion 指企业没有正式协议或面对面协商，却通过限制产量、维持高价等方式提高彼此利润。它常由重复互动和相互惩罚机制支持。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在 ADM 与 Ajinomoto 的重复博弈中，如果双方都采用 Tit for Tat，每年各赚 180 million。若一方永远作弊，第一年可能赚 200 million，但之后会被对方惩罚，长期利润降到 160 million。只要企业足够重视未来收益，Tit for Tat 就能让 Tacit Collusion 更稳定。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;ADM \ Ajinomoto&lt;/th&gt;
&lt;th&gt;Tit for Tat&lt;/th&gt;
&lt;th&gt;Always Cheat&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Tit for Tat&lt;/td&gt;
&lt;td&gt;ADM: $180 million each year; Ajinomoto: $180 million each year&lt;/td&gt;
&lt;td&gt;ADM: $150 million first year, then $160 million; Ajinomoto: $200 million first year, then $160 million&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Always Cheat&lt;/td&gt;
&lt;td&gt;ADM: $200 million first year, then $160 million; Ajinomoto: $150 million first year, then $160 million&lt;/td&gt;
&lt;td&gt;ADM: $160 million each year; Ajinomoto: $160 million each year&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;10. Antitrust Policy 与现实中的寡头&lt;/h2&gt;
&lt;p&gt;现实中的 Oligopoly 受到法律约束。许多国家禁止企业就价格、产量或不竞争达成正式协议。在美国，这类法律通常称为反托拉斯法 (Antitrust Law)，政府防止寡头企业像垄断者一样行动的政策称为反托拉斯政策 (Antitrust Policy)。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：反托拉斯政策 (Antitrust Policy)
Antitrust Policy 是政府为阻止寡头企业通过合谋、限制竞争或垄断化行为损害市场竞争而采取的政策。它通常禁止正式 Cartel 和明确的价格或产量协议。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;p&gt;不过，即使正式合谋违法，Tacit Collusion 仍可能存在，因为企业不一定需要公开协议就能形成“不要互相打价格战”的默契。Tacit Collusion 的限制因素包括：企业数量多、产品复杂、价格方案复杂、买方议价能力强，以及企业之间利益冲突明显。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Factor Limiting Tacit Collusion&lt;/th&gt;
&lt;th&gt;中文解释&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Large numbers of firms&lt;/td&gt;
&lt;td&gt;企业越多，监控和惩罚作弊越难&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Complex products and pricing scheme&lt;/td&gt;
&lt;td&gt;产品和价格越复杂，越难判断谁在降价或作弊&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Bargaining power of buyers&lt;/td&gt;
&lt;td&gt;大买方可迫使企业给出折扣，破坏默契&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Conflicts of interest among firms&lt;/td&gt;
&lt;td&gt;企业成本、产能和市场目标不同，难以维持共同策略&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;11. Product Differentiation, Price Leadership 与 Price War&lt;/h2&gt;
&lt;p&gt;为了避免直接价格竞争，寡头企业常使用产品差异化 (Product Differentiation) 和非价格竞争 (Nonprice Competition)。例如牙膏产品实际差异可能有限，但企业会通过品牌、包装、口味、功能声称和广告说服消费者认为产品不同。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：价格领导 (Price Leadership)
Price Leadership 指一家企业先设定价格，其他企业随后跟随。它是一种可能支持 Tacit Collusion 的协调方式，因为企业不用公开协议，也能减少价格竞争。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：非价格竞争 (Nonprice Competition)
Nonprice Competition 指企业避免直接降价，而通过广告、品牌、产品差异化、服务、包装或渠道等方式争夺消费者。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当 Tacit Collusion 破裂，或默契协议无法维持时，市场可能爆发价格战 (Price War)。在 Bertrand Competition 下，如果产品没有差异或属于大宗商品 (Commodities)，Price War 可能把利润压到接近零。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点：Price War 的触发条件
Price War 更可能发生在产品同质、企业产能充足、Tacit Collusion 难以监控或某家企业有强烈扩张动机时。Product Differentiation 和 Price Leadership 都是寡头企业避免 Price War 的常见方式。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;
&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;12. Kinked Demand Curve 与价格黏性&lt;/h2&gt;
&lt;p&gt;课件总结中提到折弯需求曲线 (Kinked Demand Curve)。它说明寡头企业即使面对一定范围内的边际成本变化，也可能不调整价格和产量，因为涨价可能导致竞争者不跟随、销量大幅下降；降价又可能引发竞争者跟随，导致价格战并破坏 Tacit Collusion。这个模型强调了寡头市场中价格黏性 (Price Rigidity) 的来源。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心概念：折弯需求曲线 (Kinked Demand Curve)
Kinked Demand Curve 用来解释寡头价格为什么可能保持稳定：企业担心单独涨价会失去顾客，也担心降价会引发竞争者报复，因此在某些成本变化范围内选择维持原价。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;13. 本章总结&lt;/h2&gt;
&lt;p&gt;Oligopoly 是只有少数卖方的市场结构，常见且重要。它与 Monopoly 的形成原因相似，但表现为少数企业而非一家企业拥有 Market Power。寡头行为难以预测，因为企业既可以通过 Cartel 或 Tacit Collusion 提高共同利润，也可能因个体诱因而进入 Noncooperative Behavior。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Game Theory 提供了分析 Oligopoly 的工具。Payoff Matrix 展示了每个参与者的收益如何依赖双方行动；Dominant Strategy、Prisoners&apos; Dilemma 和 Nash Equilibrium 则解释了为什么个体理性可能导致集体较差结果。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;
&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;&lt;/p&gt;
&lt;p&gt;重复互动改变了博弈结构。若企业预期未来还会相互竞争，Tit for Tat 这类策略可以通过奖励合作和惩罚背叛支持 Tacit Collusion。但现实中 Antitrust Policy 会禁止正式合谋，同时企业数量、产品复杂性、买方议价能力和利益冲突也会削弱默契合谋。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;
&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;14. Key Terms&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Term&lt;/th&gt;
&lt;th&gt;中文对应&lt;/th&gt;
&lt;th&gt;记忆要点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Oligopoly&lt;/td&gt;
&lt;td&gt;寡头&lt;/td&gt;
&lt;td&gt;少数企业控制市场，企业间相互依赖&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Oligopolist&lt;/td&gt;
&lt;td&gt;寡头企业&lt;/td&gt;
&lt;td&gt;寡头市场中的生产者&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Imperfect Competition&lt;/td&gt;
&lt;td&gt;不完全竞争&lt;/td&gt;
&lt;td&gt;有竞争者但仍有 Market Power&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Duopoly&lt;/td&gt;
&lt;td&gt;双头垄断&lt;/td&gt;
&lt;td&gt;只有两家企业的 Oligopoly&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Duopolist&lt;/td&gt;
&lt;td&gt;双头垄断企业&lt;/td&gt;
&lt;td&gt;Duopoly 中的企业&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Collusion&lt;/td&gt;
&lt;td&gt;合谋&lt;/td&gt;
&lt;td&gt;合作维持高价或限制产量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cartel&lt;/td&gt;
&lt;td&gt;卡特尔&lt;/td&gt;
&lt;td&gt;正式限制价格或产量的合谋组织&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Noncooperative Behavior&lt;/td&gt;
&lt;td&gt;非合作行为&lt;/td&gt;
&lt;td&gt;忽视自身行为对他人利润的影响&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Interdependence&lt;/td&gt;
&lt;td&gt;相互依赖&lt;/td&gt;
&lt;td&gt;一方收益取决于多方行动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Game Theory&lt;/td&gt;
&lt;td&gt;博弈论&lt;/td&gt;
&lt;td&gt;分析战略互动的工具&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Payoff&lt;/td&gt;
&lt;td&gt;收益&lt;/td&gt;
&lt;td&gt;博弈参与者获得的利润或效用&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Payoff Matrix&lt;/td&gt;
&lt;td&gt;收益矩阵&lt;/td&gt;
&lt;td&gt;展示双方行动组合下收益&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Prisoners&apos; Dilemma&lt;/td&gt;
&lt;td&gt;囚徒困境&lt;/td&gt;
&lt;td&gt;个体理性导致集体较差结果&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Dominant Strategy&lt;/td&gt;
&lt;td&gt;占优策略&lt;/td&gt;
&lt;td&gt;无论对方怎么做都最优的策略&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nash Equilibrium&lt;/td&gt;
&lt;td&gt;纳什均衡&lt;/td&gt;
&lt;td&gt;给定他人行动时无人愿意单方面改变&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Noncooperative Equilibrium&lt;/td&gt;
&lt;td&gt;非合作均衡&lt;/td&gt;
&lt;td&gt;不考虑外部影响时形成的 Nash Equilibrium&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Strategic Behavior&lt;/td&gt;
&lt;td&gt;战略行为&lt;/td&gt;
&lt;td&gt;为影响未来反应而采取的行动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tit for Tat&lt;/td&gt;
&lt;td&gt;针锋相对&lt;/td&gt;
&lt;td&gt;先合作，再模仿对方上一期行动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tacit Collusion&lt;/td&gt;
&lt;td&gt;默契合谋&lt;/td&gt;
&lt;td&gt;无正式协议但共同维持高利润&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Antitrust Policy&lt;/td&gt;
&lt;td&gt;反托拉斯政策&lt;/td&gt;
&lt;td&gt;防止寡头像垄断者一样行动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Price War&lt;/td&gt;
&lt;td&gt;价格战&lt;/td&gt;
&lt;td&gt;合谋破裂后相互降价竞争&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Product Differentiation&lt;/td&gt;
&lt;td&gt;产品差异化&lt;/td&gt;
&lt;td&gt;让消费者认为产品不同&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Price Leadership&lt;/td&gt;
&lt;td&gt;价格领导&lt;/td&gt;
&lt;td&gt;一家先定价，其他企业跟随&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nonprice Competition&lt;/td&gt;
&lt;td&gt;非价格竞争&lt;/td&gt;
&lt;td&gt;用广告、品牌和服务竞争而非直接降价&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
</content:encoded></item><item><title>ECO2011 C12：Externalities</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c12-externalities/chapter_12_externalities/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c12-externalities/chapter_12_externalities/</guid><pubDate>Mon, 06 Jul 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Externalities&lt;/h1&gt;
&lt;p&gt;本章讨论外部性 (Externalities)，也称溢出效应 (Spillovers)。当一个人的生产或消费行为影响到第三方，而这种影响没有通过市场价格体现出来时，就产生了 Externalities。外部性会使自由市场均衡偏离社会最优，从而形成市场失灵 (Market Failure)，并为政府干预提供理由。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch16a/slide_2.png&quot; alt=&quot;slide 2&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;1. Externalities 与 Market Failure&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：外部性 (Externalities)
Externalities are the impacts on third parties of an action。若某行为给他人带来成本，就是外部成本 (External Cost) 或负外部性 (Negative Externality)；若某行为给第三方带来收益，就是外部收益 (External Benefit) 或正外部性 (Positive Externality)。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当存在 Externalities 时，个人决策只考虑私人收益与私人成本，却没有完整考虑社会收益与社会成本。因此，自由市场给出的产量通常不是社会最优 (Socially Optimal)，市场结果也不再有效率。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Type&lt;/th&gt;
&lt;th&gt;中文含义&lt;/th&gt;
&lt;th&gt;Examples&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Negative Externality&lt;/td&gt;
&lt;td&gt;行为给第三方带来成本&lt;/td&gt;
&lt;td&gt;air and water pollution, texting while driving, overfishing&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Positive Externality&lt;/td&gt;
&lt;td&gt;行为给第三方带来收益&lt;/td&gt;
&lt;td&gt;education, beehives near fruit orchards, vaccination&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;2. Negative Externalities：外部成本与过度生产&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：社会成本 (Social Cost)
Social Cost of a good or activity = private cost of production + external cost。当存在污染等 External Cost 时，边际社会成本 (Marginal Social Cost, MSC) 高于企业的边际生产成本。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;若某种商品生产带来 Negative Externality，例如畜牧生产产生环境成本，市场供给曲线只反映企业的私人 Marginal Cost，却没有反映对社会造成的额外损害。因此，在没有政府干预时，市场产量 &lt;code&gt;Q_MKT&lt;/code&gt; 会高于社会最优产量 &lt;code&gt;Q_OPT&lt;/code&gt;。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：庇古税 (Pigouvian Tax)
Pigouvian Tax 是为了让市场主体把外部成本纳入决策而征收的税。最优 Pigouvian Tax 应等于边际外部成本 (Marginal External Cost)，从而使私人决策面对真正的 Marginal Social Cost。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;课件中的畜牧生产图说明：MSC 曲线相当于供给曲线 &lt;code&gt;S&lt;/code&gt; 向上移动了 Marginal External Cost。市场价格 &lt;code&gt;P_MKT&lt;/code&gt; 低估了生产的真实社会成本，因此产量过高。若征收等于 Marginal External Cost 的 Optimal Pigouvian Tax，供给曲线变为 &lt;code&gt;S_TAX&lt;/code&gt;，消费者支付价格上升，生产者税后价格下降，产量从 &lt;code&gt;Q_MKT&lt;/code&gt; 降至 &lt;code&gt;Q_OPT&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch16a/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;3. Positive Externalities：外部收益与生产不足&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：边际社会收益 (Marginal Social Benefit, MSB)
Marginal Social Benefit = marginal private benefit to consumers + marginal external benefit。当某行为带来 External Benefit 时，MSB 高于私人需求曲线反映的 Marginal Benefit。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;正外部性的典型例子包括技术溢出 (Technology Spillover) 与疫苗接种 (Vaccination)。企业创新产生的新知识可能被其他企业学习和使用；个人接种疫苗不仅保护自己，也降低疾病在人群中传播的概率。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：庇古补贴 (Pigouvian Subsidy)
Pigouvian Subsidy 是鼓励产生 External Benefit 的活动的补贴。最优 Pigouvian Subsidy 应等于边际外部收益 (Marginal External Benefit)，从而把产量提高到社会最优水平。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;课件中的疫苗图说明：由于接种疫苗有外部收益，MSB 曲线相当于需求曲线 &lt;code&gt;D&lt;/code&gt; 向上移动了 Marginal External Benefit。没有政府干预时，市场消费量 &lt;code&gt;Q_MKT&lt;/code&gt; 低于社会最优量 &lt;code&gt;Q_OPT&lt;/code&gt;。最优 Pigouvian Subsidy 降低消费者支付价格、提高生产者收到价格，使消费量上升到 &lt;code&gt;Q_OPT&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch16a/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;4. Network Externalities 与 Positive Feedback&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：网络外部性 (Network Externalities)
A good is subject to a Network Externality when the value of the good to an individual is greater when a large number of other people also use the good。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Network Externalities 意味着其他人的消费会提高你自己的 Marginal Benefit。操作系统、聊天软件、社交网络、电话、电报和铁路系统都具有这种特征。以 Microsoft Windows 为例，用户越多，软件开发者越愿意为 Windows 开发程序；程序越多，又越吸引新用户。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：正反馈 (Positive Feedback)
Positive Feedback 指 success breeds greater success and failure breeds failure。网络越大越有吸引力，市场可能因此向少数平台集中，甚至形成 Monopoly。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch16a/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] Active Learning Practice
看到邻居种花让你获得额外愉悦，这是 External Benefit。你带大件行李上 MTR，妨碍别人上下车，这是 External Cost。判断题的关键是问：影响是否落在第三方身上？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;5. Pollution 的经济学：最优污染量不是零&lt;/h2&gt;
&lt;p&gt;污染 (Pollution) 是许多有价值经济活动的副产品，例如交通、化肥和电力。企业可以使用昂贵的污染减排技术降低污染，但未受监管的企业没有私人激励这样做，因为它们通常不为自己造成的污染付费。这正是 Negative Externality。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：污染的最优社会数量 (Socially Optimal Quantity of Pollution)
Socially Optimal Quantity of Pollution 是在充分考虑污染的所有社会成本和社会收益后，社会会选择的污染数量。它满足 MSC of pollution = MSB of pollution。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;污染带来成本，也带来收益。污染的 Marginal Social Cost 是额外一单位污染对整个社会造成的额外伤害，例如健康成本和心理成本；污染的 Marginal Social Benefit 则包括允许生产者排放一单位污染所节省的成本，或污染者愿意为排放权支付的金额。&lt;/p&gt;
&lt;p&gt;因此，经济学并不简单主张“污染必须为零”。当污染非常低时，继续减少污染可能需要极高成本；当污染很高时，额外污染造成的损害很大。社会最优点在 &lt;code&gt;MSC = MSB&lt;/code&gt;，课件图中对应 &lt;code&gt;Q_OPT&lt;/code&gt; 与每吨 200 美元。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch16a/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;p&gt;衡量污染的成本与收益并不容易。MSC 需要加总社会成员因额外污染受到的损害，常包括健康损害、心理损害，也可能依赖公共意见调查，因此容易被低估。MSB 可以通过污染者愿意为排放权支付的金额衡量，例如通过 Emissions Trading Schemes 观察。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在无政府干预时，市场会产生过多污染。课件图中，市场污染量 &lt;code&gt;Q_MKT&lt;/code&gt; 是污染的 Marginal Social Benefit 降为 0 的地方；但此时 MSC 高达 400 美元，远大于 MSB。最优 Pigouvian Tax 为在 &lt;code&gt;Q_OPT&lt;/code&gt; 处的 MSC，即 200 美元，从而把污染量推回社会最优水平。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;6. Environmental Policy：标准、排放税与可交易许可证&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：环境标准 (Environmental Standards)
Environmental Standards 是要求生产者或消费者采取特定行动的规则。它们可以保护环境，但通常效率较低，因为缺乏灵活性。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：排放税 (Emissions Tax)
Emissions Tax 是根据企业排放污染数量征收的税。Pollution Tax 是 Pigouvian Tax 的一种形式，能让企业自行比较减排成本与纳税成本。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：可交易排放许可证 (Tradable Emissions Permits)
Tradable Emissions Permits 是允许企业排放有限数量污染物的许可证，可以买卖。政府限制总污染量，同时创造污染权市场。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;p&gt;课件比较了 Environmental Standard 与 Emissions Tax。若政府要求 Plant A 和 Plant B 都减排一半，会忽视两家企业减排成本不同这一事实。Plant A 减排成本较低，Plant B 减排成本较高，统一标准会让高成本企业减排过多、低成本企业减排不足。&lt;/p&gt;
&lt;p&gt;相反，Emissions Tax 允许企业灵活反应。面对每吨 200 美元税，Plant A 会减排更多，Plant B 会减排较少，直到两家企业继续排放一吨污染的边际收益都等于税率。这样可以用最低成本实现同样污染削减。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Tradable Emissions Permits 也能达到类似效果。容易低成本减排的企业会减少更多污染，并出售多余许可证；减排困难、成本高的企业会购买许可证。如果政府拍卖许可证，而不是免费发放，其效果与污染税非常接近。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Policy&lt;/th&gt;
&lt;th&gt;中文含义&lt;/th&gt;
&lt;th&gt;Efficiency Logic&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Environmental Standards&lt;/td&gt;
&lt;td&gt;统一规定行为或排放上限&lt;/td&gt;
&lt;td&gt;简单直接，但不够灵活，通常成本较高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Emissions Tax&lt;/td&gt;
&lt;td&gt;按排放数量征税&lt;/td&gt;
&lt;td&gt;企业按自身减排成本调整，通常成本更低&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tradable Emissions Permits&lt;/td&gt;
&lt;td&gt;可买卖排放许可证&lt;/td&gt;
&lt;td&gt;固定总排放量，让许可证流向减排成本较高者&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;7. Private Solutions 与 Coase Theorem&lt;/h2&gt;
&lt;p&gt;Ronald Coase 指出，在理想情况下，私人部门也可能解决 Externalities。只要交易成本 (Transaction Costs) 足够低，受影响各方可以通过谈判达成互利协议，把外部性内部化 (Internalize the Externality)。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：科斯定理 (Coase Theorem)
Coase Theorem 认为，即使存在 Externalities，只要 Transaction Costs 足够低，私人各方也能通过谈判达成有效率结果。初始产权分配影响财富分配，但不一定影响效率结果。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;p&gt;课件用 Dick 的狗 Spot 与邻居 Jane 的安静权来解释 Coase Theorem。Spot 吠叫打扰 Jane，是 Negative Externality。有效率结果取决于 Dick 养 Spot 的收益与 Jane 安静的价值：如果 Dick 对 Spot 的价值高于 Jane 的损失，Spot 应该留下；反之 Spot 应该离开。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;p&gt;若 Dick 有养 Spot 的权利，且 Dick 的收益为 500 美元、Jane 的损失为 800 美元，那么 Jane 可以支付 Dick 600 美元让他放弃 Spot，双方都更好；若 Dick 的收益为 1200 美元、Jane 的损失为 800 美元，Jane 无法支付足够金额，Spot 会留下。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;p&gt;若 Jane 有安静权，效率结果仍相同。若 Dick 的收益为 500 美元、Jane 的损失为 800 美元，Spot 离开；若 Dick 的收益为 1200 美元、Jane 的损失为 800 美元，Dick 可以支付 Jane 600 美元让她不诉讼，Spot 留下。初始权利改变谁付钱给谁，但不改变有效率结果。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Coase-type solutions 的特征是私人之间存在 Side Payments。例如，为了让邻居在孩子午睡时停止放大声音乐，一家人可以给邻居做午餐作为交换；果园主人可以付钱给养蜂人，把蜂箱放在附近提供授粉服务。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;p&gt;但现实中大多数 Externalities 没有被内部化，因为 Transaction Costs 很高。成本可能来自沟通，尤其是受影响人数很多时；也可能来自制定具有法律约束力协议的费用；还可能来自讨价还价本身，因为双方都试图争取更有利条件。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点：Coase Theorem 的适用条件
Coase Theorem 不等于“政府永远不需要干预”。它要求 Transaction Costs 足够低、产权清晰、相关方人数较少且谈判可行。污染、气候变化、城市噪音等问题往往涉及大量人群，私人谈判成本很高。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;8. 本章总结&lt;/h2&gt;
&lt;p&gt;污染这类 Negative Externalities 使市场产生过多有外部成本的活动；教育、技术溢出和疫苗这类 Positive Externalities 使市场产生过少有外部收益的活动。政府可以通过 Pigouvian Tax、Pigouvian Subsidy、Emissions Tax 和 Tradable Emissions Permits 将私人激励调整到社会最优。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Coase Theorem 说明，在低 Transaction Costs 下，私人谈判可能 Internalize the Externality，使政府干预不再必要。但在现实世界中，交易成本经常很高，因此环境政策和外部性政策仍然重要。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Positive Externalities 中，MSB 高于私人 Marginal Benefit，市场产量过低；最优 Pigouvian Subsidy 等于 Marginal External Benefit，并把产量提高到 &lt;code&gt;Q_OPT&lt;/code&gt;。这种支持能产生正外部性的产业的政策也可被理解为工业政策 (Industrial Policy)。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Negative Externalities 中，MSC 高于私人 Marginal Cost，市场产量过高；最优 Pigouvian Tax 等于 Marginal External Cost，并把产量降低到 &lt;code&gt;Q_OPT&lt;/code&gt;。若无法直接控制外部损害本身，政府也可以控制原始商品或活动的生产量。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Network Externalities 常见于通信、交通和高科技产品。由于 Positive Feedback，早期市场份额可能自我强化，生产者有动机在市场初期积极扩大网络规模，而这类市场也更容易走向垄断。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;9. Key Terms&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Term&lt;/th&gt;
&lt;th&gt;中文对应&lt;/th&gt;
&lt;th&gt;记忆要点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Marginal Social Cost of Pollution&lt;/td&gt;
&lt;td&gt;污染的边际社会成本&lt;/td&gt;
&lt;td&gt;额外一单位污染给社会造成的额外损害&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Marginal Social Benefit of Pollution&lt;/td&gt;
&lt;td&gt;污染的边际社会收益&lt;/td&gt;
&lt;td&gt;额外一单位污染带来的生产成本节省等收益&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Socially Optimal Quantity of Pollution&lt;/td&gt;
&lt;td&gt;污染的社会最优数量&lt;/td&gt;
&lt;td&gt;MSC = MSB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;External Cost&lt;/td&gt;
&lt;td&gt;外部成本&lt;/td&gt;
&lt;td&gt;行为给第三方带来的成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;External Benefit&lt;/td&gt;
&lt;td&gt;外部收益&lt;/td&gt;
&lt;td&gt;行为给第三方带来的收益&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Externalities&lt;/td&gt;
&lt;td&gt;外部性&lt;/td&gt;
&lt;td&gt;第三方影响未体现在市场价格中&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Negative Externalities&lt;/td&gt;
&lt;td&gt;负外部性&lt;/td&gt;
&lt;td&gt;市场通常生产或消费过多&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Positive Externalities&lt;/td&gt;
&lt;td&gt;正外部性&lt;/td&gt;
&lt;td&gt;市场通常生产或消费过少&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Coase Theorem&lt;/td&gt;
&lt;td&gt;科斯定理&lt;/td&gt;
&lt;td&gt;低 Transaction Costs 下私人谈判可达效率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Transaction Costs&lt;/td&gt;
&lt;td&gt;交易成本&lt;/td&gt;
&lt;td&gt;沟通、法律协议和讨价还价成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Internalize the Externality&lt;/td&gt;
&lt;td&gt;外部性内部化&lt;/td&gt;
&lt;td&gt;让决策者考虑其外部成本或收益&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Environmental Standards&lt;/td&gt;
&lt;td&gt;环境标准&lt;/td&gt;
&lt;td&gt;规定行为或排放，通常不够灵活&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Emissions Tax&lt;/td&gt;
&lt;td&gt;排放税&lt;/td&gt;
&lt;td&gt;按污染排放量征税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Pigouvian Tax&lt;/td&gt;
&lt;td&gt;庇古税&lt;/td&gt;
&lt;td&gt;等于 Marginal External Cost&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tradable Emissions Permits&lt;/td&gt;
&lt;td&gt;可交易排放许可证&lt;/td&gt;
&lt;td&gt;通过许可证市场实现低成本减排&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Pigouvian Subsidy&lt;/td&gt;
&lt;td&gt;庇古补贴&lt;/td&gt;
&lt;td&gt;等于 Marginal External Benefit&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Technology Spillover&lt;/td&gt;
&lt;td&gt;技术溢出&lt;/td&gt;
&lt;td&gt;新知识扩散给其他企业带来收益&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Positive Feedback&lt;/td&gt;
&lt;td&gt;正反馈&lt;/td&gt;
&lt;td&gt;成功带来更大成功，失败带来更大失败&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch16a/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h1&gt;Public Goods and Common Resources&lt;/h1&gt;
&lt;p&gt;本章讨论如何根据两个核心属性对商品分类：可排他性 (Excludability) 与消费竞争性 (Rivalry in Consumption)。这套分类能帮助我们判断自由市场何时可以有效供给商品，何时会出现 Free-Rider Problem、Overuse 或 Underconsumption，并解释为什么政府干预有时能提高社会福利。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch17a/slide_2.png&quot; alt=&quot;slide 2&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;1. 为什么不是所有商品都适合由市场供给&lt;/h2&gt;
&lt;p&gt;安装家里的新浴室与建设城市污水系统，种植小麦与在开放海洋捕鱼，看似都是“生产商品或服务”，但背后的经济属性完全不同。浴室设施和小麦具备市场有效运行所需的特征；公共污水系统和海洋鱼类则没有。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;2. Excludability 与 Rivalry in Consumption&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：可排他性 (Excludability)
A good is Excludable if the supplier can prevent people who do not pay from consuming it。若供应者无法阻止未付款者消费，该商品就是不可排他的 (Nonexcludable)。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：消费竞争性 (Rivalry in Consumption)
A good is Rival in Consumption if the same unit of the good cannot be consumed by more than one person at the same time。若同一单位商品可以同时被多人消费，则是非竞争性的 (Nonrival in Consumption)。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;私人品 (Private Goods) 同时具有 Excludability 和 Rivalry in Consumption；公共品 (Public Goods) 则同时具有 Nonexcludability 和 Nonrivalry in Consumption。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;3. 四类商品：Private Goods, Public Goods, Common Resources, Artificially Scarce Goods&lt;/h2&gt;
&lt;p&gt;商品可按两个维度分成四类。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Rival in Consumption&lt;/th&gt;
&lt;th&gt;Nonrival in Consumption&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Excludable&lt;/td&gt;
&lt;td&gt;Private Goods: wheat, bathroom fixtures&lt;/td&gt;
&lt;td&gt;Artificially Scarce Goods: pay-per-view movies, computer software&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nonexcludable&lt;/td&gt;
&lt;td&gt;Common Resources: clean water, biodiversity&lt;/td&gt;
&lt;td&gt;Public Goods: public sanitation, national defense&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：私人品 (Private Goods)
Private Goods are both Excludable and Rival in Consumption。它们通常可以由竞争性市场有效生产和消费。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：公共品 (Public Goods)
Public Goods are Nonexcludable and Nonrival in Consumption，例如 public sanitation、national defense、disease prevention 和 scientific research。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：公共资源 (Common Resources)
Common Resources are Nonexcludable but Rival in Consumption，例如 clean water、open-ocean fish 和 biodiversity。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：人为稀缺品 (Artificially Scarce Goods)
Artificially Scarce Goods are Excludable but Nonrival in Consumption，例如 pay-per-view movies 和 computer software。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch17a/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;4. 为什么市场只能有效供给 Private Goods&lt;/h2&gt;
&lt;p&gt;当商品 Nonexcludable 时，会出现搭便车问题 (Free-Rider Problem)：个人没有激励为自己的消费付费，而是希望别人付费后自己免费享受。当商品 Nonrival in Consumption 时，额外一个人消费的边际成本为零，因此有效率价格应为零；若为了补偿生产者成本而收取正价格，就会导致消费不足。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：搭便车问题 (Free-Rider Problem)
Free-Rider Problem 指消费者因无法被排除在消费之外而不愿付费，期待“搭别人付费的便车”。它是 Public Goods 私人供给不足的核心原因。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;5. Public Goods：非排他且非竞争&lt;/h2&gt;
&lt;p&gt;Public Goods 是 Private Goods 的反面：无法排除未付费者，同时一个人的消费不减少其他人的消费。疾病预防 (Disease Prevention)、国防 (National Defense) 和科学研究 (Scientific Research) 都是典型公共品。医生在疫情早期控制传播，保护的不只是付费患者，而是更大范围内的人群；国防保护所有公民；知识进步也会广泛惠及社会。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;p&gt;由于私人部门供给 Public Goods 通常存在严重缺陷，公共品多数需要政府提供，并通过税收融资。公共品的有效供给量由边际社会收益 (Marginal Social Benefit, MSB) 与边际成本 (Marginal Cost, MC) 决定。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：公共品的 Marginal Social Benefit
对 Public Goods 来说，额外一单位公共品可同时被所有人消费，因此 MSB 等于所有消费者个人 Marginal Benefit 的垂直加总 (Vertical Sum)。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;p&gt;课件用每月街道清扫次数说明 Public Good 的有效供给。Ted 和 Alice 各自有一条个人 Marginal Benefit 曲线；社会对某一额外清扫次数的总收益，是 Ted 与 Alice 对该次清扫的收益之和。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;p&gt;若 MC 恒定为 6 美元，社会应选择每月 5 次清扫。因为从 4 次增加到 5 次时，MSB 为 8 美元，高于 MC；但从 5 次增加到 6 次时，MSB 只有 2 美元，低于 MC。因此有效供给量是 MSB 与 MC 相等或最后一个 MSB 不低于 MC 的数量。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;&lt;/p&gt;
&lt;p&gt;单个消费者没有激励独自支付 Public Good 的有效数量，因为任何一个人的个人 Marginal Benefit 都低于 MSB。这正是政府存在的重要理由之一：政府可以通过税收把分散收益集中起来，为社会提供有效数量的 Public Goods。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;6. Cost-Benefit Analysis：政府如何决定供给多少&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：成本收益分析 (Cost-Benefit Analysis)
Cost-Benefit Analysis 是政府估计提供公共品的社会成本与社会收益，并据此决定供给数量的方法。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;虽然政府应依赖 Cost-Benefit Analysis 决定 Public Goods 的供给量，但实际操作很难。原因之一是个人在调查中可能夸大公共品对自己的价值，尤其是在他们不需要按真实估值立即付费时。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;7. Common Resources 与 Overuse&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：公共资源 (Common Resource)
Common Resource 是 Nonexcludable and Rival in Consumption。别人很难阻止我消费它，但我消费得越多，留给其他人的数量越少。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;清洁空气、河流中的清洁水、生物多样性和开放海洋中的鱼类都具有 Common Resource 的特征。问题在于，资源虽然有消费竞争性，却不可排他，所以个人使用者不会充分考虑自己对其他人造成的资源减少。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：过度使用 (Overuse)
Overuse occurs when a user depletes the amount of the common resource available to others but does not take this cost into account when deciding how much to use the common resource。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Common Resources 的 Overuse 类似 Negative Externality。使用者的个人 Marginal Cost 低于 Marginal Social Cost，因为个人成本没有包括对其他使用者造成的资源耗竭成本。因此，未监管市场中的资源使用量 &lt;code&gt;Q_MKT&lt;/code&gt; 会超过有效率数量 &lt;code&gt;Q_OPT&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch17a/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;8. 如何有效管理 Common Resources&lt;/h2&gt;
&lt;p&gt;有效管理 Common Resource 的核心，是让个体使用者考虑其行为对其他使用者造成的成本。政策工具包括：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Policy Tool&lt;/th&gt;
&lt;th&gt;中文解释&lt;/th&gt;
&lt;th&gt;Economic Logic&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Tax on use&lt;/td&gt;
&lt;td&gt;对资源使用征税&lt;/td&gt;
&lt;td&gt;类似 Pigouvian Tax，让使用者面对 MSC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Regulation&lt;/td&gt;
&lt;td&gt;对使用量或行为进行管制&lt;/td&gt;
&lt;td&gt;直接限制过度使用&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Property Rights&lt;/td&gt;
&lt;td&gt;赋予产权，使资源 Excludable&lt;/td&gt;
&lt;td&gt;让所有者有激励维护资源价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tradable Licenses&lt;/td&gt;
&lt;td&gt;建立可交易使用许可证&lt;/td&gt;
&lt;td&gt;限制总使用量，并让使用权流向价值最高者&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;9. Artificially Scarce Goods：非竞争却被排他&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：人为稀缺品 (Artificially Scarce Good)
Artificially Scarce Good is Excludable but Nonrival in Consumption。由于 Nonrival，额外一个人消费的 Marginal Cost 为零；但由于 Excludable，卖方可以收取正价格，从而导致消费不足。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;付费点播电影和软件都属于 Artificially Scarce Goods。一旦电影或软件已经被生产出来，允许多一个人观看或使用的边际成本接近零；但生产者为了回收固定成本，会设置正价格，这使一部分愿意消费且边际成本为零的消费者被排除在外。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;
&lt;img src=&quot;Assets/lecture_ch17a/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;p&gt;课件的 pay-per-view movie 图说明：市场价格为 4 美元时，需求量为 &lt;code&gt;Q_MKT&lt;/code&gt;；但由于额外一人观看的 MC = 0，有效率价格应为 0，对应更高的消费量 &lt;code&gt;Q_OPT&lt;/code&gt;。正价格导致 &lt;code&gt;Q_MKT &amp;lt; Q_OPT&lt;/code&gt;，阴影部分是 Deadweight Loss。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点：Artificially Scarce Goods 与 Natural Monopoly
Artificially Scarce Goods 的问题类似自然垄断 (Natural Monopoly)：生产有固定成本，但额外消费的边际成本很低或为零。正价格能补偿生产者，却会造成低效率的消费不足。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;10. 本章总结&lt;/h2&gt;
&lt;p&gt;商品分类取决于是否 Excludable 与是否 Rival in Consumption。Private Goods 同时可排他且消费竞争，竞争市场通常能有效供给。Nonexcludable 会导致 Free-Rider Problem，从而使生产不足；Nonrival in Consumption 意味着有效价格为零，任何正价格都可能导致消费不足。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Public Goods 的有效数量满足 MSB = MC。由于 MSB 是所有个人 Marginal Benefit 的加总，任何单个消费者的收益都低于社会总收益，因此个人不会自愿提供有效数量。政府通过税收提供 Public Goods，是政府存在的重要经济理由之一。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Common Resources 是 Rival but Nonexcludable，因此容易 Overuse。它的问题类似 Negative Externality：个人使用的 Marginal Social Cost 高于个人 Marginal Cost。可行政策包括 Pigouvian Taxes、Tradable Licenses 和 Property Rights。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Artificially Scarce Goods 是 Excludable but Nonrival in Consumption。由于额外消费没有 Marginal Cost，有效率价格应为零；但正价格又常用于补偿生产固定成本，于是市场消费量低于社会最优。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;11. Key Terms&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Term&lt;/th&gt;
&lt;th&gt;中文对应&lt;/th&gt;
&lt;th&gt;记忆要点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Excludable&lt;/td&gt;
&lt;td&gt;可排他&lt;/td&gt;
&lt;td&gt;可阻止未付费者消费&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Rival in Consumption&lt;/td&gt;
&lt;td&gt;消费竞争性&lt;/td&gt;
&lt;td&gt;同一单位无法同时被多人消费&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Private Good&lt;/td&gt;
&lt;td&gt;私人品&lt;/td&gt;
&lt;td&gt;Excludable and Rival&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nonexcludable&lt;/td&gt;
&lt;td&gt;不可排他&lt;/td&gt;
&lt;td&gt;无法阻止未付费者消费&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nonrival in Consumption&lt;/td&gt;
&lt;td&gt;消费非竞争性&lt;/td&gt;
&lt;td&gt;多人可同时消费同一单位&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Free-Rider Problem&lt;/td&gt;
&lt;td&gt;搭便车问题&lt;/td&gt;
&lt;td&gt;Nonexcludable 导致无人愿意付费&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Public Good&lt;/td&gt;
&lt;td&gt;公共品&lt;/td&gt;
&lt;td&gt;Nonexcludable and Nonrival&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cost-Benefit Analysis&lt;/td&gt;
&lt;td&gt;成本收益分析&lt;/td&gt;
&lt;td&gt;政府估算公共品社会收益与成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Common Resource&lt;/td&gt;
&lt;td&gt;公共资源&lt;/td&gt;
&lt;td&gt;Nonexcludable but Rival&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Overuse&lt;/td&gt;
&lt;td&gt;过度使用&lt;/td&gt;
&lt;td&gt;个人不考虑资源消耗给他人造成的成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Artificially Scarce Good&lt;/td&gt;
&lt;td&gt;人为稀缺品&lt;/td&gt;
&lt;td&gt;Excludable but Nonrival，正价格导致消费不足&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Marginal Social Benefit (MSB)&lt;/td&gt;
&lt;td&gt;边际社会收益&lt;/td&gt;
&lt;td&gt;公共品中等于个人 MB 的垂直加总&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Marginal Social Cost (MSC)&lt;/td&gt;
&lt;td&gt;边际社会成本&lt;/td&gt;
&lt;td&gt;Common Resource 中高于个人 MC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tradable Licenses&lt;/td&gt;
&lt;td&gt;可交易许可证&lt;/td&gt;
&lt;td&gt;用市场机制分配资源使用权&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Property Rights&lt;/td&gt;
&lt;td&gt;产权&lt;/td&gt;
&lt;td&gt;使资源 Excludable 并改善维护激励&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/lecture_ch17a/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
</content:encoded></item><item><title>ECO2011 C10：Monopolistic Competition</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c10-monopolistic-competition-and-product-differentiation/chapter_10_monopolistic-competition-and-product-differentiation/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c10-monopolistic-competition-and-product-differentiation/chapter_10_monopolistic-competition-and-product-differentiation/</guid><pubDate>Mon, 06 Jul 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Monopolistic Competition and Product Differentiation&lt;/h1&gt;
&lt;p&gt;本章讨论一种介于完全竞争与垄断之间的市场结构：垄断竞争 (Monopolistic Competition)。它既有“竞争”的一面，即行业中存在许多企业、长期可以自由进入和退出；也有“垄断”的一面，即每家企业销售的产品并不完全相同，因此面对向下倾斜的需求曲线，并拥有一定的定价能力。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;
&lt;img src=&quot;Assets/slide_2.png&quot; alt=&quot;slide 2&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;1. 四种市场结构与 Monopolistic Competition 的位置&lt;/h2&gt;
&lt;p&gt;市场结构可以按竞争强度从强到弱理解：完全竞争 (Perfect Competition) 位于竞争最强的一端，垄断 (Monopoly) 位于竞争最弱的一端；垄断竞争 (Monopolistic Competition) 和寡头 (Oligopoly) 则处在中间。垄断竞争通常是现实生活中最常见的市场结构，例如餐馆、咖啡店、理发店、服装品牌、加油站、快餐店等。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：垄断竞争 (Monopolistic Competition)
Monopolistic Competition 是一种市场结构：行业中有许多相互竞争的生产者；每个生产者销售差异化产品 (Differentiated Product)；企业面对向下倾斜的需求曲线，因此不是价格接受者 (Price Taker)；长期存在自由进入和退出 (Free Entry and Exit)；长期均衡中企业获得零经济利润 (Zero Economic Profit)。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;
&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Monopolistic Competition 的关键不是企业完全没有竞争，而是每家企业通过产品差异化 (Product Differentiation) 让自己的产品“不完全等同于别人家的产品”。因此，消费者不会只根据价格选择商品，企业也就不必像完全竞争企业那样被动接受市场价格。&lt;/p&gt;
&lt;h2&gt;2. 产品差异化 (Product Differentiation)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：产品差异化 (Product Differentiation)
Product Differentiation 指企业让自己的产品在消费者眼中不同于竞争者产品的过程。差异可以来自产品本身，也可以来自消费者的感知、位置便利性、品牌形象、质量层级或风格类型。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;在 Oligopoly 中，Product Differentiation 可以降低竞争强度并帮助企业提高利润；但在 Monopolistic Competition 中，它更为关键。因为行业中企业数量很多，公开合谋 (Collusion) 或默契合作 (Tacit Cooperation) 几乎不可行，企业获得市场力量 (Market Power) 的主要方式就是让消费者认为自己的产品有独特性。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;
&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Product Differentiation 主要有三种形式：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Form of Product Differentiation&lt;/th&gt;
&lt;th&gt;中文解释&lt;/th&gt;
&lt;th&gt;Example&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Differentiation by style or type&lt;/td&gt;
&lt;td&gt;按风格或类型区分&lt;/td&gt;
&lt;td&gt;sedans vs. SUVs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Differentiation by location&lt;/td&gt;
&lt;td&gt;按地理位置或便利性区分&lt;/td&gt;
&lt;td&gt;离家近的 dry cleaner vs. 远但便宜的 dry cleaner&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Differentiation by quality&lt;/td&gt;
&lt;td&gt;按质量层级区分&lt;/td&gt;
&lt;td&gt;ordinary chocolate vs. gourmet chocolate&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;&lt;/p&gt;
&lt;p&gt;产品差异化行业有两个同时存在的特征。第一，卖方之间仍然竞争同一批消费者，因此新企业进入会减少既有企业在任何给定价格下能卖出的数量。第二，消费者从多样性 (Diversity) 中获得价值：即使价格更高，更多选择也可能提高消费者福利。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;Ford 与 GM 的案例：规模经济与多样性的冲突&lt;/h3&gt;
&lt;p&gt;Henry Ford 的早期策略是只提供单一车型和颜色，从而最大化规模经济 (Economies of Scale)，大幅降低汽车生产成本。1913 年移动装配线 (Moving Assembly Line) 让汽车变得更便宜，Ford 一度占据市场优势。但 Alfred P. Sloan 领导的 General Motors (GM) 选择提供多种车型、质量和价格层级。到 1930s，市场给出的答案很清楚：消费者愿意为多样化风格付费。&lt;/p&gt;
&lt;p&gt;这个案例说明，最低成本并不总是消费者唯一关心的目标。Monopolistic Competition 的福利评价必须同时考虑成本效率与产品多样性。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 思考题
同一行业中的快餐店、加油站或巧克力品牌究竟是在产品本身上不同，还是主要在消费者心智中不同？经济学分析不要求二者只能选其一；只要差异影响需求弹性和消费者选择，它就会影响企业定价能力。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;3. Monopolistic Competition 的短期均衡 (Short-Run Equilibrium)&lt;/h2&gt;
&lt;p&gt;Monopolistic Competition 这个名字本身就揭示了它的双重性质。一方面，每个企业销售独特产品，所以像垄断者一样面对向下倾斜的需求曲线 (Downward-Sloping Demand Curve)，具有有限的定价能力；另一方面，它又不像纯粹垄断者，因为行业中还有许多替代品，企业销量取决于其他企业的价格和产品选择。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;p&gt;短期中，垄断竞争企业与垄断企业使用相同的利润最大化逻辑：选择边际收益等于边际成本的产量，即 MR = MC。由于需求曲线向下倾斜，边际收益 (Marginal Revenue, MR) 低于价格 (Price, P)，所以企业先在 MR = MC 处找到产量，再回到需求曲线上决定价格。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点：短期决策规则
Monopolistically Competitive Firm 的短期利润最大化条件是 MR = MC。价格不是在 MC 曲线上读出，而是在对应产量的 Demand Curve 上读出。若 P &amp;gt; ATC，企业获得 Profit；若 P &amp;lt; ATC，企业承受 Loss，但只要继续生产比停产损失更小，就会选择亏损经营。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;
&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;
&lt;img src=&quot;Assets/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Short-Run Outcome&lt;/th&gt;
&lt;th&gt;Condition&lt;/th&gt;
&lt;th&gt;Economic Meaning&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Profit&lt;/td&gt;
&lt;td&gt;P &amp;gt; ATC&lt;/td&gt;
&lt;td&gt;价格高于平均总成本，绿色利润矩形表示正经济利润&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Loss&lt;/td&gt;
&lt;td&gt;P &amp;lt; ATC&lt;/td&gt;
&lt;td&gt;价格低于平均总成本，企业亏损但仍可能通过生产最小化损失&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Profit Maximization&lt;/td&gt;
&lt;td&gt;MR = MC&lt;/td&gt;
&lt;td&gt;企业选择使利润最大的产量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Pricing&lt;/td&gt;
&lt;td&gt;Price on Demand Curve&lt;/td&gt;
&lt;td&gt;给定产量后，根据需求曲线确定消费者愿意支付的价格&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;4. 长期均衡：零利润均衡 (Zero-Profit Equilibrium)&lt;/h2&gt;
&lt;p&gt;长期中，自由进入和退出会消除短期利润或亏损。如果典型企业获得正经济利润，新企业会进入行业，既有企业的需求曲线和边际收益曲线向左移动，因为消费者被更多替代品分流；这会降低既有企业销量、价格和利润。相反，如果典型企业亏损，一些企业退出，剩余企业的需求曲线和边际收益曲线向右移动，亏损逐渐缩小。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;
&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;
&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：零利润均衡 (Zero-Profit Equilibrium)
Zero-Profit Equilibrium 是 Monopolistic Competition 的长期均衡状态：进入和退出停止，每家企业在利润最大化产量处刚好收支相抵，Price = Average Total Cost (ATC)，企业获得零经济利润。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;在长期零利润均衡中，每家企业的需求曲线与平均总成本曲线 (Average Total Cost, ATC) 在利润最大化产量处相切 (Tangency)。这意味着企业像垄断者一样仍有向下倾斜的需求曲线，但又无法长期保留垄断利润。因此可以把垄断竞争企业理解为“没有长期垄断利润的垄断者”。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;5. 与 Perfect Competition 的比较：Mark-up 与 Excess Capacity&lt;/h2&gt;
&lt;p&gt;与完全竞争相比，Monopolistic Competition 的长期均衡有两个重要特征。第一，价格高于边际成本，即 P &amp;gt; MC，因此存在 Mark-up。企业愿意在当前价格下多卖一单位，因为该价格高于生产该单位的边际成本；但如果要卖更多，企业必须降低所有单位的价格，所以它不会这样做。第二，企业产量低于使 ATC 最小化的产量，因此存在过剩产能 (Excess Capacity)。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心定义：过剩产能 (Excess Capacity)
Excess Capacity 指企业在长期均衡中生产的产量低于最小化 Average Total Cost 的产量。Monopolistic Competition 中企业没有在最低平均成本点生产，因此单位成本高于完全竞争中的类似企业。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;
&lt;img src=&quot;Assets/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Dimension&lt;/th&gt;
&lt;th&gt;Perfect Competition&lt;/th&gt;
&lt;th&gt;Monopolistic Competition&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Firm Demand&lt;/td&gt;
&lt;td&gt;Perfectly elastic, D = MR = P&lt;/td&gt;
&lt;td&gt;Downward-sloping Demand Curve&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long-Run Profit&lt;/td&gt;
&lt;td&gt;Zero Economic Profit&lt;/td&gt;
&lt;td&gt;Zero Economic Profit&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Price and MC&lt;/td&gt;
&lt;td&gt;P = MC&lt;/td&gt;
&lt;td&gt;P &amp;gt; MC, with Mark-up&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Output Level&lt;/td&gt;
&lt;td&gt;Minimum-cost output&lt;/td&gt;
&lt;td&gt;Below minimum-cost output&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Capacity&lt;/td&gt;
&lt;td&gt;No excess capacity&lt;/td&gt;
&lt;td&gt;Excess Capacity&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Product Variety&lt;/td&gt;
&lt;td&gt;Homogeneous product&lt;/td&gt;
&lt;td&gt;Differentiated products&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这也引出一个重要福利问题：Monopolistic Competition 是否低效率？从成本角度看，它价格更高、产量更少、P &amp;gt; MC，存在一些本可互利的交易没有发生。但从消费者选择角度看，更高价格的一部分代价可能被产品多样性带来的价值抵消。因此，Excess Capacity 不一定自动意味着社会福利更低，评价要看消费者对多样性的价值有多高。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂思考
你更愿意住在只有一家低价餐馆的地方，还是有几家餐馆但价格略高的地方？这个问题对应 Monopolistic Competition 的核心权衡：Lower Prices vs. Greater Product Diversity。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;6. Advertising：信息、操纵与市场力量&lt;/h2&gt;
&lt;p&gt;产品差异化讨论离不开广告 (Advertising) 和品牌名称 (Brand Name)。广告在不同产品中的重要性差异很大：高度差异化的消费品常把收入的 10-20% 用于广告；工业品广告较少；同质化商品几乎没有广告。完全竞争企业通常不做广告，因为它们可以按市场价格卖出全部产量；而销售差异化产品并且价格高于边际成本的企业，有强烈动机通过广告吸引买者、降低需求价格弹性 (Price Elasticity of Demand)，并维持更高 Mark-up。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;
&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Product Type&lt;/th&gt;
&lt;th&gt;Advertising Spending&lt;/th&gt;
&lt;th&gt;经济含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Highly differentiated consumer goods&lt;/td&gt;
&lt;td&gt;10-20% of revenue&lt;/td&gt;
&lt;td&gt;广告用于强化差异化和品牌忠诚&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Industrial products&lt;/td&gt;
&lt;td&gt;Little advertising&lt;/td&gt;
&lt;td&gt;买方更专业，信息渠道更直接&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Homogenous products&lt;/td&gt;
&lt;td&gt;No advertising&lt;/td&gt;
&lt;td&gt;产品无差异，广告难以带来市场力量&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心概念：Advertising 与 Price Elasticity of Demand
广告若能让消费者更偏好某一企业的产品，就会降低该企业需求的价格弹性 (Price Elasticity of Demand)，使需求曲线更不敏感，企业更容易收取高于边际成本的 Mark-up。若广告提供价格、质量和可得性信息，则可能让需求更有弹性并促进竞争。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;广告的争议在于它既可能有价值，也可能浪费资源。批评者认为，广告操纵消费者偏好，制造原本不存在的欲望，夸大产品差异，培养品牌忠诚，从而阻碍竞争，使消费者不再关心相似商品之间的价格差异。支持者则认为，广告向消费者传递价格、质量、可得性等信息，帮助消费者更好选择，也能让新企业更容易进入市场，增强竞争。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;
&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;
&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;眼镜广告案例：Informative Advertising&lt;/h3&gt;
&lt;p&gt;1963 年，美国一些州开始允许验光师做广告。研究发现，禁止广告的州，一副眼镜平均价格约为 33 美元；不限制广告的州，平均价格约为 26 美元。原因是广告让消费者更容易发现价格更好的替代选择，增强竞争，并使企业面对的需求更有弹性。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Policy Environment&lt;/th&gt;
&lt;th&gt;Average Price Paid for Eyeglasses&lt;/th&gt;
&lt;th&gt;Interpretation&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;States that prohibited advertising&lt;/td&gt;
&lt;td&gt;$33&lt;/td&gt;
&lt;td&gt;消费者信息不足，价格较高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;States that did not restrict advertising&lt;/td&gt;
&lt;td&gt;$26&lt;/td&gt;
&lt;td&gt;广告提供替代选择信息，竞争增强&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;7. Brand Name：质量信号还是人为差异？&lt;/h2&gt;
&lt;p&gt;品牌名称 (Brand Name) 往往伴随大量广告支出和更高价格。批评者认为，Brand Name 为实际上差别不大的产品制造人为差异，使消费者因名人代言或品牌形象支付更高价格。支持者则强调，Brand Name 可以传递质量信息：如果企业愿意花大量资金建立品牌，消费者会推断企业预计长期经营并重视声誉；同时，企业为了保护品牌资产，也有动力维持高质量。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心概念：昂贵信号 (Costly Signal)
Costly Signal 指某种高成本行为本身传递信息。品牌广告的具体内容可能并不重要，关键是企业愿意为品牌投入大量资源，这可能向消费者暗示产品质量、企业承诺和长期经营预期。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;
&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;
&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;View on Brand Names&lt;/th&gt;
&lt;th&gt;Main Argument&lt;/th&gt;
&lt;th&gt;Welfare Implication&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Critics&lt;/td&gt;
&lt;td&gt;品牌为实际差异很小的产品创造感知差异&lt;/td&gt;
&lt;td&gt;可能浪费资源、提高价格、削弱竞争&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Defenders&lt;/td&gt;
&lt;td&gt;品牌提供质量信息并约束企业维持质量&lt;/td&gt;
&lt;td&gt;可能降低消费者搜寻成本、改善选择&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2&gt;8. 社会福利：Between Perfect Competition and Monopoly&lt;/h2&gt;
&lt;p&gt;Monopolistic Competition 位于 Perfect Competition 和 Monopoly 之间，因此福利评价也处在二者之间。短期中，P &amp;gt; MC 带来类似垄断定价的 Deadweight Loss，一些本可提升福利的交易没有发生；企业还可能把资源用于纯粹制造差异化的广告。长期中，自由进入虽然消除经济利润，却可能导致过多企业进入，重复承担固定成本 (Duplication of Fixed Costs)，并让每家企业都在低于最低 ATC 的产量上生产。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;
&lt;img src=&quot;Assets/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Time Horizon&lt;/th&gt;
&lt;th&gt;Source of Inefficiency&lt;/th&gt;
&lt;th&gt;Explanation&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Short Run&lt;/td&gt;
&lt;td&gt;Markup of price over marginal cost&lt;/td&gt;
&lt;td&gt;P &amp;gt; MC 导致部分互利交易无法发生&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Short Run&lt;/td&gt;
&lt;td&gt;Deadweight loss of monopoly pricing&lt;/td&gt;
&lt;td&gt;类似垄断定价带来的无谓损失&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Short Run&lt;/td&gt;
&lt;td&gt;Wasteful advertising&lt;/td&gt;
&lt;td&gt;广告若只为制造市场力量，可能浪费资源&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long Run&lt;/td&gt;
&lt;td&gt;Too much entry&lt;/td&gt;
&lt;td&gt;进入过多导致固定成本重复&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long Run&lt;/td&gt;
&lt;td&gt;Excess capacity&lt;/td&gt;
&lt;td&gt;企业产量低于最小化 ATC 的产量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Offset&lt;/td&gt;
&lt;td&gt;Product-variety benefit&lt;/td&gt;
&lt;td&gt;消费者从产品多样性中获得补偿性收益&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点：福利评价不要只看 Excess Capacity
Monopolistic Competition 的价格和成本表现不如 Perfect Competition，但它提供更丰富的产品选择。考试中若问是否低效率，需要同时写出 P &amp;gt; MC、Excess Capacity、Deadweight Loss，以及 Product-variety benefit 对这些成本的抵消。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;9. 本章总结&lt;/h2&gt;
&lt;p&gt;Monopolistic Competition 是由许多企业、差异化产品和长期自由进入退出构成的市场结构。Product Differentiation 可以按风格或类型、位置、质量等方式实现，是企业获得 Market Power 的核心来源。短期中，企业像垄断者一样按照 MR = MC 选择产量，并可能获得 Profit 或承受 Loss；长期中，进入与退出推动企业达到 Zero-Profit Equilibrium，需求曲线与 ATC 曲线在利润最大化产量处相切。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_32.png&quot; alt=&quot;slide 32&quot; /&gt;&lt;/p&gt;
&lt;p&gt;长期均衡下，企业虽然获得零经济利润，但仍有 P &amp;gt; MC 的 Mark-up，并且存在 Excess Capacity。Advertising 和 Brand Name 既可能提供有价值信息、促进竞争，也可能操纵偏好、制造人为差异并浪费资源。现实中二者通常兼具经济价值与经济浪费两面。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_33.png&quot; alt=&quot;slide 33&quot; /&gt;
&lt;img src=&quot;Assets/slide_34.png&quot; alt=&quot;slide 34&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;10. Key Terms&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Term&lt;/th&gt;
&lt;th&gt;中文对应&lt;/th&gt;
&lt;th&gt;记忆要点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Monopolistic Competition&lt;/td&gt;
&lt;td&gt;垄断竞争&lt;/td&gt;
&lt;td&gt;多企业、差异化产品、长期自由进入退出&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Product Differentiation&lt;/td&gt;
&lt;td&gt;产品差异化&lt;/td&gt;
&lt;td&gt;企业获得 Market Power 的核心方式&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Differentiated Product&lt;/td&gt;
&lt;td&gt;差异化产品&lt;/td&gt;
&lt;td&gt;消费者认为与其他产品不完全相同&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Downward-Sloping Demand Curve&lt;/td&gt;
&lt;td&gt;向下倾斜的需求曲线&lt;/td&gt;
&lt;td&gt;企业有一定定价能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Marginal Revenue (MR)&lt;/td&gt;
&lt;td&gt;边际收益&lt;/td&gt;
&lt;td&gt;垄断竞争企业中 MR &amp;lt; P&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Marginal Cost (MC)&lt;/td&gt;
&lt;td&gt;边际成本&lt;/td&gt;
&lt;td&gt;利润最大化条件为 MR = MC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Average Total Cost (ATC)&lt;/td&gt;
&lt;td&gt;平均总成本&lt;/td&gt;
&lt;td&gt;长期零利润均衡中 P = ATC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Zero-Profit Equilibrium&lt;/td&gt;
&lt;td&gt;零利润均衡&lt;/td&gt;
&lt;td&gt;长期进入退出停止，经济利润为零&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Mark-up&lt;/td&gt;
&lt;td&gt;加价&lt;/td&gt;
&lt;td&gt;P &amp;gt; MC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Excess Capacity&lt;/td&gt;
&lt;td&gt;过剩产能&lt;/td&gt;
&lt;td&gt;产量低于最小化 ATC 的产量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Advertising&lt;/td&gt;
&lt;td&gt;广告&lt;/td&gt;
&lt;td&gt;可传递信息，也可强化市场力量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Brand Name&lt;/td&gt;
&lt;td&gt;品牌名称&lt;/td&gt;
&lt;td&gt;可能是质量信号，也可能制造人为差异&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Costly Signal&lt;/td&gt;
&lt;td&gt;昂贵信号&lt;/td&gt;
&lt;td&gt;高成本广告支出本身传递质量或承诺信息&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_35.png&quot; alt=&quot;slide 35&quot; /&gt;&lt;/p&gt;
</content:encoded></item><item><title>ECO2011 C8：Perfect Competition</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c8-perfect-competition/chapter_8_perfect-competition/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c8-perfect-competition/chapter_8_perfect-competition/</guid><pubDate>Tue, 30 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Perfect Competition and the Supply Curve&lt;/h1&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;
&lt;img src=&quot;Assets/slide_2.png&quot; alt=&quot;slide 2&quot; /&gt;&lt;/p&gt;
&lt;p&gt;本章讨论完全竞争市场如何形成供给曲线，以及在短期与长期中，企业如何根据价格、成本和进入退出机制调整产量。核心逻辑是：单个企业在完全竞争中不能影响市场价格，只能把价格当作给定条件；因此它的生产决策由边际收益、边际成本、平均成本和停业价格共同决定。&lt;/p&gt;
&lt;h2&gt;1. 完全竞争的基本含义&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
价格接受者生产者 (Price-taking producer) 是指其个体行动不会影响所售商品市场价格的生产者。价格接受者消费者 (Price-taking consumer) 是指其个体购买行动不会影响市场价格的消费者。完全竞争市场 (Perfectly competitive market) 是所有市场参与者都是 price-takers 的市场；完全竞争行业 (Perfectly competitive industry) 是生产者都是 price-takers 的行业。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;p&gt;完全竞争并不是说企业之间没有竞争，而是说每个单个企业都太小，无法通过自己的产量变化影响市场价格。因此，企业面对的是一个外生给定的市场价格，而不是自己可以选择的价格。&lt;/p&gt;
&lt;p&gt;完全竞争行业通常需要两个必要条件。第一，行业中必须有许多生产者，并且没有任何一个生产者拥有很大的市场份额 (Market share)。Market share 指某个生产者产量占整个行业总产量的比例。第二，消费者必须认为不同生产者的产品彼此等价，也就是产品是标准化产品 (Standardized product)，也常被称为商品 (Commodity)。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;p&gt;长期中还需要一个重要条件：自由进入与退出 (Free entry and exit)。当新生产者可以容易进入行业、现有生产者也可以容易离开行业时，行业内生产者数量会随着市场利润变化而调整。这一机制会防止长期利润过高，也会让长期均衡具有特殊性质：经济利润趋向于零。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning]
考点提示：Perfect competition 的关键不是“企业很多”这一个条件，而是 many producers、standardized product、free entry and exit 三个机制共同作用。其中前两个是完全竞争的必要条件，free entry and exit 是长期调整的核心条件。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;2. 生产、收益与最优产量&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
边际收益 (Marginal revenue, MR) 是额外生产并销售一单位产品所带来的总收益变化，公式为 &lt;code&gt;MR = ΔTR / ΔQ&lt;/code&gt;。最优产量规则 (Optimal output rule) 说明：利润最大化发生在最后一单位产出的边际成本 (Marginal cost, MC) 等于其 marginal revenue 的产量上，即 &lt;code&gt;MR = MC&lt;/code&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;&lt;/p&gt;
&lt;p&gt;对于价格接受者企业，价格接受者企业的最优产量规则 (Price-taking firm&apos;s optimal output rule) 更具体：因为企业每多卖一单位都只能按市场价格出售，所以 &lt;code&gt;MR = P&lt;/code&gt;。于是利润最大化条件变成 &lt;code&gt;P = MC&lt;/code&gt;。这也是为什么价格接受者企业的边际收益曲线 (Marginal revenue curve) 是一条位于市场价格水平的水平线。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question]
核心思考题：如果企业增加产量，它能否用额外销售收入覆盖额外成本？这个问题对应的就是比较 &lt;code&gt;MR&lt;/code&gt; 与 &lt;code&gt;MC&lt;/code&gt;。当 &lt;code&gt;MR &amp;gt; MC&lt;/code&gt; 时应增加产量；当 &lt;code&gt;MR &amp;lt; MC&lt;/code&gt; 时应减少产量；当 &lt;code&gt;MR = MC&lt;/code&gt; 时达到利润最大化产量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Jennifer and Jason&apos;s Farm 的例子说明了这一点。当市场价格为 &lt;code&gt;$18&lt;/code&gt; 时，企业的 &lt;code&gt;MR&lt;/code&gt; 水平线与 &lt;code&gt;MC&lt;/code&gt; 曲线在 5 bushels 处相交，因此利润最大化产量是 5 bushels。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;Short-Run Costs 数据表&lt;/h3&gt;
&lt;p&gt;第 8 页给出了农场在不同产量下的短期成本。这里的 &lt;code&gt;MC&lt;/code&gt; 是 total cost 随产量增加一单位的变化，&lt;code&gt;MR&lt;/code&gt; 固定为 &lt;code&gt;$18&lt;/code&gt;，&lt;code&gt;MR - MC&lt;/code&gt; 显示生产额外一单位带来的净收益。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Quantity of tomatoes Q (bushels)&lt;/th&gt;
&lt;th&gt;Variable cost VC&lt;/th&gt;
&lt;th&gt;Total cost TC&lt;/th&gt;
&lt;th&gt;Marginal cost MC&lt;/th&gt;
&lt;th&gt;Marginal revenue MR&lt;/th&gt;
&lt;th&gt;Net gain MR - MC&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;$0&lt;/td&gt;
&lt;td&gt;$14&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;$16&lt;/td&gt;
&lt;td&gt;$30&lt;/td&gt;
&lt;td&gt;$16&lt;/td&gt;
&lt;td&gt;$18&lt;/td&gt;
&lt;td&gt;$2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2&lt;/td&gt;
&lt;td&gt;$22&lt;/td&gt;
&lt;td&gt;$36&lt;/td&gt;
&lt;td&gt;$6&lt;/td&gt;
&lt;td&gt;$18&lt;/td&gt;
&lt;td&gt;$12&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3&lt;/td&gt;
&lt;td&gt;$30&lt;/td&gt;
&lt;td&gt;$44&lt;/td&gt;
&lt;td&gt;$8&lt;/td&gt;
&lt;td&gt;$18&lt;/td&gt;
&lt;td&gt;$10&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;td&gt;$42&lt;/td&gt;
&lt;td&gt;$56&lt;/td&gt;
&lt;td&gt;$12&lt;/td&gt;
&lt;td&gt;$18&lt;/td&gt;
&lt;td&gt;$6&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;td&gt;$58&lt;/td&gt;
&lt;td&gt;$72&lt;/td&gt;
&lt;td&gt;$16&lt;/td&gt;
&lt;td&gt;$18&lt;/td&gt;
&lt;td&gt;$2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;6&lt;/td&gt;
&lt;td&gt;$78&lt;/td&gt;
&lt;td&gt;$92&lt;/td&gt;
&lt;td&gt;$20&lt;/td&gt;
&lt;td&gt;$18&lt;/td&gt;
&lt;td&gt;-$2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;$102&lt;/td&gt;
&lt;td&gt;$116&lt;/td&gt;
&lt;td&gt;$24&lt;/td&gt;
&lt;td&gt;$18&lt;/td&gt;
&lt;td&gt;-$6&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;从表格看，产量从 4 增加到 5 时，&lt;code&gt;MR - MC = $2&lt;/code&gt;，仍然增加利润；但从 5 增加到 6 时，&lt;code&gt;MR - MC = -$2&lt;/code&gt;，说明第 6 单位会降低利润。因此最优产量停在 5 bushels。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;3. 平均成本、盈亏平衡与利润&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
盈亏平衡价格 (Break-even price) 是价格接受者企业经济利润为零时的市场价格。它等于企业的 minimum average total cost。若 &lt;code&gt;P &amp;gt; ATC&lt;/code&gt;，企业盈利；若 &lt;code&gt;P = ATC&lt;/code&gt;，企业 break even；若 &lt;code&gt;P &amp;lt; ATC&lt;/code&gt;，企业亏损。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在短期中，平均总成本 (Average total cost, ATC) 曲线与 &lt;code&gt;MC&lt;/code&gt; 曲线的关系很重要：&lt;code&gt;MC&lt;/code&gt; 曲线穿过 &lt;code&gt;ATC&lt;/code&gt; 曲线的最低点。该点对应 minimum average total cost，也就是企业的 break-even price。在例子中，市场价格为 &lt;code&gt;$14&lt;/code&gt;、产量为 4 bushels 时，企业处在 minimum-cost output，且 break-even price 为 &lt;code&gt;$14&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当市场价格为 &lt;code&gt;$18&lt;/code&gt; 时，价格高于 minimum average total cost &lt;code&gt;$14&lt;/code&gt;，企业盈利。利润最大化产量为 5 bushels；该产量下 &lt;code&gt;ATC = $14.40&lt;/code&gt;，单位利润为 &lt;code&gt;$18.00 - $14.40 = $3.60&lt;/code&gt;，总利润为 &lt;code&gt;5 x $3.60 = $18.00&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当市场价格为 &lt;code&gt;$10&lt;/code&gt; 时，价格低于 minimum average total cost &lt;code&gt;$14&lt;/code&gt;，企业亏损。如果企业仍然生产，其最优产量为 3 bushels；该产量下 &lt;code&gt;ATC = $14.67&lt;/code&gt;，单位亏损为 &lt;code&gt;$14.67 - $10.00 = $4.67&lt;/code&gt;，总亏损约为 &lt;code&gt;$14.00&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning]
不要把“亏损”自动理解为“立即停产”。短期生产决策取决于价格能否覆盖 variable cost；长期退出决策才取决于价格能否覆盖 total cost。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;4. 短期停业决策与单个企业供给曲线&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
沉没成本 (Sunk cost) 是已经发生且无法收回的成本。短期固定成本 (Fixed cost) 通常是 sunk cost，因此不应影响企业是否继续营业的短期决策。短期相关的是 variable cost。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;p&gt;课堂例子是海滨度假区餐厅：工作日顾客很少，餐厅是否应该开门？答案不是看租金等 fixed costs，因为这些成本在短期已经无法避免；关键是看当天营业收入是否能覆盖 variable costs。如果 weekday revenue 大于 variable costs，继续营业可以减少亏损；如果 weekday revenue 小于 variable costs，则停业更好。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question]
Class exercise：一家餐厅在淡季工作日几乎没有客人，是否应该开门？判断标准是 &lt;code&gt;TR&lt;/code&gt; 与 &lt;code&gt;VC&lt;/code&gt;，不是 &lt;code&gt;TR&lt;/code&gt; 与 &lt;code&gt;TC&lt;/code&gt;。若 &lt;code&gt;TR &amp;gt; VC&lt;/code&gt;，开门；若 &lt;code&gt;TR &amp;lt; VC&lt;/code&gt;，短期停业。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
停业价格 (Shut-down price) 等于 minimum average variable cost。短期个体供给曲线 (Short-run individual supply curve) 表示在 fixed cost 给定时，单个生产者的最优产量如何随市场价格变化。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当市场价格等于或高于 shut-down price 时，企业沿着 &lt;code&gt;MC&lt;/code&gt; 曲线选择满足 &lt;code&gt;P = MC&lt;/code&gt; 的产量；因此 &lt;code&gt;MC&lt;/code&gt; 曲线位于 &lt;code&gt;AVC&lt;/code&gt; 最低点以上的部分就是短期个体供给曲线。当市场价格低于 minimum average variable cost 时，企业短期停止生产，产量为 0。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning]
短期竞争企业的供给曲线不是整条 &lt;code&gt;MC&lt;/code&gt; 曲线，而是 &lt;code&gt;MC&lt;/code&gt; 曲线中位于 &lt;code&gt;AVC&lt;/code&gt; 以上的部分。若 &lt;code&gt;P &amp;lt; AVC&lt;/code&gt;，企业 shut down。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;5. 行业供给曲线与短期市场均衡&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
行业供给曲线 (Industry supply curve) 描述某商品价格与整个行业总产量之间的关系。短期行业供给曲线 (Short-run industry supply curve) 描述在生产者数量固定时，行业供给量如何随市场价格变化。短期市场均衡 (Short-run market equilibrium) 是在生产者数量给定时，供给量等于需求量的状态。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;p&gt;短期行业供给曲线可以通过横向加总所有企业的 short-run individual supply curves 得到。在幻灯片例子中，行业有 100 个生产者；低于 &lt;code&gt;$10&lt;/code&gt; 的 shut-down price 时，没有生产者愿意在短期生产。高于 &lt;code&gt;$10&lt;/code&gt; 后，每个企业随价格上升增加产量，行业供给曲线也向上倾斜。它与需求曲线相交于短期均衡点，市场价格为 &lt;code&gt;$18&lt;/code&gt;，市场数量为 500 bushels。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;6. 长期均衡、进入退出与长期供给曲线&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
长期市场均衡 (Long-run market equilibrium) 是在有足够时间发生 free entry and exit 后，供给量等于需求量，且企业没有进入或退出激励的状态。长期行业供给曲线 (Long-run industry supply curve, LRS) 表示在生产者有时间进入或退出后，行业供给量如何响应价格。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;p&gt;长期调整的核心是利润信号。当现有企业获得 economic profit 时，新企业被吸引进入，短期行业供给曲线向右移动，价格下降，现有企业利润减少。进入会持续到市场价格等于 break-even price，企业经济利润为零为止。此时既没有进入激励，也没有退出激励，市场达到 long-run market equilibrium。&lt;/p&gt;
&lt;p&gt;需求增加时，短期和长期反应不同。短期内，需求曲线右移会提高价格和利润，现有企业沿 &lt;code&gt;MC&lt;/code&gt; 增加产量；长期内，利润吸引新企业进入，行业供给增加，价格被推回 break-even price。在例子中，价格最终回到 &lt;code&gt;$14&lt;/code&gt;，现有企业回到零经济利润，而行业总产量增加主要来自 new entrants。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;code&gt;LRS&lt;/code&gt; 往往比短期行业供给曲线更平坦，也就是更有弹性 (more elastic)。原因是长期中企业可以进入或退出：高价格吸引进入，增加行业产量并压低价格；低价格诱导退出，减少行业产量并抬高价格。即便 &lt;code&gt;LRS&lt;/code&gt; 向上倾斜，它也总是比短期行业供给曲线更平坦。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning]
长期供给比短期供给更 elastic 的根本原因是 entry and exit，而不是单个企业的 &lt;code&gt;MC&lt;/code&gt; 曲线突然变平。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;7. 完全竞争长期均衡的效率结论&lt;/h2&gt;
&lt;p&gt;完全竞争行业的长期均衡有三个重要结论。&lt;/p&gt;
&lt;p&gt;第一，所有企业都在 &lt;code&gt;P = MC&lt;/code&gt; 的条件下生产，因此 market price 等于每家企业的 marginal cost。第二，在 free entry and exit 下，长期均衡中企业获得 zero economic profits；有利润会吸引进入，有亏损会导致退出。第三，长期均衡是有效率的：企业在最低单位生产成本处生产，行业总产出的生产成本被最小化。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
完全竞争长期均衡的效率来自两个条件同时成立：&lt;code&gt;P = MC&lt;/code&gt; 保证消费者愿意支付至少 marginal cost 的商品被生产；&lt;code&gt;P = minimum ATC&lt;/code&gt; 保证行业以最低平均成本组织生产。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2&gt;8. Summary 与 Key Terms&lt;/h2&gt;
&lt;p&gt;完全竞争市场中，所有生产者与消费者都是 price-takers，没有单个参与者能影响市场价格。行业要接近完全竞争，需要 many producers、低 market share、standardized product/commodity，以及长期中的 free entry and exit。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;p&gt;企业选择产量时遵循 optimal output rule：生产到 &lt;code&gt;MR = MC&lt;/code&gt;。对于 price-taking firm，因为 &lt;code&gt;MR = P&lt;/code&gt;，所以规则变成 &lt;code&gt;P = MC&lt;/code&gt;，其 marginal revenue curve 是一条位于市场价格的水平线。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;&lt;/p&gt;
&lt;p&gt;短期中，fixed cost 与 sunk cost 不应影响是否生产的决策。只要 &lt;code&gt;P &amp;gt;= minimum AVC&lt;/code&gt;，企业就生产 &lt;code&gt;P = MC&lt;/code&gt; 的产量；若 &lt;code&gt;P &amp;lt; minimum AVC&lt;/code&gt;，企业短期停业。这形成了 short-run individual supply curve。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;&lt;/p&gt;
&lt;p&gt;长期中 fixed cost 不再是不可调整的背景条件。若市场价格长期低于 minimum average total cost，企业会退出；若高于 minimum average total cost，现有企业盈利，新企业进入。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;&lt;/p&gt;
&lt;p&gt;企业盈利条件可以写成两种等价形式：&lt;code&gt;TR &amp;gt; TC&lt;/code&gt; 或 &lt;code&gt;P &amp;gt; ATC&lt;/code&gt;。单位利润为 &lt;code&gt;P - ATC&lt;/code&gt;；单位亏损为 &lt;code&gt;ATC - P&lt;/code&gt;。短期市场均衡由 short-run industry supply curve 与 demand curve 的交点决定。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;p&gt;长期行业供给曲线是在充分发生 entry and exit 后得到的供给曲线。在 long-run market equilibrium 中，没有企业有进入或退出激励。&lt;code&gt;LRS&lt;/code&gt; 常常是水平的；如果某些投入供给有限，也可能向上倾斜，但它总比短期行业供给曲线更 elastic。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在竞争行业长期均衡中，profit maximization 使每家企业生产到相同的 marginal cost，且该 marginal cost 等于 market price。free entry and exit 使每家企业获得 zero economic profit，并在 minimum average total cost 对应产量生产。因此行业生产成本被最小化，消费者愿意支付至少 marginal cost 的需求被满足，结果是 efficient。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;Key Terms 中英对照&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;中文术语&lt;/th&gt;
&lt;th&gt;English term&lt;/th&gt;
&lt;th&gt;核心含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;价格接受者生产者&lt;/td&gt;
&lt;td&gt;Price-taking producer&lt;/td&gt;
&lt;td&gt;个体产量不影响市场价格的生产者&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;价格接受者消费者&lt;/td&gt;
&lt;td&gt;Price-taking consumer&lt;/td&gt;
&lt;td&gt;个体购买不影响市场价格的消费者&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;完全竞争市场&lt;/td&gt;
&lt;td&gt;Perfectly competitive market&lt;/td&gt;
&lt;td&gt;所有参与者都是 price-takers 的市场&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;完全竞争行业&lt;/td&gt;
&lt;td&gt;Perfectly competitive industry&lt;/td&gt;
&lt;td&gt;生产者都是 price-takers 的行业&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;市场份额&lt;/td&gt;
&lt;td&gt;Market share&lt;/td&gt;
&lt;td&gt;单个生产者产量占行业总产量的比例&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;标准化产品&lt;/td&gt;
&lt;td&gt;Standardized product&lt;/td&gt;
&lt;td&gt;消费者认为不同生产者产品等价&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;商品&lt;/td&gt;
&lt;td&gt;Commodity&lt;/td&gt;
&lt;td&gt;标准化、可替代的产品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;自由进入与退出&lt;/td&gt;
&lt;td&gt;Free entry and exit&lt;/td&gt;
&lt;td&gt;企业可容易进入或离开行业&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;边际收益&lt;/td&gt;
&lt;td&gt;Marginal revenue&lt;/td&gt;
&lt;td&gt;额外销售一单位带来的总收益变化&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;最优产量规则&lt;/td&gt;
&lt;td&gt;Optimal output rule&lt;/td&gt;
&lt;td&gt;利润最大化产量满足 &lt;code&gt;MR = MC&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;价格接受者企业最优产量规则&lt;/td&gt;
&lt;td&gt;Price-taking firm&apos;s optimal output rule&lt;/td&gt;
&lt;td&gt;价格接受者生产到 &lt;code&gt;P = MC&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;边际收益曲线&lt;/td&gt;
&lt;td&gt;Marginal revenue curve&lt;/td&gt;
&lt;td&gt;price-taking firm 面对的水平价格线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;盈亏平衡价格&lt;/td&gt;
&lt;td&gt;Break-even price&lt;/td&gt;
&lt;td&gt;经济利润为零的价格，等于 minimum ATC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;停业价格&lt;/td&gt;
&lt;td&gt;Shut-down price&lt;/td&gt;
&lt;td&gt;等于 minimum AVC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;短期个体供给曲线&lt;/td&gt;
&lt;td&gt;Short-run individual supply curve&lt;/td&gt;
&lt;td&gt;&lt;code&gt;MC&lt;/code&gt; 曲线在 &lt;code&gt;AVC&lt;/code&gt; 以上的部分&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;行业供给曲线&lt;/td&gt;
&lt;td&gt;Industry supply curve&lt;/td&gt;
&lt;td&gt;商品价格与行业总产量的关系&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;短期行业供给曲线&lt;/td&gt;
&lt;td&gt;Short-run industry supply curve&lt;/td&gt;
&lt;td&gt;企业数量固定时的行业供给曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;短期市场均衡&lt;/td&gt;
&lt;td&gt;Short-run market equilibrium&lt;/td&gt;
&lt;td&gt;企业数量给定时供给等于需求&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;长期市场均衡&lt;/td&gt;
&lt;td&gt;Long-run market equilibrium&lt;/td&gt;
&lt;td&gt;entry/exit 完成后无进入退出激励&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;长期行业供给曲线&lt;/td&gt;
&lt;td&gt;Long-run industry supply curve&lt;/td&gt;
&lt;td&gt;长期进入退出完成后的行业供给曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_32.png&quot; alt=&quot;slide 32&quot; /&gt;&lt;/p&gt;
</content:encoded></item><item><title>ECO2011 C9：Monopoly and Price Discrimination</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c9-monopoly-markets-and-price-discrimination/chapter_9_monopoly-markets-and-price-discrimination/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c9-monopoly-markets-and-price-discrimination/chapter_9_monopoly-markets-and-price-discrimination/</guid><pubDate>Tue, 30 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Monopoly Markets and Price Discrimination&lt;/h1&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_2.png&quot; alt=&quot;slide 2&quot; /&gt;&lt;/p&gt;
&lt;p&gt;本章从完全竞争转向垄断市场，核心问题是：当一个企业拥有市场力量时，它如何选择产量与价格？这种选择为什么会造成社会福利损失？政府可以如何处理 monopoly？最后，本章还讨论价格歧视 (Price discrimination)，说明拥有市场力量的企业为什么常常不愿只收一个统一价格。&lt;/p&gt;
&lt;h2&gt;1. Market Structure 的基本分类&lt;/h2&gt;
&lt;p&gt;经济学用市场结构 (Market structure) 来预测企业行为。四种主要模型是：完全竞争 (Perfect competition)、垄断 (Monopoly)、寡头垄断 (Oligopoly)、垄断竞争 (Monopolistic competition)。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;p&gt;这些市场结构可以按两个维度分类：第一，市场中有多少生产者；第二，产品是相同的还是差异化的。差异化产品 (Differentiated goods) 是指消费者认为不同产品不完全相同，但仍有一定替代性，例如 Coke 和 Pepsi。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;How many producers?&lt;/th&gt;
&lt;th&gt;Products differentiated?&lt;/th&gt;
&lt;th&gt;Products not differentiated?&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;One&lt;/td&gt;
&lt;td&gt;Not applicable&lt;/td&gt;
&lt;td&gt;Monopoly&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Few&lt;/td&gt;
&lt;td&gt;Oligopoly&lt;/td&gt;
&lt;td&gt;Oligopoly&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Many&lt;/td&gt;
&lt;td&gt;Monopolistic competition&lt;/td&gt;
&lt;td&gt;Perfect competition&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
垄断者 (Monopolist) 是某种没有 close substitutes 的商品的唯一生产者。由 monopolist 控制的行业称为垄断 (Monopoly)。市场力量 (Market power) 是企业通过减少产量，把价格提高到竞争水平以上的能力。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;垄断与完全竞争的根本差异在于需求曲线。完全竞争企业面对的是水平 demand curve，因为它是 price-taker；monopolist 面对的是整个市场 demand curve，因此需求曲线向下倾斜。垄断者可以通过减少产量沿需求曲线上移，从而提高价格。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;2. 为什么 Monopoly 能长期存在&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
进入壁垒 (Barrier to entry) 是阻止其他企业进入行业的因素。没有 barrier to entry，monopoly profit 会吸引竞争者进入，长期利润无法持续。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;monopolist 因 market power 可以收取更高价格并生产更少产量，从而在短期和长期获得利润。但长期利润只有在存在 barrier to entry 时才能维持。本章列出五类常见进入壁垒。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Barrier to entry&lt;/th&gt;
&lt;th&gt;机制&lt;/th&gt;
&lt;th&gt;例子&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Control of a scarce resource or input&lt;/td&gt;
&lt;td&gt;控制关键自然资源或投入品，使竞争者无法获得必要生产条件&lt;/td&gt;
&lt;td&gt;OPEC 控制石油生产；De Beers 控制钻石矿&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Increasing returns to scale&lt;/td&gt;
&lt;td&gt;大规模生产具有巨大成本优势，一个大企业比多个小企业成本更低&lt;/td&gt;
&lt;td&gt;邮政服务、传统有线电话系统&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Technological superiority&lt;/td&gt;
&lt;td&gt;企业拥有技术优势，潜在竞争者难以复制&lt;/td&gt;
&lt;td&gt;某些企业更善于获取、整合和应用技术&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Network externality&lt;/td&gt;
&lt;td&gt;用户越多，产品对每个用户的价值越高&lt;/td&gt;
&lt;td&gt;电话网络、Facebook&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Government-made barrier&lt;/td&gt;
&lt;td&gt;政府通过法律授予排他性权利&lt;/td&gt;
&lt;td&gt;Patent、Copyright&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
自然垄断 (Natural monopoly) 出现在 increasing returns to scale 或 economies of scale 让单一企业生产整个行业产量的单位成本显著低于任何潜在进入者时。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Natural monopoly 的关键是高 fixed costs 和下降的 average total cost。若一个行业需要巨大的基础设施投资，第二家企业进入时也必须重复承担这些固定成本。结果是：一个大企业生产全部产量，比两个或更多小企业分开生产更便宜。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;p&gt;技术优势 (Technological superiority) 也可能形成 monopoly，但这种优势有时会很快消失，因为技术扩散、模仿和替代创新会削弱原有领先者。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
网络外部性 (Network externality) 指某种商品或服务对单个消费者的价值，会随着其他使用者数量增加而上升。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;电话在只有少数人拥有时价值有限，但当电话网络扩大后，每个用户都能联系更多人，产品价值上升。社交平台也是类似逻辑：Facebook 相比 Myspace、Google+、QQ 等竞争者的优势，很大程度上来自更多用户聚集带来的 network externality。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
专利 (Patent) 给予发明者对某项发明为期 20 年的临时 monopoly；版权 (Copyright) 给予文学或艺术作品创作者复制并获利的排他性权利。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;政府创造的 barriers 并不一定都是坏事。Patent 和 Copyright 的目的通常是鼓励创新和创作，但它们也会在授权期内限制竞争。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;3. Monopolist 如何最大化利润&lt;/h2&gt;
&lt;p&gt;完全竞争企业的利润最大化规则是 &lt;code&gt;P = MC&lt;/code&gt;。但 monopolist 是唯一供给者，面对向下倾斜的 market demand curve。为了卖出更多，它必须降低价格；而降价不只影响新增的最后一单位，也影响之前所有单位。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
垄断者的边际收益 (Marginal revenue, MR) 由两个效果组成：数量效应 (Quantity effect) 是多卖一单位带来的收入增加；价格效应 (Price effect) 是为了多卖这一单位，必须降低所有已售单位价格而造成的收入减少。由于 price effect，拥有 market power 的企业总是有 &lt;code&gt;MR &amp;lt; P&lt;/code&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当 monopolist 增加产量时，它一方面从新增单位获得 revenue，另一方面必须对所有单位降价。低产量时 quantity effect 往往较强，total revenue 上升；高产量时 price effect 变大，total revenue 可能下降。这就是为什么 total revenue curve 呈山形，也解释了为什么 monopolist 的 marginal revenue curve 位于 demand curve 下方。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;p&gt;钻石例子中，卖 9 颗钻石时价格为 &lt;code&gt;$550&lt;/code&gt;，总收益为 &lt;code&gt;$4,950&lt;/code&gt;。为了卖第 10 颗，价格必须降到 &lt;code&gt;$500&lt;/code&gt;。新增第 10 颗带来 &lt;code&gt;$500&lt;/code&gt; 的 quantity effect，但前 9 颗每颗降价 &lt;code&gt;$50&lt;/code&gt;，造成 &lt;code&gt;-$450&lt;/code&gt; 的 price effect。因此第 10 颗的 &lt;code&gt;MR = $50&lt;/code&gt;，远低于价格 &lt;code&gt;$500&lt;/code&gt;。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning]
垄断者也使用 &lt;code&gt;MR = MC&lt;/code&gt;，但它不是在 &lt;code&gt;P = MC&lt;/code&gt; 处生产。因为 monopolist 面对 downward-sloping demand curve，&lt;code&gt;MR&lt;/code&gt; 总在 &lt;code&gt;P&lt;/code&gt; 下方，所以利润最大化时通常有 &lt;code&gt;P &amp;gt; MR = MC&lt;/code&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在 De Beers 的例子中，假设 marginal cost 固定为 &lt;code&gt;$200&lt;/code&gt;。monopolist 在 &lt;code&gt;MR = MC&lt;/code&gt; 的点 A 生产 8 颗钻石，然后沿着需求曲线向上找到消费者愿意支付的价格，即点 B 的 &lt;code&gt;$600&lt;/code&gt;。利润为 &lt;code&gt;($600 - $200) x 8 = $3,200&lt;/code&gt;。如果是完全竞争行业，则会在 &lt;code&gt;P = MC&lt;/code&gt; 处生产 16 颗，价格为 &lt;code&gt;$200&lt;/code&gt;，经济利润为零。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;p&gt;更一般地，当 &lt;code&gt;MC&lt;/code&gt; 向上倾斜、&lt;code&gt;ATC&lt;/code&gt; 呈 U 形时，monopolist 仍先找 &lt;code&gt;MR = MC&lt;/code&gt; 的产量 &lt;code&gt;QM&lt;/code&gt;，再从 demand curve 找对应价格 &lt;code&gt;PM&lt;/code&gt;。利润面积为：&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;Profit = TR - TC
       = (PM x QM) - (ATCM x QM)
       = (PM - ATCM) x QM
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;4. Monopoly 与 Perfect Competition 的比较&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;比较项目&lt;/th&gt;
&lt;th&gt;Perfect competition&lt;/th&gt;
&lt;th&gt;Monopoly&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;企业面对的 demand curve&lt;/td&gt;
&lt;td&gt;水平&lt;/td&gt;
&lt;td&gt;向下倾斜，等于市场 demand curve&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;利润最大化条件&lt;/td&gt;
&lt;td&gt;&lt;code&gt;P = MC&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;MR = MC&lt;/code&gt; 且 &lt;code&gt;P &amp;gt; MR&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;产量&lt;/td&gt;
&lt;td&gt;&lt;code&gt;QC&lt;/code&gt; 较高&lt;/td&gt;
&lt;td&gt;&lt;code&gt;QM &amp;lt; QC&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;价格&lt;/td&gt;
&lt;td&gt;&lt;code&gt;PC&lt;/code&gt; 较低&lt;/td&gt;
&lt;td&gt;&lt;code&gt;PM &amp;gt; PC&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;长期利润&lt;/td&gt;
&lt;td&gt;free entry 下为 zero economic profit&lt;/td&gt;
&lt;td&gt;若有 barrier to entry，可长期盈利&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning]
Monopoly 的福利问题不只是“消费者付了更高价格”。更重要的是，&lt;code&gt;P &amp;gt; MC&lt;/code&gt; 使一些本来 mutually beneficial transactions 没有发生，从而产生 deadweight loss。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;完全竞争中，产量为 &lt;code&gt;QC&lt;/code&gt;，价格等于 &lt;code&gt;MC&lt;/code&gt;，总剩余较大。Monopoly 中，monopolist 把产量减少到 &lt;code&gt;QM&lt;/code&gt;，价格提高到 &lt;code&gt;PM&lt;/code&gt;。一部分 consumer surplus 被转化为 monopoly profit，但还有一部分直接消失，成为无谓损失 (Deadweight loss)。这部分代表本来消费者愿意支付高于 marginal cost、但由于价格过高而没有发生的交易。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;5. Monopoly and Public Policy&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
反托拉斯政策 (Antitrust policies) 是政府用来预防、限制或拆分 monopoly 的政策工具。其目标是降低 market power 造成的 deadweight loss。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;当 monopoly 是人为创造或可以通过竞争替代时，政府通常应阻止其形成，或拆分已经存在的 monopoly。但 natural monopoly 比较特殊：如果把一个自然垄断企业拆成多个小企业，可能会提高 average total cost，因为 economies of scale 被破坏。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Natural monopoly 即使不适合拆分，也仍会因为 &lt;code&gt;P &amp;gt; MC&lt;/code&gt; 造成 inefficiency。政府常见处理方式有两种：公共所有制 (Public ownership) 和价格管制 (Price regulation)。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;政策工具&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;th&gt;主要优点&lt;/th&gt;
&lt;th&gt;主要问题&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Public ownership&lt;/td&gt;
&lt;td&gt;商品由政府或政府拥有的企业供给&lt;/td&gt;
&lt;td&gt;可直接控制价格与供给&lt;/td&gt;
&lt;td&gt;公有企业可能经营效率较低&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Price regulation&lt;/td&gt;
&lt;td&gt;对 monopolist 设置 price ceiling 或规定价格规则&lt;/td&gt;
&lt;td&gt;可提高产量、扩大 consumer surplus&lt;/td&gt;
&lt;td&gt;若价格过低，企业可能无法 break even&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在 regulated natural monopoly 中，最佳可持续监管价格通常是让价格等于 average total cost 的 &lt;code&gt;PR*&lt;/code&gt;。这样产量从 &lt;code&gt;QM&lt;/code&gt; 扩大到 &lt;code&gt;QR*&lt;/code&gt;，consumer surplus 增加，monopolist 获得 zero profit，且仍能 break even。这里要特别注意：对 monopolist 的 price ceiling 不一定像完全竞争市场那样导致 shortages；只要价格没有低到企业不愿供给，它反而可能提高 total surplus。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;6. Price Discrimination 的逻辑&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
单一价格垄断者 (Single-price monopolist) 对所有消费者收取同一价格。价格歧视 (Price discrimination) 是指企业对不同消费者就同一商品收取不同价格，以提高利润。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;许多拥有 market power 的企业不会只收一个价格。航空票价就是经典例子：愿意提前一个月购买不可退票、并在周六过夜的乘客，可能只付 &lt;code&gt;$150&lt;/code&gt;；临时出差、第二天返回的商务旅客，可能要付 &lt;code&gt;$550&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Price discrimination 能盈利，是因为消费者对价格的敏感程度不同。低弹性消费者 (low-elasticity consumers) 对价格不敏感，企业可以收更高价格；高弹性消费者 (high-elasticity consumers) 更容易因为高价退出市场，企业通常收较低价格。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Price discrimination technique&lt;/th&gt;
&lt;th&gt;做法&lt;/th&gt;
&lt;th&gt;经济逻辑&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Advance purchase restrictions&lt;/td&gt;
&lt;td&gt;提前购买者享受较低价格&lt;/td&gt;
&lt;td&gt;提前计划者通常价格弹性更高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Volume discounts&lt;/td&gt;
&lt;td&gt;大量购买者获得较低单价&lt;/td&gt;
&lt;td&gt;大买家对价格更敏感，且可扩大销售量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Two-part tariffs&lt;/td&gt;
&lt;td&gt;先收 membership fee，再收较低使用价&lt;/td&gt;
&lt;td&gt;通过 club 或会员机制分离消费者类型&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_32.png&quot; alt=&quot;slide 32&quot; /&gt;&lt;/p&gt;
&lt;p&gt;航空公司例子中，Air Sunshine 有两类顾客：business travelers 每张票最高愿付 &lt;code&gt;$550&lt;/code&gt;，students 每张票最高愿付 &lt;code&gt;$150&lt;/code&gt;，两类顾客各 2,000 人，marginal cost 为 &lt;code&gt;$125&lt;/code&gt;。若能区分顾客类型，航空公司对 business travelers 收 &lt;code&gt;$550&lt;/code&gt;，对 students 收 &lt;code&gt;$150&lt;/code&gt;，就能把两类消费者的 consumer surplus 都转化为 profit。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Customer type&lt;/th&gt;
&lt;th&gt;Quantity&lt;/th&gt;
&lt;th&gt;Willingness to pay / Price&lt;/th&gt;
&lt;th&gt;Marginal cost&lt;/th&gt;
&lt;th&gt;Profit per ticket&lt;/th&gt;
&lt;th&gt;Total profit&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Business travelers&lt;/td&gt;
&lt;td&gt;2,000&lt;/td&gt;
&lt;td&gt;$550&lt;/td&gt;
&lt;td&gt;$125&lt;/td&gt;
&lt;td&gt;$425&lt;/td&gt;
&lt;td&gt;$850,000&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Student travelers&lt;/td&gt;
&lt;td&gt;2,000&lt;/td&gt;
&lt;td&gt;$150&lt;/td&gt;
&lt;td&gt;$125&lt;/td&gt;
&lt;td&gt;$25&lt;/td&gt;
&lt;td&gt;$50,000&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total&lt;/td&gt;
&lt;td&gt;4,000&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;$900,000&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_33.png&quot; alt=&quot;slide 33&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info]
完全价格歧视 (Perfect price discrimination) 是 monopolist 对每个消费者都按照其 willingness to pay 收费。此时所有 mutually beneficial transactions 都会发生，因此没有 inefficiency；但消费者不再获得 consumer surplus，全部 surplus 都被 monopolist 以 profit 形式获取。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Price discrimination 越精细，monopolist 能捕获的 consumer surplus 越多，profit 越高。从两档价格到三档价格，企业能覆盖更多不同 willingness to pay 的消费者，并把更多蓝色 consumer surplus 转为利润。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_34.png&quot; alt=&quot;slide 34&quot; /&gt;
&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_35.png&quot; alt=&quot;slide 35&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Perfect price discrimination 在现实中几乎不可能完全实现，因为消费者有强烈动机隐藏自己的 true willingness to pay。但企业会通过会员制度、优惠券、提前购买限制、学生票、商务舱与经济舱等策略不断向它靠近。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_36.png&quot; alt=&quot;slide 36&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;7. Summary&lt;/h2&gt;
&lt;p&gt;本章首先把市场结构按生产者数量和产品差异化程度划分为 perfect competition、monopoly、oligopoly 和 monopolistic competition。Monopoly 是只有一个生产者且没有 close substitutes 的市场结构，monopolist 因面对 downward-sloping demand curve 而拥有 market power。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_37.png&quot; alt=&quot;slide 37&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Monopoly 若要长期存在，必须受到 barrier to entry 保护。这些壁垒包括 scarce resource/input control、natural monopoly、technological superiority、network externality，以及 patent、copyright 等 government-created barriers。由于 price effect，monopolist 的 &lt;code&gt;MR&lt;/code&gt; 总是低于市场价格，MR curve 位于 demand curve 下方。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_38.png&quot; alt=&quot;slide 38&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Monopolist 在 &lt;code&gt;MR = MC&lt;/code&gt; 处选择产量，再根据 demand curve 决定价格。因此相比 perfect competition，它生产更少、价格更高，并在 barrier to entry 下可获得短期和长期利润。Monopoly 通过 &lt;code&gt;P &amp;gt; MC&lt;/code&gt; 造成 deadweight loss，是一种 market failure。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_39.png&quot; alt=&quot;slide 39&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Natural monopoly 不一定适合拆分，但仍可能需要 public ownership 或 price regulation。Monopolists、oligopolists 和 monopolistic competitors 都可能使用 price discrimination。Perfect price discrimination 不造成 inefficiency，但会把全部 surplus 转化为 producer profit，且现实中难以完全实现。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_40.png&quot; alt=&quot;slide 40&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;Key Terms 中英对照&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;中文术语&lt;/th&gt;
&lt;th&gt;English term&lt;/th&gt;
&lt;th&gt;核心含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;垄断者&lt;/td&gt;
&lt;td&gt;Monopolist&lt;/td&gt;
&lt;td&gt;某种无 close substitutes 商品的唯一生产者&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;垄断&lt;/td&gt;
&lt;td&gt;Monopoly&lt;/td&gt;
&lt;td&gt;由 monopolist 控制的行业或市场&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;市场力量&lt;/td&gt;
&lt;td&gt;Market power&lt;/td&gt;
&lt;td&gt;通过减少产量提高价格的能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;进入壁垒&lt;/td&gt;
&lt;td&gt;Barrier to entry&lt;/td&gt;
&lt;td&gt;阻止潜在竞争者进入行业的因素&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;自然垄断&lt;/td&gt;
&lt;td&gt;Natural monopoly&lt;/td&gt;
&lt;td&gt;单一企业因 economies of scale 具有最低单位成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;网络外部性&lt;/td&gt;
&lt;td&gt;Network externality&lt;/td&gt;
&lt;td&gt;用户越多，单个用户获得的价值越高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;专利&lt;/td&gt;
&lt;td&gt;Patent&lt;/td&gt;
&lt;td&gt;发明的临时排他性使用和销售权&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;版权&lt;/td&gt;
&lt;td&gt;Copyright&lt;/td&gt;
&lt;td&gt;文学或艺术作品复制和获利的排他性权利&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;公共所有制&lt;/td&gt;
&lt;td&gt;Public ownership&lt;/td&gt;
&lt;td&gt;政府或政府拥有企业提供商品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;价格管制&lt;/td&gt;
&lt;td&gt;Price regulation&lt;/td&gt;
&lt;td&gt;政府限制 monopolist 可收取的价格&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;单一价格垄断者&lt;/td&gt;
&lt;td&gt;Single-price monopolist&lt;/td&gt;
&lt;td&gt;对所有消费者收取同一价格的 monopolist&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;价格歧视&lt;/td&gt;
&lt;td&gt;Price discrimination&lt;/td&gt;
&lt;td&gt;对不同消费者收取不同价格&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;完全价格歧视&lt;/td&gt;
&lt;td&gt;Perfect price discrimination&lt;/td&gt;
&lt;td&gt;按每位消费者 willingness to pay 收费&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/Chapter_9_Monopoly_Markets_and_Price_Discrimination/slide_41.png&quot; alt=&quot;slide 41&quot; /&gt;&lt;/p&gt;
</content:encoded></item><item><title>ECO2011 期中复习：考试指南</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/aaamid/review_guide/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/aaamid/review_guide/</guid><pubDate>Wed, 24 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;ECO2011 期中考试复习指南&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;考试范围&lt;/strong&gt;: Chapter 2–7, Krugman &amp;amp; Wells &lt;em&gt;Microeconomics&lt;/em&gt; 3rd Edition&lt;br /&gt;
&lt;strong&gt;题型&lt;/strong&gt;: 30 道选择题&lt;br /&gt;
&lt;strong&gt;生成依据&lt;/strong&gt;: 6 份章节笔记 + 20 道样例题逐题分析&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;Part A: 样例卷逐题分析 &amp;amp; 笔记对比&lt;/h2&gt;
&lt;p&gt;每题标注：✅ 笔记已覆盖 / ⚠️ 笔记部分覆盖 / ❌ 笔记缺失&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;题号&lt;/th&gt;
&lt;th&gt;考点&lt;/th&gt;
&lt;th&gt;章节&lt;/th&gt;
&lt;th&gt;答案&lt;/th&gt;
&lt;th&gt;笔记覆盖&lt;/th&gt;
&lt;th&gt;说明&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;Movement Along vs Shift of Demand&lt;/td&gt;
&lt;td&gt;Ch3&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记详尽；自身价格变→Movement，外部因素→Shift；题中&quot;生产成本变化&quot;是供给侧因素，不影响需求曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2&lt;/td&gt;
&lt;td&gt;弹性的影响因素：必需品 vs 奢侈品&lt;/td&gt;
&lt;td&gt;Ch6&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有四大因素表；澳洲活龙虾=奢侈品+多替代品→高弹性&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3&lt;/td&gt;
&lt;td&gt;弹性与总收益关系&lt;/td&gt;
&lt;td&gt;Ch6&lt;/td&gt;
&lt;td&gt;D&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有完整表格：ηd&amp;gt;1→涨价→总收益减少&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;td&gt;正常品/劣质品：收入变化对均衡的影响&lt;/td&gt;
&lt;td&gt;Ch3&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有 Normal/Inferior Good 定义及移动方向&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;td&gt;生产者剩余的定义&lt;/td&gt;
&lt;td&gt;Ch4&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有精确定义：PS = 价格 − 成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;6&lt;/td&gt;
&lt;td&gt;竞争市场长期均衡特征&lt;/td&gt;
&lt;td&gt;Ch3/Ch4&lt;/td&gt;
&lt;td&gt;E&lt;/td&gt;
&lt;td&gt;⚠️&lt;/td&gt;
&lt;td&gt;笔记缺：长期零经济利润、边际成本定价、最低平均成本生产；选项e「消费者长期零剩余」是错误陈述故为答案&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;竞争市场均衡数量含义&lt;/td&gt;
&lt;td&gt;Ch4&lt;/td&gt;
&lt;td&gt;E&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记总剩余部分覆盖「均衡量最大总剩余」&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;8&lt;/td&gt;
&lt;td&gt;价格上限的定义&lt;/td&gt;
&lt;td&gt;Ch5&lt;/td&gt;
&lt;td&gt;D&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有完整定义&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;9&lt;/td&gt;
&lt;td&gt;完全非弹性需求（垂直线）&lt;/td&gt;
&lt;td&gt;Ch6&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有 perfectly inelastic demand = 垂直线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;10&lt;/td&gt;
&lt;td&gt;需求曲线右移的原因（图形题）&lt;/td&gt;
&lt;td&gt;Ch3&lt;/td&gt;
&lt;td&gt;E&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有五大移动因素；消费者数量增加→D右移&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;11&lt;/td&gt;
&lt;td&gt;供需同时移动&lt;/td&gt;
&lt;td&gt;Ch3&lt;/td&gt;
&lt;td&gt;D&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有同时移动矩阵；技术→S右移+消费者认知→D右移&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;12&lt;/td&gt;
&lt;td&gt;互补品价格对需求的影响&lt;/td&gt;
&lt;td&gt;Ch3&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有：互补品价格下降→需求增加&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;13&lt;/td&gt;
&lt;td&gt;价格上限 Binding vs Not Binding&lt;/td&gt;
&lt;td&gt;Ch5&lt;/td&gt;
&lt;td&gt;B&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有：上限高于均衡→not binding→无影响&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;14&lt;/td&gt;
&lt;td&gt;预算约束线&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;?&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;E&lt;/td&gt;
&lt;td&gt;❌&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;完全不在笔记中&lt;/strong&gt;；收入与价格同比例上升→实际收入不变→预算线不变&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;15&lt;/td&gt;
&lt;td&gt;成本函数与平均成本计算&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;?&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;D&lt;/td&gt;
&lt;td&gt;❌&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;完全不在笔记中&lt;/strong&gt;；C(Q)=5000+15Q+2Q²+0.5Q³，AC(100)=C(100)/100=5265&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;16&lt;/td&gt;
&lt;td&gt;供给曲线向上倾斜的原因&lt;/td&gt;
&lt;td&gt;Ch3&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;⚠️&lt;/td&gt;
&lt;td&gt;笔记有供给曲线向上倾斜但未深入解释原因&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;17&lt;/td&gt;
&lt;td&gt;均衡价格最大化总剩余&lt;/td&gt;
&lt;td&gt;Ch4&lt;/td&gt;
&lt;td&gt;B&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有明确论断&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;18&lt;/td&gt;
&lt;td&gt;Binding Price Floor 图形识别&lt;/td&gt;
&lt;td&gt;Ch5&lt;/td&gt;
&lt;td&gt;B&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有：Floor 高于均衡=Binding→过剩&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;19&lt;/td&gt;
&lt;td&gt;比较优势计算&lt;/td&gt;
&lt;td&gt;Ch2&lt;/td&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记有完整计算方法：找最低机会成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;20&lt;/td&gt;
&lt;td&gt;国际贸易：专业化与贸易&lt;/td&gt;
&lt;td&gt;Ch2&lt;/td&gt;
&lt;td&gt;C&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;td&gt;笔记比较优势部分覆盖&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;h2&gt;Part B: 遗漏考点清单&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;以下是样例卷中出现但笔记中&lt;strong&gt;缺失或不完整&lt;/strong&gt;的考点，按严重程度排列。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;🔴 严重缺失（完全不在笔记中）&lt;/h3&gt;
&lt;h4&gt;1. 预算约束线 (Budget Constraint)&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;对应题目&lt;/strong&gt;: Q14&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;来源章节&lt;/strong&gt;: 可能来自 Chapter 1 或消费者选择章节（Krugman &amp;amp; Wells Ch10 附录）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;核心概念&lt;/strong&gt;:
&lt;ul&gt;
&lt;li&gt;预算约束线表示在给定收入和价格下消费者能负担的所有商品组合&lt;/li&gt;
&lt;li&gt;公式：$P_x \cdot X + P_y \cdot Y = \text{Income}$&lt;/li&gt;
&lt;li&gt;收入与所有价格同比例变化 → &lt;strong&gt;预算线不变&lt;/strong&gt;（实际收入未变）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;2. 成本函数与平均成本计算 (Cost Functions &amp;amp; Average Cost)&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;对应题目&lt;/strong&gt;: Q15&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;来源章节&lt;/strong&gt;: 可能来自 Chapter 1 或生产与成本章节（Krugman &amp;amp; Wells Ch9）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;核心概念&lt;/strong&gt;:
&lt;ul&gt;
&lt;li&gt;总成本函数：$C(Q) = FC + VC(Q)$&lt;/li&gt;
&lt;li&gt;平均成本：$\text{AC} = \frac{C(Q)}{Q}$&lt;/li&gt;
&lt;li&gt;需要能做基本代数代入计算&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;🟡 部分缺失（笔记有概念但缺深度）&lt;/h3&gt;
&lt;h4&gt;3. 竞争市场的长期均衡特征&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;对应题目&lt;/strong&gt;: Q6 (选项 b, c, d)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;笔记现状&lt;/strong&gt;: Ch3 定义了竞争市场（多买卖者、同质商品），但未覆盖长期特征&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;需补充&lt;/strong&gt;:
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;长期零经济利润&lt;/strong&gt; (Zero Economic Profit in Long Run): 利润吸引进入→供给右移→价格下降→利润消失&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;边际成本定价&lt;/strong&gt; (Price = Marginal Cost): 生产者增产直到 P=MC&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;最低平均成本生产&lt;/strong&gt;: 长期均衡时企业在 ATC 最低点生产&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;4. 供给曲线向上倾斜的微观基础&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;对应题目&lt;/strong&gt;: Q16&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;笔记现状&lt;/strong&gt;: Ch3 提到供给曲线向上倾斜（正向关系），但未解释&quot;为什么&quot;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;需补充&lt;/strong&gt;: 价格上涨给生产者激励→增加产量；更深层原因：边际成本递增&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;5. 边际成本 (Marginal Cost) 概念&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;对应题目&lt;/strong&gt;: Q6 选项 c, Q15&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;笔记现状&lt;/strong&gt;: 完全未提及&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;需补充&lt;/strong&gt;:
&lt;ul&gt;
&lt;li&gt;边际成本 = 多生产一单位所增加的总成本&lt;/li&gt;
&lt;li&gt;竞争市场中：P=MC 时利润最大&lt;/li&gt;
&lt;li&gt;P&amp;gt;MC → 增加产量可增加利润&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;Part C: 精简复习脑图&lt;/h2&gt;
&lt;pre&gt;&lt;code&gt;ECO2011 期中考试知识框架
═══════════════════════════════════════

Ch2  经济模型：权衡与贸易
├── PPF: 效率(线上) / 不可行(线外) / 无效率(线内)
├── 机会成本 = 放弃的东西 / PPF斜率
├── 递增机会成本 → PPF bowed-out shape
├── 经济增长 → PPF 外移 (要素↑ or 技术↑)
├── 🔥 比较优势 = 最低机会成本 (≠绝对优势!)
├── 贸易收益: 专业化+贸易 → 双方消费都增加
├── 循环流向图: Households ⇄ Firms (商品市场+要素市场)
└── 实证(是什么) vs 规范(应该怎样)

Ch3  供需模型 ⭐ 最核心
├── 需求曲线: 向下倾斜 (Law of Demand)
│   ├── 🔥 Movement Along: 仅由自身价格变化引起
│   └── Shift (5因素): ①相关品价格 ②收入 ③消费者数 ④预期 ⑤品味
│       ├── 替代品: B涨价→A需求↑
│       ├── 互补品: B涨价→A需求↓
│       ├── 正常品: 收入↑→需求↑
│       └── 劣质品: 收入↑→需求↓
├── 供给曲线: 向上倾斜
│   ├── Movement Along: 仅由自身价格变化引起
│   └── Shift (5因素): ①投入品价 ②相关品价 ③技术 ④预期 ⑤生产者数
├── 市场均衡: Qd = Qs
│   ├── Surplus (过剩): P &amp;gt; P* → 价格下降
│   ├── Shortage (短缺): P &amp;lt; P* → 价格上升
│   └── 🔥 Short Side 规则: 实际交易量由市场&quot;短边&quot;决定
├── 均衡变化预测:
│   ├── D↑→P↑Q↑  │  S↑→P↓Q↑
│   ├── D↓→P↓Q↓  │  S↓→P↑Q↓
│   └── 同时移动矩阵 (见速查表)
└── 判据: P与Q同向变化→D移动; P与Q反向变化→S移动

Ch4  消费者剩余与生产者剩余
├── CS = WTP − 价格 = 需求曲线下方、价格上方面积
├── PS = 价格 − 成本 = 供给曲线上方、价格下方面积
├── 总剩余 = CS + PS → 市场均衡时最大化
├── 三项无效率尝试 (都会降低总剩余):
│   ├── 重新分配消费
│   ├── 重新分配销售
│   └── 改变交易量
├── 市场四项效率功能: 最优分配消费/销售/确保互惠/不遗漏
├── 价格作为经济信号 + 产权 → 市场运作良好的两大支柱
└── ⚠️ 三个注意事项: 效率≠公平 / 市场可能失灵 / 有效率≠每个人最好

Ch5  价格管制与配额 (政府干预)
├── Price Ceiling (价格上限): 最高合法价格
│   ├── Binding: Ceiling &amp;lt; P*  → 短缺
│   ├── Not Binding: Ceiling &amp;gt; P* → 无影响
│   └── 4种低效率: 无效分配/资源浪费/低质量/黑市
├── Price Floor (价格下限): 最低合法价格
│   ├── Binding: Floor &amp;gt; P* → 过剩
│   ├── Not Binding: Floor &amp;lt; P* → 无影响
│   ├── 5种低效率: 低交易量/无效分配/资源浪费/过高质量/违法诱惑
│   └── 最低工资案例: 对青少年binding, 高技能工人not binding
├── Quota (数量管制/配额)
│   ├── Quota Rent = Demand Price − Supply Price (Wedge)
│   ├── 许可证可交易时: 牌照价格 = Quota Rent
│   └── 也造成 DWL (阻碍互惠交易)
└── 共同效应: 三者都减少交易量、造成DWL (如果binding)

Ch6  弹性 ⭐ 贯穿各章的分析工具
├── 需求价格弹性 ηd = |%ΔQd / %ΔP|
│   ├── 中点法: %ΔX = ΔX / [(X₁+X₂)/2] × 100%
│   ├── ηd &amp;gt; 1  Elastic   → 涨价→总收益↓ (数量效应主导)
│   ├── ηd &amp;lt; 1  Inelastic → 涨价→总收益↑ (价格效应主导)
│   ├── ηd = 1  Unit-Elastic → 总收益不变
│   ├── ηd = 0  Perfectly Inelastic (垂直线)
│   ├── ηd = ∞  Perfectly Elastic (水平线)
│   └── 影响ηd的4因素: 替代品/必需品vs奢侈品/收入占比/时间
├── 交叉价格弹性 ηxy = %ΔQx / %ΔPy
│   ├── 正 → 替代品
│   └── 负 → 互补品
├── 收入弹性 ηi = %ΔQd / %ΔIncome
│   ├── 正 → 正常品 (&amp;gt;1收入弹性, 0-1收入缺乏弹性)
│   └── 负 → 劣质品
└── 供给价格弹性 ηs = %ΔQs / %ΔP
    ├── 影响因素: 投入品可得性 / 时间(长期&amp;gt;短期)
    └── 接近产能极限时弹性变小

Ch7  税收
├── Excise Tax: 在买卖价格间打入 Wedge
│   ├── 🔥 税收归宿不取决于谁缴税!
│   └── 取决于弹性: 弹性小的一方承担更多税负
├── Tax Revenue = Tax/单位 × 征税后交易量
│   └── 税率翻倍≠收入翻倍 (拉弗曲线)
├── Deadweight Loss (DWL): 被税收阻碍的互惠交易价值
│   ├── 弹性越大 → DWL越大
│   ├── Perfectly Inelastic → DWL=0
│   └── Total Inefficiency = DWL + Administrative Costs
├── 公平原则: Benefits Principle / Ability-to-Pay Principle
├── 税收结构: Progressive(累进) / Regressive(累退) / Proportional(比例)
├── 税基类型: Income/Payroll/Sales/Profits/Property/Wealth
└── 🔥 Equity-Efficiency Trade-off: 最公平的税效率最低, 反之亦然

⚠️ 补充考点 (不在Ch2-7笔记但出现于样例卷)
├── 预算约束线: 收入与所有价格同比例变化→预算线不变
├── 成本函数: AC = C(Q)/Q, 能做代数计算
└── 竞争市场长期特征: 零经济利润/P=MC/ATC最低点生产
&lt;/code&gt;&lt;/pre&gt;
&lt;hr /&gt;
&lt;h2&gt;Part D: 核心速查表&lt;/h2&gt;
&lt;h3&gt;D.1 必辨概念对&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;概念 A&lt;/th&gt;
&lt;th&gt;概念 B&lt;/th&gt;
&lt;th&gt;区分关键&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Movement Along&lt;/td&gt;
&lt;td&gt;Shift&lt;/td&gt;
&lt;td&gt;自身价格变 → Movement; 外部因素 → Shift&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Demand 变化&lt;/td&gt;
&lt;td&gt;Quantity Demanded 变化&lt;/td&gt;
&lt;td&gt;Demand=整条线移动; Qd=沿曲线移动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Supply 变化&lt;/td&gt;
&lt;td&gt;Quantity Supplied 变化&lt;/td&gt;
&lt;td&gt;Supply=整条线移动; Qs=沿曲线移动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;比较优势&lt;/td&gt;
&lt;td&gt;绝对优势&lt;/td&gt;
&lt;td&gt;比较优势=&lt;strong&gt;更低机会成本&lt;/strong&gt;; 绝对优势=&lt;strong&gt;更高效/更少资源&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;替代品&lt;/td&gt;
&lt;td&gt;互补品&lt;/td&gt;
&lt;td&gt;替代品交叉弹性&lt;strong&gt;正&lt;/strong&gt;; 互补品交叉弹性&lt;strong&gt;负&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;正常品&lt;/td&gt;
&lt;td&gt;劣质品&lt;/td&gt;
&lt;td&gt;正常品收入弹性&lt;strong&gt;正&lt;/strong&gt;; 劣质品收入弹性&lt;strong&gt;负&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;实证经济学&lt;/td&gt;
&lt;td&gt;规范经济学&lt;/td&gt;
&lt;td&gt;实证=&lt;strong&gt;是什么&lt;/strong&gt;(可验证); 规范=&lt;strong&gt;应该怎样&lt;/strong&gt;(价值判断)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Price Ceiling&lt;/td&gt;
&lt;td&gt;Price Floor&lt;/td&gt;
&lt;td&gt;Ceiling=&lt;strong&gt;最高&lt;/strong&gt;价→短缺; Floor=&lt;strong&gt;最低&lt;/strong&gt;价→过剩&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Binding&lt;/td&gt;
&lt;td&gt;Not Binding&lt;/td&gt;
&lt;td&gt;Ceiling&amp;lt;均衡 or Floor&amp;gt;均衡 = Binding&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;消费者剩余&lt;/td&gt;
&lt;td&gt;生产者剩余&lt;/td&gt;
&lt;td&gt;CS=WTP-价格(线下方面积); PS=价格-成本(线上方面积)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;td&gt;η&amp;gt;1=消费者敏感; η&amp;lt;1=消费者不敏感&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;累进税&lt;/td&gt;
&lt;td&gt;累退税&lt;/td&gt;
&lt;td&gt;Progressive=高收入税率更高; Regressive=高收入税率更低&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;D.2 供需同时移动结果矩阵&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Supply↑&lt;/th&gt;
&lt;th&gt;Supply↓&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Demand↑&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;P:? Q:↑&lt;/td&gt;
&lt;td&gt;P:↑ Q:?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Demand↓&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;P:↓ Q:?&lt;/td&gt;
&lt;td&gt;P:? Q:↓&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;口诀&lt;/strong&gt;: 反方向移动→P确定Q不确定; 同方向移动→Q确定P不确定&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;D.3 弹性与总收益&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;弹性&lt;/th&gt;
&lt;th&gt;涨价效果&lt;/th&gt;
&lt;th&gt;降价效果&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Elastic (&amp;gt;1)&lt;/td&gt;
&lt;td&gt;总收益 &lt;strong&gt;↓&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;总收益 &lt;strong&gt;↑&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Unit-Elastic (=1)&lt;/td&gt;
&lt;td&gt;总收益不变&lt;/td&gt;
&lt;td&gt;总收益不变&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Inelastic (&amp;lt;1)&lt;/td&gt;
&lt;td&gt;总收益 &lt;strong&gt;↑&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;总收益 &lt;strong&gt;↓&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;口诀&lt;/strong&gt;: Elastic→数量效应强→别涨价; Inelastic→价格效应强→涨价增收&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;D.4 税收归宿速判&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;条件&lt;/th&gt;
&lt;th&gt;承担更多税负方&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;需求弹性 &amp;lt; 供给弹性&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;消费者&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;供给弹性 &amp;lt; 需求弹性&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;生产者&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;完全非弹性需求&lt;/td&gt;
&lt;td&gt;消费者承担全部&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;完全非弹性供给&lt;/td&gt;
&lt;td&gt;生产者承担全部&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;口诀&lt;/strong&gt;: 谁更跑不掉(Inelastic)，谁就承担更多税负&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;D.5 政府干预对比&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;干预&lt;/th&gt;
&lt;th&gt;条件&lt;/th&gt;
&lt;th&gt;结果&lt;/th&gt;
&lt;th&gt;福利效应&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Price Ceiling&lt;/td&gt;
&lt;td&gt;&amp;lt; P*&lt;/td&gt;
&lt;td&gt;短缺&lt;/td&gt;
&lt;td&gt;DWL&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Price Floor&lt;/td&gt;
&lt;td&gt;&amp;gt; P*&lt;/td&gt;
&lt;td&gt;过剩&lt;/td&gt;
&lt;td&gt;DWL&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Quota&lt;/td&gt;
&lt;td&gt;限制交易量&lt;/td&gt;
&lt;td&gt;Wedge + Quota Rent&lt;/td&gt;
&lt;td&gt;DWL&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Excise Tax&lt;/td&gt;
&lt;td&gt;每单位征税&lt;/td&gt;
&lt;td&gt;Wedge(归宿由弹性定)&lt;/td&gt;
&lt;td&gt;DWL + AdminCost&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;口诀&lt;/strong&gt;: Binding 的干预都减少交易量、都造成 DWL&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;D.6 比较优势计算步骤&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;算出各国/各人生产每种商品的机会成本（用放弃的另一商品数量表示）&lt;/li&gt;
&lt;li&gt;比较机会成本：&lt;strong&gt;谁的机会成本更低，谁就有比较优势&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;各国应专门生产自己有&lt;strong&gt;比较优势&lt;/strong&gt;的商品，然后贸易&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;D.7 Movement vs Shift 速判&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;变化来源&lt;/th&gt;
&lt;th&gt;影响&lt;/th&gt;
&lt;th&gt;图示&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;商品自身价格&lt;/td&gt;
&lt;td&gt;Quantity Demanded/Supplied 变化&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;沿&lt;/strong&gt;曲线移动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;替代品/互补品价格&lt;/td&gt;
&lt;td&gt;Demand 变化&lt;/td&gt;
&lt;td&gt;需求曲线&lt;strong&gt;平移&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;收入&lt;/td&gt;
&lt;td&gt;Demand 变化&lt;/td&gt;
&lt;td&gt;需求曲线&lt;strong&gt;平移&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;消费者数量/品味/预期&lt;/td&gt;
&lt;td&gt;Demand 变化&lt;/td&gt;
&lt;td&gt;需求曲线&lt;strong&gt;平移&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;投入品价格&lt;/td&gt;
&lt;td&gt;Supply 变化&lt;/td&gt;
&lt;td&gt;供给曲线&lt;strong&gt;平移&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;技术&lt;/td&gt;
&lt;td&gt;Supply 变化&lt;/td&gt;
&lt;td&gt;供给曲线&lt;strong&gt;平移&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;生产者数量/预期&lt;/td&gt;
&lt;td&gt;Supply 变化&lt;/td&gt;
&lt;td&gt;供给曲线&lt;strong&gt;平移&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;h2&gt;Part E: 常见陷阱 &amp;amp; 易错点&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;比较优势 ≠ 绝对优势&lt;/strong&gt; — 只看机会成本，不看绝对产出量（Q19 题型必考）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Movement vs Shift&lt;/strong&gt; — 坐标轴上变量(价格)变化是 Movement，不在轴上的是 Shift（Q1 题型必考）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Binding 条件&lt;/strong&gt; — Ceiling 必须&lt;strong&gt;低于&lt;/strong&gt;均衡才 binding，Floor 必须&lt;strong&gt;高于&lt;/strong&gt;均衡才 binding（Q13 陷阱）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;弹性与总收益方向&lt;/strong&gt; — Inelastic 时涨价增收，Elastic 时涨价减收（Q3 题型必考）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;税收归宿不取决于谁缴税&lt;/strong&gt; — 取决于弹性（Ch7 核心结论）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Short Side 规则&lt;/strong&gt; — 实际交易量由不愿意交易的那方决定（Ceiling→卖方决定，Floor→买方决定）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;交叉弹性符号&lt;/strong&gt; — 正=替代品，负=互补品（不要记反）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;收入弹性符号&lt;/strong&gt; — 负=劣质品（不是正常品）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Normal Good 的收入效应&lt;/strong&gt; — 收入↑→需求↑→P↑Q↑（不是 P↓Q↓）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Perfectly Inelastic Demand 下价格涨 20%&lt;/strong&gt; — 数量不变，需求曲线垂直（Q9 题型）&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h2&gt;Part F: 样例卷 Q14 &amp;amp; Q15 补充知识点&lt;/h2&gt;
&lt;h3&gt;预算约束线 (Budget Constraint)&lt;/h3&gt;
&lt;pre&gt;&lt;code&gt;公式: Px·X + Py·Y = Income

预算线斜率 = -Px/Py (两种商品的相对价格)
X截距 = Income/Px, Y截距 = Income/Py

变化效果:
- 收入↑ → 预算线平行外移
- Px↑ → X截距减小, 预算线绕Y截距向内旋转
- 收入与所有价格同比例变化 → 预算线不变 (实际收入未变)
&lt;/code&gt;&lt;/pre&gt;
&lt;h3&gt;成本函数基础&lt;/h3&gt;
&lt;pre&gt;&lt;code&gt;总成本: C(Q) = FC (固定成本) + VC(Q) (可变成本)
平均成本: AC = C(Q)/Q = AFC + AVC
边际成本: MC = ΔC/ΔQ (每多产一单位的额外成本)

例题: C(Q) = 5000 + 15Q + 2Q² + 0.5Q³
当 Q=100: C(100) = 5000 + 1500 + 20000 + 500000 = 526500
AC = 526500/100 = 5265
&lt;/code&gt;&lt;/pre&gt;
&lt;hr /&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;最后更新&lt;/strong&gt;: 2026-06-24&lt;br /&gt;
&lt;strong&gt;建议&lt;/strong&gt;: 重点练习 Movement vs Shift 辨别、弹性计算与总收益判断、比较优势计算、Binding vs Not Binding 条件判断、税收归宿判断。样例卷 Q14-Q15 若来自教授课堂讲授内容，建议向同学确认是否有补充讲义。&lt;/p&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>ECO2011 C7：Inputs and Costs（投入与成本）</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c7-production-inputs-and-costs-1/chapter_7_production-inputs-and-costs-/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c7-production-inputs-and-costs-1/chapter_7_production-inputs-and-costs-/</guid><pubDate>Tue, 23 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 11: 供给曲线背后 — 投入与成本&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;本章核心问题：企业的生产函数如何将投入与产出联系起来？成本曲线如何从生产函数中推导出来？短期与长期成本有何不同？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;1. 生产函数 (The Production Function)&lt;/h2&gt;
&lt;h3&gt;1.1 基本概念&lt;/h3&gt;
&lt;p&gt;企业的 &lt;strong&gt;生产函数 (Production Function)&lt;/strong&gt; 描述了企业使用的投入品数量与所生产的产出数量之间的关系。在分析生产时，我们区分两类投入：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 固定投入与可变投入&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;固定投入 (Fixed Input)&lt;/strong&gt;：在特定时期内数量固定、无法改变的投入品。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;可变投入 (Variable Input)&lt;/strong&gt;：企业可以随时改变其数量的投入品。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;这一区分引出了经济学中两个极其重要的时间维度概念：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 短期与长期&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;短期 (Short Run)&lt;/strong&gt;：至少有一种投入是固定的时期。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长期 (Long Run)&lt;/strong&gt;：所有投入都可以改变的时期。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点提示
短期与长期的区分不在于具体的时间长度（不是&quot;几个月&quot;），而在于&lt;strong&gt;是否存在固定投入&lt;/strong&gt;。不同行业的短期/长期的时间含义完全不同。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;总产量曲线 (Total Product Curve)&lt;/strong&gt; 展示了在给定固定投入数量的情况下，产出数量如何随可变投入数量的变化而变化。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;1.2 George 与 Martha 农场的生产函数&lt;/h3&gt;
&lt;p&gt;以下表格和图表展示了 George 与 Martha 农场的具体例子。该农场有 10 英亩土地（固定投入），工人数量（可变投入）可以调整。下表展示了生产函数以及 &lt;strong&gt;劳动边际产量 (Marginal Product of Labor, MPL)&lt;/strong&gt;。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Quantity of Labor (workers)&lt;/th&gt;
&lt;th&gt;Quantity of Wheat (bushels)&lt;/th&gt;
&lt;th&gt;MPL = ΔQ/ΔL (bushels/worker)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;19&lt;/td&gt;
&lt;td&gt;19&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2&lt;/td&gt;
&lt;td&gt;36&lt;/td&gt;
&lt;td&gt;17&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3&lt;/td&gt;
&lt;td&gt;51&lt;/td&gt;
&lt;td&gt;15&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;td&gt;64&lt;/td&gt;
&lt;td&gt;13&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;td&gt;75&lt;/td&gt;
&lt;td&gt;11&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;6&lt;/td&gt;
&lt;td&gt;84&lt;/td&gt;
&lt;td&gt;9&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;91&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;8&lt;/td&gt;
&lt;td&gt;96&lt;/td&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;从表中可以清楚看到：随着工人数量的增加，每增加一名工人所带来的额外产出&lt;strong&gt;递减&lt;/strong&gt;——这便是&lt;strong&gt;边际报酬递减 (Diminishing Returns)&lt;/strong&gt; 的核心表现。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;1.3 边际产量与边际报酬递减&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 边际产量 (Marginal Product)
某投入品的 &lt;strong&gt;边际产量 (Marginal Product)&lt;/strong&gt; 是指多使用一单位该投入品所生产的额外产出数量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 边际报酬递减 (Diminishing Returns to an Input)
当一种投入品的数量增加，而其他所有投入品的水平保持不变时，该投入品的边际产量下降，即存在 &lt;strong&gt;边际报酬递减&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;在 George 与 Martha 的农场中，第一名工人带来了 19 蒲式耳的增产，第二名工人带来 17 蒲式耳，第三名 15 蒲式耳……劳动边际产量持续下降。&lt;strong&gt;边际产量递减是经济学中最基本也是最重要的规律之一&lt;/strong&gt;，它是后续推导成本曲线形状的关键。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;劳动边际产量曲线 (Marginal Product of Labor Curve)&lt;/strong&gt; 呈现明显的向下倾斜趋势：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;从演讲者备注中可以看到，该图描绘的是每位新增工人对应的边际产量。纵轴衡量产出变化量，横轴衡量工人数量。曲线向下倾斜正是&lt;strong&gt;边际报酬递减&lt;/strong&gt;的直接体现。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;1.4 固定投入变化的影响&lt;/h3&gt;
&lt;p&gt;当固定投入（如土地面积）发生改变时，总产量曲线和边际产量曲线都会发生移动。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;&lt;/p&gt;
&lt;p&gt;上图包含两组曲线：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Panel (a)&lt;/strong&gt;：$TP_{10}$ 和 $TP_{20}$ 分别代表 10 英亩和 20 英亩土地时的总产量曲线。当土地面积翻倍时，&lt;strong&gt;每一位工人的产量都更高&lt;/strong&gt;，因此总产量曲线整体上移。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Panel (b)&lt;/strong&gt;：对应的边际产量曲线也上移——$MPL_{20}$ 高于 $MPL_{10}$。但需要注意的是，&lt;strong&gt;两条边际产量曲线仍然向下倾斜&lt;/strong&gt;，因为即使在更大的农场，边际报酬递减依然存在。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 关键洞察
增加固定投入会提高每个工人的边际产量（曲线向上移动），但&lt;strong&gt;不能消除&lt;/strong&gt;边际报酬递减的趋势。这是理解后续短期与长期成本差异的重要基础。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;2. 从生产函数到成本曲线 (From the Production Function to Cost Curves)&lt;/h2&gt;
&lt;h3&gt;2.1 成本的类型&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 固定成本 (Fixed Cost)
不随产出数量变化而变化的成本。它是固定投入的成本。例如：柴油发电厂的&lt;strong&gt;建设成本&lt;/strong&gt;就是固定成本。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 可变成本 (Variable Cost)
依赖于产出数量变化的成本。它是可变投入的成本。例如：发电过程中使用的&lt;strong&gt;柴油燃料&lt;/strong&gt;就是可变成本。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.2 总成本曲线 (Total Cost Curve)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 总成本 (Total Cost, TC)
生产给定数量产出的总成本等于固定成本与可变成本之和：
$$TC = FC + VC$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;总成本曲线 (Total Cost Curve)&lt;/strong&gt; 显示了总成本如何随产出数量变化。它的形状特征为：&lt;strong&gt;随着产出的增加，曲线变得越来越陡峭&lt;/strong&gt;——这正是边际报酬递减的直接后果。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.3 George 与 Martha 农场的总成本&lt;/h3&gt;
&lt;p&gt;回到农场的例子，以下是完整的成本数据表：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Q (wheat, bushels)&lt;/th&gt;
&lt;th&gt;L (workers)&lt;/th&gt;
&lt;th&gt;Fixed Cost (FC)&lt;/th&gt;
&lt;th&gt;Variable Cost (VC)&lt;/th&gt;
&lt;th&gt;Total Cost (TC = FC + VC)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$0&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;19&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$200&lt;/td&gt;
&lt;td&gt;$600&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;36&lt;/td&gt;
&lt;td&gt;2&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$800&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;51&lt;/td&gt;
&lt;td&gt;3&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$600&lt;/td&gt;
&lt;td&gt;$1,000&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;64&lt;/td&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$800&lt;/td&gt;
&lt;td&gt;$1,200&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;75&lt;/td&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$1,000&lt;/td&gt;
&lt;td&gt;$1,400&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;84&lt;/td&gt;
&lt;td&gt;6&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$1,200&lt;/td&gt;
&lt;td&gt;$1,600&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;91&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$1,400&lt;/td&gt;
&lt;td&gt;$1,800&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;96&lt;/td&gt;
&lt;td&gt;8&lt;/td&gt;
&lt;td&gt;$400&lt;/td&gt;
&lt;td&gt;$1,600&lt;/td&gt;
&lt;td&gt;$2,000&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;从演讲者备注中可以确认：总成本曲线向上倾斜——因为产出增加需要雇佣更多工人，总成本随之增加。曲线变得越来越陡峭，正是因为&lt;strong&gt;劳动的边际报酬递减&lt;/strong&gt;：每增加一单位产出，需要越来越多的工人。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;3. 边际成本与平均成本 (Marginal Cost and Average Cost)&lt;/h2&gt;
&lt;h3&gt;3.1 边际成本 (Marginal Cost)&lt;/h3&gt;
&lt;p&gt;与边际产量的概念相对应，&lt;strong&gt;边际成本 (Marginal Cost)&lt;/strong&gt; 是成本分析中的核心概念：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 边际成本 (Marginal Cost, MC)
多生产一单位产出所导致的总成本增加量：
$$MC = \frac{\Delta TC}{\Delta Q}$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;类比于边际产量等于&quot;上升量除以水平距离&quot;（即斜率），边际成本也是总成本曲线斜率的度量。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;3.2 Selena&apos;s Gourmet Salsas 案例&lt;/h3&gt;
&lt;p&gt;为更好地展示成本结构，教材引入了 Selena&apos;s Gourmet Salsas（一家辣酱公司）的生产数据：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;p&gt;以下是该公司的总成本与边际成本曲线：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;从演讲者备注可以明确：Panel (a) 的总成本曲线向上倾斜且越来越陡峭，Panel (b) 的边际成本曲线也向上倾斜——这都反映了&lt;strong&gt;可变投入的边际报酬递减&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.3 为什么边际成本曲线向上倾斜？&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 边际成本曲线向上倾斜的逻辑链条&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;生产中存在 &lt;strong&gt;边际报酬递减 (Diminishing Returns)&lt;/strong&gt;：随着产出增加，可变投入的边际产量下降。&lt;/li&gt;
&lt;li&gt;这意味着每多生产一单位产出，需要使用&lt;strong&gt;越来越多的可变投入&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;由于每单位可变投入都需要付费，因此&lt;strong&gt;每增加一单位产出的成本也上升&lt;/strong&gt;。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这就是边际成本曲线向上倾斜的根本原因。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;3.4 平均成本 (Average Cost)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 平均总成本 (Average Total Cost, ATC)
平均总成本（常简称为平均成本）等于总成本除以产出数量：
$$ATC = \frac{TC}{Q}$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 平均固定成本 (Average Fixed Cost, AFC)
每单位产出的固定成本：
$$AFC = \frac{FC}{Q}$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 平均可变成本 (Average Variable Cost, AVC)
每单位产出的可变成本：
$$AVC = \frac{VC}{Q}$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;其中，&lt;strong&gt;典型的 ATC 曲线呈 U 形 (U-shaped)&lt;/strong&gt;：在较低产出水平时下降，在较高产出水平时上升。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;3.5 U 形成本曲线的形成机制：两种效应&lt;/h3&gt;
&lt;p&gt;ATC 曲线之所以呈 U 形，是因为产出增加对平均总成本有两种相互对立的影响：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 摊薄效应 (The Spreading Effect)
产出越大，固定成本被分摊到越多的产出单位上，导致&lt;strong&gt;平均固定成本 (AFC) 下降&lt;/strong&gt;。
→ 这解释了 ATC 曲线在低产出水平时&lt;strong&gt;下降&lt;/strong&gt;的原因。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 边际报酬递减效应 (The Diminishing Returns Effect)
产出越大，生产额外单位产出所需要的可变投入越多，导致&lt;strong&gt;平均可变成本 (AVC) 上升&lt;/strong&gt;。
→ 这解释了 ATC 曲线在高产出水平时&lt;strong&gt;上升&lt;/strong&gt;的原因。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点提示
U 形 ATC 曲线的形状并非偶然。在低产出水平，&quot;摊薄效应&quot;占主导 → ATC 下降；在高产出水平，&quot;边际报酬递减效应&quot;占主导 → ATC 上升。这两种效应的&lt;strong&gt;相对力量对比&lt;/strong&gt;决定了 ATC 曲线的走向。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;3.6 Selena&apos;s Gourmet Salsas 的平均成本&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;p&gt;以下是 Selena&apos;s Gourmet Salsas 的完整平均成本曲线：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;演讲者备注详细解释：&lt;strong&gt;最低平均总成本&lt;/strong&gt;出现在点 M，对应每天 3 箱辣酱的产出。在低产出水平，&quot;摊薄效应&quot;（AFC 下降）超过&quot;边际报酬递减效应&quot;（AVC 上升），ATC 下降。在高产出水平，情况正好相反，ATC 上升。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;4. 四大成本曲线的综合 (Putting the Four Cost Curves Together)&lt;/h2&gt;
&lt;h3&gt;4.1 曲线家族&lt;/h3&gt;
&lt;p&gt;现在将所有曲线画在同一张图中：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;p&gt;四条核心成本曲线的关系：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;MC (Marginal Cost)&lt;/strong&gt;：向上倾斜，反映边际报酬递减。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AVC (Average Variable Cost)&lt;/strong&gt;：也向上倾斜，但比 MC 平坦。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AFC (Average Fixed Cost)&lt;/strong&gt;：持续向下倾斜，反映摊薄效应。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ATC (Average Total Cost)&lt;/strong&gt;：U 形，是 AFC 与 AVC 的垂直加总。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;演讲者备注明确指出：ATC 曲线呈 U 形，MC 曲线在 U 形底部（点 M）与 ATC 相交，该点对应的是&lt;strong&gt;最低平均总成本 (minimum average total cost)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.2 核心原理：MC 与 ATC 的关系&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 边际成本与平均成本的关系（普适原理）
这是一条适用于&lt;strong&gt;所有企业&lt;/strong&gt;的通用法则：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;在 &lt;strong&gt;最低成本产出 (Minimum-Cost Output)&lt;/strong&gt; 处，ATC 最低，此时 &lt;strong&gt;MC = ATC&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;当产出&lt;strong&gt;低于&lt;/strong&gt;最低成本产出时：&lt;strong&gt;MC &amp;lt; ATC&lt;/strong&gt;，ATC 在下降。&lt;/li&gt;
&lt;li&gt;当产出&lt;strong&gt;高于&lt;/strong&gt;最低成本产出时：&lt;strong&gt;MC &amp;gt; ATC&lt;/strong&gt;，ATC 在上升。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 考点必考
这个关系与 GPA 的逻辑完全一致：如果你的边际成绩（本学期的 GPA）低于你的累计平均成绩，平均成绩就会被拉低；如果边际成绩高于平均，平均就会被拉高。&lt;strong&gt;MC 曲线必定从下方穿过 ATC 曲线的最低点&lt;/strong&gt;——这不是偶然，而是逻辑必然。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;4.3 直观理解&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;演讲者备注的精彩解释：为了理解为什么 MC 曲线必须穿过 ATC 曲线的最低点（点 M），我们观察 MC 与 ATC 不同时的两种情况。如果 MC &amp;lt; ATC，增加产出必定降低 ATC（如 A₁ → A₂ 的移动）。如果 MC &amp;gt; ATC，增加产出必定提高 ATC（如 B₁ → B₂ 的移动）。&lt;strong&gt;只有当 MC = ATC 时，ATC 既不上升也不下降——这正是 U 形底部的位置。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;5. 更现实的成本曲线 (More Realistic Cost Curves)&lt;/h2&gt;
&lt;h3&gt;5.1 边际成本曲线总是向上倾斜吗？&lt;/h3&gt;
&lt;p&gt;在实践中，边际成本曲线往往呈现 &lt;strong&gt;&quot;✔ Swoosh&quot; 形状&lt;/strong&gt;：在极低产出水平时先下降，然后在高产出水平时上升。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 为什么 MC 最初会下降？
当一个企业只雇佣极少数工人时，&lt;strong&gt;劳动专业化 (Specialization of Labor)&lt;/strong&gt; 的好处无法充分实现。随着工人数量增加：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;起初&lt;/strong&gt;：专业化程度提高 → &lt;strong&gt;报酬递增 (Increasing Returns)&lt;/strong&gt; → MC &lt;strong&gt;下降&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;之后&lt;/strong&gt;：专业化优势被耗尽 → &lt;strong&gt;报酬递减 (Diminishing Returns)&lt;/strong&gt; 开始作用 → MC &lt;strong&gt;上升&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这就是为何两个农民可以生产超出一个农民两倍的产量——专业化的力量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.2 更现实成本曲线的形态&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;演讲者备注强调：&quot;Swoosh&quot;形状的 MC 曲线和相应的 U 形 AVC 曲线才是更符合现实的情况。关键在于认识到&lt;strong&gt;专业化的好处可以在一开始产生报酬递增&lt;/strong&gt;，直到工人数量足够、专业化红利耗尽，报酬递减才开始主导。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;6. 短期成本 vs. 长期成本 (Short-Run versus Long-Run Costs)&lt;/h2&gt;
&lt;h3&gt;6.1 核心差异&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 短期与长期成本的根本区别&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;短期 (Short Run)&lt;/strong&gt;：固定成本 (Fixed Cost) 完全不受企业控制。企业只能在给定固定投入的条件下调整可变投入。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长期 (Long Run)&lt;/strong&gt;：&lt;strong&gt;所有投入都是可变的&lt;/strong&gt;，这意味着固定成本也成为了企业可以选择和调整的变量。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;企业会在长期中根据&lt;strong&gt;期望的产出水平&lt;/strong&gt;来选择最优的固定成本。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;6.2 固定成本的选择：权衡 (Trade-off)&lt;/h3&gt;
&lt;p&gt;企业在选择固定成本水平时面临一个基本权衡：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 高固定成本 vs. 低固定成本的权衡&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;高固定成本&lt;/strong&gt; → 通常意味着更低的可变成本（更高效的设备/更大的工厂 → 每单位产出使用的可变投入更少）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;低固定成本&lt;/strong&gt; → 通常意味着更高的可变成本&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;哪种选择更优，取决于企业期望的&lt;strong&gt;产出水平&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;演讲者备注的详细说明：$ATC_1$ 对应低固定成本（$108），$ATC_2$ 对应高固定成本（$216）但更低的可变成本。在低产出水平（4 箱或以下），$ATC_1$ 低于 $ATC_2$——固定成本低更有优势。但在高产出水平（超过 4 箱），$ATC_2$ 低于 $ATC_1$——高固定成本换来更低的可变成本，总成本反而更低。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;6.3 长期平均总成本曲线&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 长期平均总成本曲线 (Long-Run Average Total Cost Curve, LRATC)
展示了在&lt;strong&gt;固定成本已被选择为对每个产出水平最小化平均总成本&lt;/strong&gt;的前提下，产出与平均总成本之间的关系。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;演讲者备注解释了图中的三个重要点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;如果 Selena 选择对应于 6 箱产出的固定成本水平并实际生产 6 箱，她位于 $LRATC$ 和 $ATC_6$ 上的点 C。&lt;/li&gt;
&lt;li&gt;如果她只生产 3 箱，位于点 B（短期）；但如果她&lt;strong&gt;预期长期只生产&lt;/strong&gt; 3 箱，她会降低固定成本，移至 $ATC_3$ 上的点 A。&lt;/li&gt;
&lt;li&gt;同理，如果她生产 9 箱（点 Y）且预期持续，长期中她会增加固定成本，移至点 X。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;7. 规模报酬 (Returns to Scale)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 规模经济 / 规模报酬递增 (Increasing Returns to Scale / Economies of Scale)
当产出增加时，&lt;strong&gt;长期平均总成本下降&lt;/strong&gt;。
原因：更大规模允许&lt;strong&gt;更高程度的工人专业化&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 规模报酬不变 (Constant Returns to Scale)
当产出增加时，&lt;strong&gt;长期平均总成本保持不变&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 规模不经济 / 规模报酬递减 (Decreasing Returns to Scale / Diseconomies of Scale)
当产出增加时，&lt;strong&gt;长期平均总成本上升&lt;/strong&gt;。
原因：大规模组织带来的&lt;strong&gt;协调问题 (Coordination Problems)&lt;/strong&gt; 日益严重。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 区分两个&quot;递减&quot;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Diminishing Returns (边际报酬递减)&lt;/strong&gt;：是&lt;strong&gt;短期&lt;/strong&gt;概念——在固定投入不变时，增加可变投入导致边际产量下降。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Decreasing Returns to Scale (规模报酬递减)&lt;/strong&gt;：是&lt;strong&gt;长期&lt;/strong&gt;概念——所有投入同比例增加时，产出增加的比例小于投入增加的比例。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;两者机制不同，不可混淆！前者源于固定投入的瓶颈，后者源于组织的协调困难。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;8. 本章总结 (Summary)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;8.1 生产函数与成本基础&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;生产函数 (Production Function)&lt;/strong&gt; 描述了投入与产出之间的关系。&lt;/li&gt;
&lt;li&gt;短期中，固定投入不可变，可变投入可变；长期中，所有投入皆可变。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总产量曲线 (Total Product Curve)&lt;/strong&gt; 展示可变投入与产出的关系。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;8.2 边际报酬递减与成本结构&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_32.png&quot; alt=&quot;slide 32&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;当边际产量随投入增加而下降时，存在 &lt;strong&gt;边际报酬递减 (Diminishing Returns)&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总成本 (Total Cost)&lt;/strong&gt; = 固定成本 (Fixed Cost) + 可变成本 (Variable Cost)。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;8.3 平均成本与边际成本&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_33.png&quot; alt=&quot;slide 33&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;平均总成本 (ATC)&lt;/strong&gt; = TC / Q；&lt;strong&gt;边际成本 (MC)&lt;/strong&gt; = 额外一单位产出的成本。&lt;/li&gt;
&lt;li&gt;U 形 ATC 曲线由两部分构成：
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;AFC&lt;/strong&gt;：随产出增加而下降（摊薄效应，Spreading Effect）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AVC&lt;/strong&gt;：随产出增加而上升（边际报酬递减效应，Diminishing Returns Effect）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;8.4 最低成本产出&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_34.png&quot; alt=&quot;slide 34&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;U 形 ATC 曲线的最低点即为 &lt;strong&gt;最低成本产出 (Minimum-Cost Output)&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;在该点，&lt;strong&gt;MC = ATC&lt;/strong&gt;，且 MC 曲线从下方穿过 ATC 曲线。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;8.5 长期成本与规模报酬&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_35.png&quot; alt=&quot;slide 35&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;长期中，企业可以改变固定投入和固定成本水平。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长期平均总成本曲线 (LRATC)&lt;/strong&gt; 展示最优固定成本选择下的成本关系。&lt;/li&gt;
&lt;li&gt;三种规模报酬：
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;规模报酬递增 (Increasing Returns to Scale)&lt;/strong&gt;：LRATC 下降。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;规模报酬不变 (Constant Returns to Scale)&lt;/strong&gt;：LRATC 不变。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;规模报酬递减 (Decreasing Returns to Scale)&lt;/strong&gt;：LRATC 上升。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;9. 关键术语 (Key Terms)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_36.png&quot; alt=&quot;slide 36&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;th&gt;中文翻译&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Production Function&lt;/td&gt;
&lt;td&gt;生产函数&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fixed Input&lt;/td&gt;
&lt;td&gt;固定投入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Variable Input&lt;/td&gt;
&lt;td&gt;可变投入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long Run&lt;/td&gt;
&lt;td&gt;长期&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Short Run&lt;/td&gt;
&lt;td&gt;短期&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Product Curve&lt;/td&gt;
&lt;td&gt;总产量曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Marginal Product&lt;/td&gt;
&lt;td&gt;边际产量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Diminishing Returns to an Input&lt;/td&gt;
&lt;td&gt;投入的边际报酬递减&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fixed Cost&lt;/td&gt;
&lt;td&gt;固定成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Variable Cost&lt;/td&gt;
&lt;td&gt;可变成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Cost&lt;/td&gt;
&lt;td&gt;总成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Cost Curve&lt;/td&gt;
&lt;td&gt;总成本曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Average Total Cost / Average Cost&lt;/td&gt;
&lt;td&gt;平均总成本 / 平均成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;U-shaped Average Total Cost Curve&lt;/td&gt;
&lt;td&gt;U 形平均总成本曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Average Fixed Cost&lt;/td&gt;
&lt;td&gt;平均固定成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Average Variable Cost&lt;/td&gt;
&lt;td&gt;平均可变成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Minimum-Cost Output&lt;/td&gt;
&lt;td&gt;最低成本产出&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long-Run Average Total Cost Curve&lt;/td&gt;
&lt;td&gt;长期平均总成本曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Increasing Returns to Scale&lt;/td&gt;
&lt;td&gt;规模报酬递增&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decreasing Returns to Scale&lt;/td&gt;
&lt;td&gt;规模报酬递减&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Constant Returns to Scale&lt;/td&gt;
&lt;td&gt;规模报酬不变&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课后思考&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;为什么 MC 曲线必定穿过 ATC 曲线的最低点？请用 GPA 类比解释。&lt;/li&gt;
&lt;li&gt;短期中的 Diminishing Returns 与长期中的 Decreasing Returns to Scale 有何本质区别？&lt;/li&gt;
&lt;li&gt;一家企业在选择高固定成本还是低固定成本时，应考虑哪些因素？&lt;/li&gt;
&lt;li&gt;&quot;Swoosh&quot;形 MC 曲线（先降后升）与标准的始终向上倾斜的 MC 曲线，各自的前提假设是什么？&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>ECO2011 C5：Elasticity（弹性）</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c5-elasticity/chapter_6_elasticity/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c5-elasticity/chapter_6_elasticity/</guid><pubDate>Mon, 15 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 6: Elasticity（弹性）&lt;/h1&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;本章学习目标 (What You Will Learn in This Chapter)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;p&gt;本章围绕经济学中一个核心工具——&lt;strong&gt;弹性 (Elasticity)&lt;/strong&gt; 展开。弹性是衡量一个经济变量对另一个经济变量变化反应程度的通用指标。通过本章的学习，你将掌握以下核心问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;弹性的定义是什么？为什么经济学家使用弹性来衡量对价格或收入变化的反应程度？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;需求的价格弹性 (Price Elasticity of Demand)&lt;/strong&gt; 的含义与重要性。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;需求的收入弹性 (Income Elasticity of Demand)&lt;/strong&gt; 的含义与重要性。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;供给的价格弹性 (Price Elasticity of Supply)&lt;/strong&gt; 的含义与重要性。&lt;/li&gt;
&lt;li&gt;哪些因素会影响上述各类弹性的大小？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;需求的交叉价格弹性 (Cross-Price Elasticity of Demand)&lt;/strong&gt; 如何衡量一种商品的需求对另一种商品价格变化的反应程度。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;一、需求的价格弹性 (Price Elasticity of Demand)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_2.png&quot; alt=&quot;slide 2&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;1.1 弹性的直观理解&lt;/h3&gt;
&lt;p&gt;在经济学中，我们知道价格与需求量之间存在反向关系（需求定律, Law of Demand）。但一个关键问题是：&lt;strong&gt;当价格变动时，需求量到底会变多少？&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 弹性 (Elastic) vs. 非弹性 (Inelastic)&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;如果一条需求曲线是 &lt;strong&gt;elastic（富有弹性）&lt;/strong&gt; 的，那么价格的上升会导致需求量&lt;strong&gt;大幅&lt;/strong&gt;减少（反之亦然）。&lt;/li&gt;
&lt;li&gt;如果一条需求曲线是 &lt;strong&gt;inelastic（缺乏弹性）&lt;/strong&gt; 的，那么同样的价格上升只会导致需求量&lt;strong&gt;略微&lt;/strong&gt;减少。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;换句话说，弹性衡量的是消费者对价格变化的&lt;strong&gt;敏感程度&lt;/strong&gt;。&lt;/p&gt;
&lt;h3&gt;1.2 正式定义&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 需求的价格弹性 (Price Elasticity of Demand)
需求的价格弹性是需求量变动的百分比与价格变动的百分比之间的比率（在沿需求曲线移动时，我们省略负号，取绝对值）。&lt;/p&gt;
&lt;p&gt;[
\text{Price Elasticity of Demand} = \frac{%\ \text{Change in Quantity Demanded}}{%\ \text{Change in Price}}
]&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;1.3 一个具体例子：疫苗接种需求&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;&lt;/p&gt;
&lt;p&gt;以疫苗接种为例：当每支疫苗的价格为 $20 时，全球年需求量为 1000 万支（点 A）。当价格上升到 $21 时，需求量下降到 990 万支（点 B）。价格仅上涨了 $1，需求量就减少了 10 万支——这个变化是大还是小？弹性给了我们一个标准化的衡量方式。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;二、弹性的计算：中点法 (The Midpoint Method)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在计算百分比变化时，一个常见的问题是：从 A 点到 B 点计算的百分比变化，与从 B 点到 A 点计算的百分比变化不同。为了解决这个问题，经济学家使用&lt;strong&gt;中点法 (Midpoint Method)&lt;/strong&gt;。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 中点法 (Midpoint Method)
中点法是一种计算百分比变化的技术。在这种方法中，我们用变量的&lt;strong&gt;初始值和最终值的平均值（即中点）&lt;/strong&gt; 作为分母来计算百分比变化。&lt;/p&gt;
&lt;p&gt;$[%\ \text{Change in } X = \frac{\text{Change in } X}{\text{Average Value of } X} \times 100%]$&lt;/p&gt;
&lt;p&gt;其中，$(\text{Average Value of } X = \frac{\text{Starting Value + Final Value}}{2})$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;p&gt;使用中点法，无论从哪个方向计算，弹性值都保持一致，这使其成为经济学中计算弹性的标准方法。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;三、需求价格弹性的实际估算值&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;p&gt;下表展示了一些常见商品的估计需求价格弹性：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Good（商品）&lt;/th&gt;
&lt;th&gt;Price Elasticity of Demand（需求价格弹性）&lt;/th&gt;
&lt;th&gt;类型&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Inelastic Demand（缺乏弹性）&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;弹性 &amp;lt; 1&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Eggs（鸡蛋）&lt;/td&gt;
&lt;td&gt;0.1&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Beef（牛肉）&lt;/td&gt;
&lt;td&gt;0.4&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Stationery（文具）&lt;/td&gt;
&lt;td&gt;0.5&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gasoline（汽油）&lt;/td&gt;
&lt;td&gt;0.5&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Elastic Demand（富有弹性）&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;弹性 &amp;gt; 1&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Housing（住房）&lt;/td&gt;
&lt;td&gt;1.2&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Restaurant meals（餐厅就餐）&lt;/td&gt;
&lt;td&gt;2.3&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Airline travel（航空旅行）&lt;/td&gt;
&lt;td&gt;2.4&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Foreign travel（出国旅行）&lt;/td&gt;
&lt;td&gt;4.1&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 关键判断标准&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Price elasticity of demand &amp;lt; 1&lt;/strong&gt;：需求是 &lt;strong&gt;inelastic（缺乏弹性）&lt;/strong&gt; 的。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Price elasticity of demand &amp;gt; 1&lt;/strong&gt;：需求是 &lt;strong&gt;elastic（富有弹性）&lt;/strong&gt; 的。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Price elasticity of demand = 1&lt;/strong&gt;：需求是 &lt;strong&gt;unit-elastic（单位弹性）&lt;/strong&gt; 的。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;四、两种极端情况 (Two Extreme Cases)&lt;/h2&gt;
&lt;h3&gt;4.1 完全非弹性需求 (Perfectly Inelastic Demand)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 完全非弹性需求 (Perfectly Inelastic Demand)
当需求量完全不随价格变化而变化时，需求是 &lt;strong&gt;perfectly inelastic&lt;/strong&gt; 的。此时需求曲线是一条&lt;strong&gt;垂直线 (vertical line)&lt;/strong&gt;，价格弹性为 &lt;strong&gt;0&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;以鞋带为例（如 Panel a 所示）：无论鞋带的价格是 $2 还是 $3，消费者每年始终购买 10 亿双鞋带。价格上升对需求量完全没有影响——这就是 perfectly inelastic demand。&lt;/p&gt;
&lt;h3&gt;4.2 完全弹性需求 (Perfectly Elastic Demand)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 完全弹性需求 (Perfectly Elastic Demand)
当任何价格上涨都会使需求量降为零时，需求是 &lt;strong&gt;perfectly elastic&lt;/strong&gt; 的。此时需求曲线是一条&lt;strong&gt;水平线 (horizontal line)&lt;/strong&gt;，价格弹性为 &lt;strong&gt;∞（无穷大）&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;以粉色网球为例（如 Panel b 所示）：在恰好 $5 的价格下，消费者愿意购买任意数量的粉色网球；但如果价格超过 $5，需求量立即降为零；如果价格低于 $5，消费者会购买极大数量的粉色网球而完全不买其他颜色的球。这说明当商品存在完美替代品时，需求是 perfectly elastic 的。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;五、弹性需求、单位弹性需求与非弹性需求&lt;/h2&gt;
&lt;h3&gt;5.1 单位弹性需求 (Unit-Elastic Demand)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 单位弹性需求 (Unit-Elastic Demand)
当价格弹性 &lt;strong&gt;恰好等于 1&lt;/strong&gt; 时，需求是 &lt;strong&gt;unit-elastic&lt;/strong&gt; 的。此时价格变动的百分比恰好等于需求量变动的百分比。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;以过桥通行费为例：价格从 $0.90 上涨 20% 到 $1.10，过桥需求量也从 1,100 下降到 900，恰好下降 20%（使用中点法计算）。这就是 unit-elastic demand。&lt;/p&gt;
&lt;h3&gt;5.2 非弹性需求 (Inelastic Demand)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 非弹性需求 (Inelastic Demand)
当价格弹性 &lt;strong&gt;小于 1&lt;/strong&gt; 时，需求是 &lt;strong&gt;inelastic&lt;/strong&gt; 的。此时需求量变动的百分比&lt;strong&gt;小于&lt;/strong&gt;价格变动的百分比。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如 Panel (b) 所示：价格同样上涨 20%，但需求量只下降了 10%（从 1,050 到 950）。弹性为 0.5，属于 inelastic demand。这意味着消费者对价格变化相对不敏感。&lt;/p&gt;
&lt;h3&gt;5.3 弹性需求 (Elastic Demand)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 弹性需求 (Elastic Demand)
当价格弹性 &lt;strong&gt;大于 1&lt;/strong&gt; 时，需求是 &lt;strong&gt;elastic&lt;/strong&gt; 的。此时需求量变动的百分比&lt;strong&gt;大于&lt;/strong&gt;价格变动的百分比。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如 Panel (c) 所示：价格上涨 20%，需求量却下降了 40%（从 1,200 到 800）。弹性为 2，属于 elastic demand。消费者对价格变化非常敏感。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;六、弹性与总收益 (Elasticity and Total Revenue)&lt;/h2&gt;
&lt;h3&gt;6.1 为什么要关心弹性的分类？&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 核心问题
为什么区分 unit-elastic、inelastic 和 elastic 需求如此重要？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;答案&lt;/strong&gt;：因为这种分类可以预测商品价格的变化将如何影响生产者从销售该商品中获得的 &lt;strong&gt;总收益 (Total Revenue)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 总收益 (Total Revenue)
总收益定义为销售一种商品或服务的总价值：
Total Revenue = Price × Quantity Sold&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;p&gt;上图绿色矩形区域代表了在价格为 $0.90、通行量为 1,100 时的总收益：$0.90 × 1,100 = $990。&lt;/p&gt;
&lt;h3&gt;6.2 价格效应与数量效应&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当卖家提高商品价格时，有两个相互抵消的效应在起作用（除非商品具有 perfectly elastic 或 perfectly inelastic 的需求）：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 两种效应&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;价格效应 (Price Effect)&lt;/strong&gt;：价格上涨后，每售出一单位商品的价格更高，这倾向于&lt;strong&gt;增加&lt;/strong&gt;总收益。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;数量效应 (Quantity Effect)&lt;/strong&gt;：价格上涨后，售出的商品数量减少，这倾向于&lt;strong&gt;减少&lt;/strong&gt;总收益。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;最终总收益是增加还是减少，取决于价格弹性——即哪种效应更强。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如上图 Figure 6-4(b) 所示：价格从 $0.90 上涨到 $1.10。数量效应使总收益减少面积 A，价格效应使总收益增加面积 C。总体效果取决于需求的价格弹性。&lt;/p&gt;
&lt;h3&gt;6.3 弹性分类与总收益的关系&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 关键结论（考试重点）&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;需求类型&lt;/th&gt;
&lt;th&gt;弹性值&lt;/th&gt;
&lt;th&gt;涨价对总收益的影响&lt;/th&gt;
&lt;th&gt;主导效应&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Elastic（富有弹性）&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&amp;gt; 1&lt;/td&gt;
&lt;td&gt;总收益 &lt;strong&gt;减少&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;数量效应 &amp;gt; 价格效应&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Inelastic（缺乏弹性）&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&amp;lt; 1&lt;/td&gt;
&lt;td&gt;总收益 &lt;strong&gt;增加&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;价格效应 &amp;gt; 数量效应&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Unit-Elastic（单位弹性）&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;= 1&lt;/td&gt;
&lt;td&gt;总收益 &lt;strong&gt;不变&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;两种效应恰好抵消&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;p&gt;上图直观展示了两种情况的对比：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Inelastic demand 情形&lt;/strong&gt;：价格从 $4 涨到 $5（上涨 25%），需求量仅从 100 降到 90（下降 10%），总收益从 $400 &lt;strong&gt;增加到&lt;/strong&gt; $450。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Elastic demand 情形&lt;/strong&gt;：价格同样从 $4 涨到 $5，需求量却从 100 剧降到 70（下降 30%），总收益从 $400 &lt;strong&gt;减少到&lt;/strong&gt; $350。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;6.4 沿线性需求曲线的弹性变化&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 重要洞察
&lt;strong&gt;需求的价格弹性沿需求曲线是变化的&lt;/strong&gt;——即使是在一条直线上也是如此。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;下表中的数据来自一条线性需求曲线 (Linear Demand Curve)：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Price（价格）&lt;/th&gt;
&lt;th&gt;Quantity Demanded（需求量）&lt;/th&gt;
&lt;th&gt;Total Revenue（总收益）&lt;/th&gt;
&lt;th&gt;弹性区间&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$0&lt;/td&gt;
&lt;td&gt;10&lt;/td&gt;
&lt;td&gt;$0&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1&lt;/td&gt;
&lt;td&gt;9&lt;/td&gt;
&lt;td&gt;$9&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$2&lt;/td&gt;
&lt;td&gt;8&lt;/td&gt;
&lt;td&gt;$16&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$3&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;$21&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$4&lt;/td&gt;
&lt;td&gt;6&lt;/td&gt;
&lt;td&gt;$24&lt;/td&gt;
&lt;td&gt;Elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$5&lt;/td&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;td&gt;$25&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Unit-Elastic&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$6&lt;/td&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;td&gt;$24&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$7&lt;/td&gt;
&lt;td&gt;3&lt;/td&gt;
&lt;td&gt;$21&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$8&lt;/td&gt;
&lt;td&gt;2&lt;/td&gt;
&lt;td&gt;$16&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$9&lt;/td&gt;
&lt;td&gt;1&lt;/td&gt;
&lt;td&gt;$9&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$10&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;$0&lt;/td&gt;
&lt;td&gt;Inelastic&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;从表中可以看出：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;在低价区域&lt;/strong&gt;，需求是 inelastic 的——提高价格会使总收益增加（因为数量效应较弱）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;在高价区域&lt;/strong&gt;，需求是 elastic 的——提高价格反而会减少总收益（因为数量效应较强）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;在中间某点&lt;/strong&gt;（本例中 P=$5, Q=5），需求是 unit-elastic 的，总收益达到最大值 $25。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;七、影响需求价格弹性的因素&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 决定需求价格弹性的四大因素&lt;/p&gt;
&lt;/blockquote&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;因素&lt;/th&gt;
&lt;th&gt;说明&lt;/th&gt;
&lt;th&gt;弹性变化方向&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;是否存在近似替代品 (Close Substitutes)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;替代品越多，消费者越容易转向其他选择&lt;/td&gt;
&lt;td&gt;替代品多 → &lt;strong&gt;更 elastic&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;必需品 vs. 奢侈品 (Necessity vs. Luxury)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;必需品无论价格如何都要购买，奢侈品则可以推迟或放弃&lt;/td&gt;
&lt;td&gt;必需品 → &lt;strong&gt;更 inelastic&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;占收入的比例 (Share of Income)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;花费占比越大，消费者对价格越敏感&lt;/td&gt;
&lt;td&gt;占比大 → &lt;strong&gt;更 elastic&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;调整时间 (Time to Adjust)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;时间越长，消费者越能找到替代方案&lt;/td&gt;
&lt;td&gt;时间长 → &lt;strong&gt;更 elastic&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 经典案例：巴厘岛度假 (Vacations in Bali)
巴厘岛度假是 &lt;strong&gt;highly price elastic&lt;/strong&gt; 的经典例子，因为它同时满足四个条件：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;有很多替代品&lt;/strong&gt;（可以去泰国、马尔代夫、夏威夷等）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;不是必需品&lt;/strong&gt;（奢侈品消费）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;非常昂贵&lt;/strong&gt;（占收入比例大）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;需要长时间规划&lt;/strong&gt;（消费者有充分时间调整）&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;八、其他需求弹性 (Other Demand Elasticities)&lt;/h2&gt;
&lt;h3&gt;8.1 需求的交叉价格弹性 (Cross-Price Elasticity of Demand)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 交叉价格弹性 (Cross-Price Elasticity of Demand)
交叉价格弹性衡量的是&lt;strong&gt;一种商品价格的变动对另一种商品需求量的影响&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;$[\text{Cross-Price Elasticity of Demand} = \frac{%\ \text{Change in Quantity of Good A Demanded}}{%\ \text{Change in Price of Good B}}]$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 交叉弹性的符号含义（考试重点）&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;替代品 (Substitutes)&lt;/strong&gt;：交叉价格弹性为 &lt;strong&gt;正 (+)&lt;/strong&gt; —— B 商品涨价，A 商品的需求量上升。
&lt;ul&gt;
&lt;li&gt;例：某品牌饼干涨价 → 其他品牌饼干需求增加。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;互补品 (Complements)&lt;/strong&gt;：交叉价格弹性为 &lt;strong&gt;负 (−)&lt;/strong&gt; —— B 商品涨价，A 商品的需求量下降。
&lt;ul&gt;
&lt;li&gt;例：牛奶涨价 → 对饼干（搭配牛奶食用）的需求下降。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;8.2 需求的收入弹性 (Income Elasticity of Demand)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 收入弹性 (Income Elasticity of Demand)
收入弹性衡量的是消费者收入变动对商品需求量的影响。&lt;/p&gt;
&lt;p&gt;$[\text{Income Elasticity of Demand} = \frac{%\ \text{Change in Quantity Demanded}}{%\ \text{Change in Income}}]$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 收入弹性的符号含义（考试重点）&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;正收入弹性 (Positive)&lt;/strong&gt;：该商品是 &lt;strong&gt;normal good（正常商品）&lt;/strong&gt; ——收入增加，需求增加。
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Income-elastic（富有收入弹性）&lt;/strong&gt;：收入弹性 &amp;gt; 1（如奢侈品）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Income-inelastic（缺乏收入弹性）&lt;/strong&gt;：收入弹性在 0 到 1 之间（如生活必需品）。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;负收入弹性 (Negative)&lt;/strong&gt;：该商品是 &lt;strong&gt;inferior good（低档商品）&lt;/strong&gt; ——收入增加，需求反而减少（如方便面、公共交通等）。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;九、供给的价格弹性 (Price Elasticity of Supply)&lt;/h2&gt;
&lt;h3&gt;9.1 定义&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 供给的价格弹性 (Price Elasticity of Supply)
供给的价格弹性衡量的是商品供给量对该商品价格变化的反应程度。&lt;/p&gt;
&lt;p&gt;$[\text{Price Elasticity of Supply} = \frac{%\ \text{Change in Quantity Supplied}}{%\ \text{Change in Price}}]$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;9.2 单位弹性供给示例&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
&lt;p&gt;供给弹性决定了供给曲线是陡峭还是平坦。在单位弹性供给的例子中，价格上升 22%（使用中点法），供给量也恰好上升 22%，弹性等于 1。&lt;/p&gt;
&lt;h3&gt;9.3 两种极端情况&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_32.png&quot; alt=&quot;slide 32&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_33.png&quot; alt=&quot;slide 33&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 完全非弹性供给 (Perfectly Inelastic Supply)&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;价格弹性 = &lt;strong&gt;0&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;供给曲线为&lt;strong&gt;垂直线 (vertical line)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;无论价格如何变化，供给量始终不变&lt;/li&gt;
&lt;li&gt;经典例子：&lt;strong&gt;手机通信频段 (cell phone frequencies)&lt;/strong&gt;——频段的数量由政府牌照决定，不随价格变化；&lt;strong&gt;土地 (land)&lt;/strong&gt; 的供给也是固定的。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 完全弹性供给 (Perfectly Elastic Supply)&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;价格弹性 = &lt;strong&gt;∞（无穷大）&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;供给曲线为&lt;strong&gt;水平线 (horizontal line)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;在某一特定价格下，生产者愿意供给任意数量；低于该价格则供给量为零&lt;/li&gt;
&lt;li&gt;经典例子：&lt;strong&gt;MP3 歌曲文件的复制品&lt;/strong&gt;——在 $12 的价格下，可以无限量供应数字拷贝。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;9.4 影响供给弹性的因素&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_34.png&quot; alt=&quot;slide 34&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 决定供给价格弹性的两大因素&lt;/p&gt;
&lt;/blockquote&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;因素&lt;/th&gt;
&lt;th&gt;说明&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;投入品的可获得性 (Availability of Inputs)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;当投入品容易获得且能以较低成本转移进出生产时，供给弹性较大；当投入品难以获取时，供给弹性较小。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;时间 (Time)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;生产者对价格变化做出反应的时间越长，供给弹性越大。&lt;strong&gt;长期供给弹性 (long-run price elasticity of supply) 通常高于短期弹性 (short-run elasticity)&lt;/strong&gt;。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;9.5 供给弹性沿供给曲线的变化&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_35.png&quot; alt=&quot;slide 35&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 产能限制与弹性变化
企业通常有最大产能限制。在&lt;strong&gt;低产量水平&lt;/strong&gt;，供给弹性可能很高（企业有大量闲置产能可以快速启用）；但在&lt;strong&gt;高产量水平&lt;/strong&gt;，当企业接近产能极限时，进一步增加产量变得非常困难，供给弹性会显著下降。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;如图所示：在低价低产量区间（$3-$4），弹性大于 1；而在高价高产量区间（$12-$15），弹性远小于 1，因为企业已经接近最大产能。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;十、弹性全景图 (An Elasticity Menagerie)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_36.png&quot; alt=&quot;slide 36&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_37.png&quot; alt=&quot;slide 37&quot; /&gt;&lt;/p&gt;
&lt;p&gt;下表总结了本章涵盖的所有弹性概念：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;弹性类型&lt;/th&gt;
&lt;th&gt;公式&lt;/th&gt;
&lt;th&gt;正/负含义&lt;/th&gt;
&lt;th&gt;极端情况&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price Elasticity of Demand&lt;/strong&gt;（需求价格弹性）&lt;/td&gt;
&lt;td&gt;$(\frac{%\Delta Q_D}{%\Delta P})$&lt;/td&gt;
&lt;td&gt;取绝对值；&amp;gt;1 elastic, &amp;lt;1 inelastic, =1 unit-elastic&lt;/td&gt;
&lt;td&gt;0 = perfectly inelastic, ∞ = perfectly elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Cross-Price Elasticity of Demand&lt;/strong&gt;（需求交叉价格弹性）&lt;/td&gt;
&lt;td&gt;$(\frac{%\Delta Q_{D(A)}}{%\Delta P_B})$&lt;/td&gt;
&lt;td&gt;正 = substitutes（替代品）; 负 = complements（互补品）&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Income Elasticity of Demand&lt;/strong&gt;（需求收入弹性）&lt;/td&gt;
&lt;td&gt;$(\frac{%\Delta Q_D}{%\Delta \text{Income}})$&lt;/td&gt;
&lt;td&gt;正 = normal good; 负 = inferior good&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price Elasticity of Supply&lt;/strong&gt;（供给价格弹性）&lt;/td&gt;
&lt;td&gt;$(\frac{%\Delta Q_S}{%\Delta P})$&lt;/td&gt;
&lt;td&gt;始终为正（供给定律）&lt;/td&gt;
&lt;td&gt;0 = perfectly inelastic, ∞ = perfectly elastic&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;h2&gt;十一、本章小结 (Chapter Summary)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_38.png&quot; alt=&quot;slide 38&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_39.png&quot; alt=&quot;slide 39&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_40.png&quot; alt=&quot;slide 40&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_41.png&quot; alt=&quot;slide 41&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_42.png&quot; alt=&quot;slide 42&quot; /&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;弹性 (Elasticity)&lt;/strong&gt; 是一个衡量反应程度的通用指标，用于回答&quot;一个变量对另一个变量的变化有多敏感&quot;这类问题。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;需求的价格弹性 (Price Elasticity of Demand)&lt;/strong&gt; 等于需求量变动的百分比除以价格变动的百分比（省略负号），衡量的是需求量对价格变化的反应程度。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;需求对价格的反应程度可以从 &lt;strong&gt;perfectly inelastic demand&lt;/strong&gt;（需求量完全不受价格影响，需求曲线为垂直线）到 &lt;strong&gt;perfectly elastic demand&lt;/strong&gt;（存在唯一价格使消费者购买任意数量，需求曲线为水平线）。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;需求价格弹性根据大于或小于 1 来分类：大于 1 为 &lt;strong&gt;elastic&lt;/strong&gt;，小于 1 为 &lt;strong&gt;inelastic&lt;/strong&gt;，等于 1 为 &lt;strong&gt;unit-elastic&lt;/strong&gt;。这一分类决定了 &lt;strong&gt;总收益 (Total Revenue)&lt;/strong&gt; 如何随价格变化而变化。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;需求价格弹性取决于四个因素：&lt;strong&gt;近似替代品的存在与否、商品是必需品还是奢侈品、商品支出占收入的比例、以及价格变动后经过的时间长短&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;交叉价格弹性 (Cross-Price Elasticity of Demand)&lt;/strong&gt; 衡量一种商品价格变化对另一种商品需求量的影响。正值为替代品，负值为互补品。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;收入弹性 (Income Elasticity of Demand)&lt;/strong&gt; 等于需求量变动的百分比除以收入变动的百分比。收入弹性大于 1 为 income-elastic，介于 0 到 1 之间为 income-inelastic，负值代表 inferior good。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;供给的价格弹性 (Price Elasticity of Supply)&lt;/strong&gt; 等于供给量变动的百分比除以价格变动的百分比。&lt;strong&gt;Perfectly inelastic supply&lt;/strong&gt;（供给曲线为垂直线）和 &lt;strong&gt;perfectly elastic supply&lt;/strong&gt;（供给曲线为水平线）是两个极端情况。供给弹性取决于：(1) 扩大生产所需资源的可获得性；(2) 时间——投入品越容易以低成本获得、距价格变动的时间越长，供给弹性越高。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;hr /&gt;
&lt;h2&gt;十二、关键术语 (Key Terms)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_43.png&quot; alt=&quot;slide 43&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;th&gt;中文翻译&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price elasticity of demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;需求的价格弹性&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Midpoint method&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;中点法&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Perfectly inelastic demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;完全非弹性需求&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Perfectly elastic demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;完全弹性需求&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Elastic demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;富有弹性需求&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Inelastic demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;缺乏弹性需求&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Unit-elastic demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;单位弹性需求&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Total revenue&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;总收益&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Cross-price elasticity of demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;需求的交叉价格弹性&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Income elasticity of demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;需求的收入弹性&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Income-elastic demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;富有收入弹性需求&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Income-inelastic demand&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;缺乏收入弹性需求&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price elasticity of supply&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;供给的价格弹性&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Perfectly inelastic supply&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;完全非弹性供给&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Perfectly elastic supply&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;完全弹性供给&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
</content:encoded></item><item><title>ECO2011 C6：Taxes</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c6-taxes/chapter_7_taxes/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c6-taxes/chapter_7_taxes/</guid><pubDate>Mon, 15 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 7 — Taxes（税收）&lt;/h1&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 本章学习目标 (What You Will Learn)&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;税收对竞争市场中供需的影响&lt;/li&gt;
&lt;li&gt;谁真正承担税负（Tax Incidence）的决定因素&lt;/li&gt;
&lt;li&gt;税收的成本与收益，以及为何税收造成的社会成本大于其征收的税收收入&lt;/li&gt;
&lt;li&gt;Progressive tax（累进税）与 Regressive tax（累退税）的区别，以及 Tax Equity（税收公平）与 Tax Efficiency（税收效率）之间的权衡&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;1. 税收经济学基础 (The Economics of Taxes: A Preliminary View)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;1.1 Excise Tax（消费税/从量税）&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义：Excise Tax
An &lt;strong&gt;excise tax&lt;/strong&gt; is a tax on sales of a good or service.（消费税是对商品或服务销售征收的税。）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;常见的 Excise Tax 例子：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;对酒店住宿征收的税（由住客支付）&lt;/li&gt;
&lt;li&gt;对酒类销售征收的税（由零售店支付）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;税收在买方支付的价格 (price buyers pay) 与卖方收到的价格 (price sellers receive) 之间打入了一个 &lt;strong&gt;wedge（楔子）&lt;/strong&gt;：买方需要支付更多，而卖方实际收到更少。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义：Tax Incidence（税收归宿/税负承担）
&lt;strong&gt;Tax incidence&lt;/strong&gt; is a measure of who bears the burden for a tax — who really pays for the tax.（税收归宿衡量的是谁真正承担了税收负担。）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h3&gt;1.2 酒店房间市场的供需模型&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在没有税收的情况下，酒店房间的均衡价格 (equilibrium price) 为每晚 &lt;strong&gt;$80&lt;/strong&gt;，均衡数量 (equilibrium quantity) 为每晚 &lt;strong&gt;10,000 间&lt;/strong&gt;（点 E）。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;供给曲线 S 展示了在任意给定价格下（税前）的供给量&lt;/li&gt;
&lt;li&gt;当价格为 $60/晚时，酒店业主愿意提供 5,000 间房（点 B）&lt;/li&gt;
&lt;li&gt;但在征税后，酒店业主只有在收到 $100 时才愿意提供同样的 5,000 间：其中 $60 归自己，$40 作为税款交给市政府&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;2. Tax Incidence（税收归宿）&lt;/h2&gt;
&lt;h3&gt;2.1 对酒店业主征收 Excise Tax&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当对酒店业主征收 &lt;strong&gt;$40/间&lt;/strong&gt; 的 Excise Tax 时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;供给曲线向上平移&lt;/strong&gt;，平移幅度等于税额&lt;/li&gt;
&lt;li&gt;均衡价格从 $80 上升至 &lt;strong&gt;$100&lt;/strong&gt;（消费者支付）&lt;/li&gt;
&lt;li&gt;均衡数量从 10,000 下降至 &lt;strong&gt;5,000&lt;/strong&gt; 间&lt;/li&gt;
&lt;li&gt;酒店客人承担部分税负：价格从 $80 上涨至 $100&lt;/li&gt;
&lt;li&gt;酒店业主也承担部分税负：税后净收入从 $80 降至 &lt;strong&gt;$60&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;$40 的税负由买卖双方共同分担&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2.2 对酒店客人征收 Excise Tax&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当改为对酒店客人征收同样的 $40/间税收时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;需求曲线向下平移&lt;/strong&gt;，平移幅度等于税额&lt;/li&gt;
&lt;li&gt;均衡价格降至 $60（酒店收到的价格）&lt;/li&gt;
&lt;li&gt;数量同样降至 5,000 间&lt;/li&gt;
&lt;li&gt;酒店客人依然承担税负：实际支付 $100（$60 房费 + $40 税费）&lt;/li&gt;
&lt;li&gt;酒店业主依然承担税负：净收入从 $80 降至 $60&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 关键结论
&lt;strong&gt;The incidence of an excise tax doesn&apos;t depend on who officially pays the tax.&lt;/strong&gt;（税收归宿不取决于谁在法律上支付税款。）无论是对生产者征税还是对消费者征税，最终结果相同。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] Active Learning Practice (Slide 7)
&lt;img src=&quot;Assets/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;
如果 A 是买方价格，B 是卖方价格，图中每单位征收的税额是多少？&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;A. $5&lt;/li&gt;
&lt;li&gt;B. $10&lt;/li&gt;
&lt;li&gt;C. $15&lt;/li&gt;
&lt;li&gt;D. $50&lt;/li&gt;
&lt;li&gt;E. $1,000&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h3&gt;2.3 弹性决定税收归宿 (Elasticity Determines Tax Incidence)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心原理
谁真正承担税负（以消费者支付更高价格或生产者收到更低价格的形式）&lt;strong&gt;并不取决于谁在法律上支付税款&lt;/strong&gt;。根据供需曲线的形状（即弹性），Excise Tax 的归宿可能以不同方式分配。&lt;/p&gt;
&lt;p&gt;供需价格之间的 wedge 成为政府的 &lt;strong&gt;tax revenue（税收收入）&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;消费者承担大部分税负&lt;/h4&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当 &lt;strong&gt;需求价格弹性 (price elasticity of demand) 低&lt;/strong&gt; 而 &lt;strong&gt;供给价格弹性 (price elasticity of supply) 高&lt;/strong&gt; 时，税负主要由消费者承担：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;以汽油市场为例：汽油需求曲线较陡（低弹性），供给曲线较平（高弹性）&lt;/li&gt;
&lt;li&gt;税前汽油价格：$2.00/加仑，征收 $1.00/加仑的税&lt;/li&gt;
&lt;li&gt;消费者支付的价格上涨 &lt;strong&gt;$0.95&lt;/strong&gt; 至 $2.95（承担了绝大部分）&lt;/li&gt;
&lt;li&gt;生产者收到的价格仅下降 &lt;strong&gt;$0.05&lt;/strong&gt; 至 $1.95（承担极小部分）&lt;/li&gt;
&lt;/ul&gt;
&lt;h4&gt;生产者承担大部分税负&lt;/h4&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当 &lt;strong&gt;需求价格弹性高&lt;/strong&gt; 而 &lt;strong&gt;供给价格弹性低&lt;/strong&gt; 时，税负主要由生产者承担：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;以市中心停车位市场为例：需求曲线较平（高弹性），供给曲线较陡（低弹性）&lt;/li&gt;
&lt;li&gt;税前停车费：$6.00/天，征收 $5.00 的税&lt;/li&gt;
&lt;li&gt;生产者收到的价格大幅下降至 &lt;strong&gt;$1.50&lt;/strong&gt;（承担了绝大部分）&lt;/li&gt;
&lt;li&gt;消费者支付的价格仅上涨 &lt;strong&gt;$0.50&lt;/strong&gt; 至 $6.50（承担极小部分）&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 总结：Elasticity 决定 Tax Incidence
&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;当 &lt;strong&gt;需求价格弹性 &amp;gt; 供给价格弹性&lt;/strong&gt; → 税负主要由 &lt;strong&gt;生产者&lt;/strong&gt; 承担&lt;/li&gt;
&lt;li&gt;当 &lt;strong&gt;供给价格弹性 &amp;gt; 需求价格弹性&lt;/strong&gt; → 税负主要由 &lt;strong&gt;消费者&lt;/strong&gt; 承担&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;所以是弹性（而非谁在法律上缴税）决定了 Excise Tax 的归宿。&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;3. Tax Revenue（税收收入）&lt;/h2&gt;
&lt;h3&gt;3.1 税收收入的计算&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 税收收入公式
$$\text{Tax Revenue} = \text{Tax per unit} \times \text{Quantity transacted under the tax}$$
税收收入等于 tax wedge（税收楔子）的高度乘以征税后的交易数量，即图中阴影矩形的面积。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;例&lt;/strong&gt;：$40/间 × 5,000 间 = &lt;strong&gt;$200,000&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.2 Tax Rate（税率）与税收收入的关系&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义：Tax Rate
A &lt;strong&gt;tax rate&lt;/strong&gt; is the amount of tax people are required to pay per unit of whatever is being taxed.（税率是人们需要为每单位被征税物品支付的税额。）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 重要规律
一般来说，&lt;strong&gt;将 Excise Tax 税率翻倍并不会使税收收入翻倍&lt;/strong&gt;，因为提高税率会减少交易数量。
在某些情况下，&lt;strong&gt;提高税率实际上可能减少政府征收的总收入&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;税率&lt;/th&gt;
&lt;th&gt;税收收入&lt;/th&gt;
&lt;th&gt;说明&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$20/间&lt;/td&gt;
&lt;td&gt;$150,000&lt;/td&gt;
&lt;td&gt;税率减半，收入为原来的 3/4（非 1/2）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$40/间&lt;/td&gt;
&lt;td&gt;$200,000&lt;/td&gt;
&lt;td&gt;基准情形&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$60/间&lt;/td&gt;
&lt;td&gt;$150,000&lt;/td&gt;
&lt;td&gt;税率提高，收入反而下降！&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;h2&gt;4. 税收的福利效应与 Deadweight Loss（无谓损失）&lt;/h2&gt;
&lt;h3&gt;4.1 税收减少 Consumer Surplus 和 Producer Surplus&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;价格下降会产生 consumer surplus（消费者剩余）的增加&lt;/li&gt;
&lt;li&gt;同理，&lt;strong&gt;价格上涨给消费者造成损失&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;在 Excise Tax 的情形下：消费者支付的价格上涨 → 消费者剩余减少；生产者收到的价格下降 → 生产者剩余减少&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;税收同时减少了 consumer surplus 和 producer surplus&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Figure 7-8 解析（来自演讲者备注）&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;税前均衡价格与数量：$P_E$ 和 $Q_E$&lt;/li&gt;
&lt;li&gt;征税 $T$/单位后，消费者价格升至 $P_C$，消费者剩余减少 = 矩形 A + 三角形 B&lt;/li&gt;
&lt;li&gt;生产者价格降至 $P_P$，生产者剩余减少 = 矩形 C + 三角形 F&lt;/li&gt;
&lt;li&gt;政府获得税收收入 $Q_T \times T$ = 面积 A + C&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;面积 B + F&lt;/strong&gt; 代表了消费者和生产者剩余中未被政府以税收形式获得的部分——这就是税收对社会的 &lt;strong&gt;deadweight loss（无谓损失）&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.2 Deadweight Loss of a Tax&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义：Deadweight Loss（无谓损失）
The &lt;strong&gt;deadweight loss&lt;/strong&gt; caused by the tax represents the total surplus lost to society because of the tax — that is, the amount of surplus that would have been generated by transactions that now do not take place because of the tax.
（税收造成的无谓损失代表社会因税收而损失的 total surplus——即那些因税收而不再发生的交易所本应产生的剩余。）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;虽然消费者和生产者因税收受损，但政府获得了收入（$Q_T \times T$）。然而，&lt;strong&gt;生产者和消费者的部分损失并没有被政府的收益所抵消&lt;/strong&gt;。这些就是 deadweight loss。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Figure 7-9 解析（来自演讲者备注）
税收导致 deadweight loss 是因为它造成了 inefficiency（无效率）：一些 mutually beneficial transactions（互惠交易）因税收而永远无法发生，即 $Q_E - Q_T$ 这部分交易。&lt;/p&gt;
&lt;p&gt;黄色区域代表 deadweight loss 的价值：它是本应从 $Q_E - Q_T$ 交易中获得的全部剩余。如果税收没有阻碍交易——即交易数量保持在 $Q_E$——就不会产生 deadweight loss。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.3 Deadweight-Loss Triangle 的应用&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;p&gt;用三角形来衡量 deadweight loss 是经济学中广泛使用的技术：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;用于衡量 &lt;strong&gt;垄断 (monopoly)&lt;/strong&gt; 造成的 deadweight loss&lt;/li&gt;
&lt;li&gt;用于评估公共政策的收益与成本，例如是否对产品施加更严格的安全标准&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;5. Deadweight Loss 与 Elasticities 的关系&lt;/h2&gt;
&lt;h3&gt;5.1 税率大小与 Deadweight Loss&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 两个关键规律&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;税收规模越大 → &lt;strong&gt;Deadweight loss 越大&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;税收规模越大 → 税收收入 &lt;strong&gt;先升后降&lt;/strong&gt;（这种关系被称为 &lt;strong&gt;Laffer curve（拉弗曲线）&lt;/strong&gt;）&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.2 Tax Collection Around the World&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;5.3 Administrative Costs of Taxation&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义：Administrative Costs（行政成本）
The &lt;strong&gt;administrative costs&lt;/strong&gt; of a tax are the resources used by government to collect the tax, and by taxpayers to pay it, over and above the amount of the tax.（税收的行政成本是政府和纳税人为征收和缴纳税款而使用的、超出税额本身的资源。）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;行政成本包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;会计成本 (accounting costs)&lt;/li&gt;
&lt;li&gt;用于隐藏利润的壳公司 (shell companies to hide profits)&lt;/li&gt;
&lt;li&gt;合法和非法的逃税行为&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 税收政策的一般原则
&lt;strong&gt;Total inefficiency = Deadweight Loss + Administrative Costs&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;在其他条件相同的情况下，税收体系应被设计为&lt;strong&gt;最小化其对社会施加的总 inefficiency&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.4 Elasticities 与 Deadweight Loss&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心原则
为了使税收的效率成本最小化，应选择对那些 &lt;strong&gt;需求或供给相对缺乏弹性 (inelastic)&lt;/strong&gt; 的商品征税。
对于这类商品，税收对行为的影响很小，因为行为对价格变化相对不敏感。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;四种情形对比&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;情形&lt;/th&gt;
&lt;th&gt;Deadweight Loss&lt;/th&gt;
&lt;th&gt;原因&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;(a) Elastic Demand (弹性需求)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;较大&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;税收导致交易量大幅下降&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;(b) Inelastic Demand (缺乏弹性需求)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;较小&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;交易量下降幅度小&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;(c) Elastic Supply (弹性供给)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;较大&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;税收导致交易量大幅下降&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;(d) Inelastic Supply (缺乏弹性供给)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;较小&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;交易量下降幅度小&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;
&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;
&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;
&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 来自演讲者备注的详细解释 (Figure 7-10)
Deadweight loss 在 panel (a) 和 (c) 中更大，因为 demand 或 supply 的 price elasticity 越大，税收引起的交易量下降就越大。
反之，demand 或 supply 的 price elasticity 越小，税收引起的交易量下降越小，deadweight loss 也越小。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.5 极端情形：Perfectly Inelastic&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 极端情形&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;当需求 &lt;strong&gt;完全无弹性 (perfectly inelastic)&lt;/strong&gt;（垂直需求曲线）：征税不改变需求量 → &lt;strong&gt;Deadweight loss = 0&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;当供给 &lt;strong&gt;完全无弹性 (perfectly inelastic)&lt;/strong&gt;（垂直供给曲线）：征税不改变供给量 → &lt;strong&gt;Deadweight loss = 0&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;政策含义&lt;/strong&gt;：如果目标是 minimizing deadweight loss，应当对消费者或生产者行为反应最缺乏弹性 (most inelastic response) 的商品和服务征税。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.6 案例：Land Value Tax（地价税）&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Land Value Tax — 一种高效税收
自 Adam Smith 以来，经济学家就注意到土地的供给几乎是 perfectly inelastic 的（土地数量无法轻易改变）。&lt;/p&gt;
&lt;p&gt;对土地价值征税（不考虑建筑物、基础设施和其他改良的价值）是一种&lt;strong&gt;极其高效的税收&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;地价税的负担将&lt;strong&gt;完全落在土地所有者&lt;/strong&gt;身上&lt;/li&gt;
&lt;li&gt;如果由承租人支付，市场租金将下降税额的幅度&lt;/li&gt;
&lt;li&gt;土地的市场价值将相应下降，减少土地所有者的财富&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;6. Tax Fairness（税收公平）与 Tax Efficiency（税收效率）&lt;/h2&gt;
&lt;h3&gt;6.1 两大税收公平原则&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_32.png&quot; alt=&quot;slide 32&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Benefits Principle（受益原则）
According to the &lt;strong&gt;benefits principle&lt;/strong&gt; of tax fairness, those who benefit from public spending should bear the burden of the tax that pays for that spending.
（根据受益原则，从公共支出中受益的人应承担为该支出提供资金的税收负担。）&lt;/p&gt;
&lt;p&gt;例如：拥有最多财产的人可能从政府（警察、公共基础设施等）中受益最多。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Ability-to-Pay Principle（支付能力原则）
According to the &lt;strong&gt;ability-to-pay principle&lt;/strong&gt;, those with greater ability to pay should pay more tax.
（根据支付能力原则，支付能力更强的人应缴纳更多税款。）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Lump-Sum Tax（一次性总付税）
A &lt;strong&gt;lump-sum tax&lt;/strong&gt; is the same for everyone, regardless of any actions people take.
这是最有效的税收形式——最容易征收、对激励扭曲最小——但也是最不公平的。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;6.2 Equity-Efficiency Trade-off&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_33.png&quot; alt=&quot;slide 33&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 税收体系的核心权衡：Equity vs. Efficiency&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;按照 ability-to-pay principle，&lt;strong&gt;最公平的税&lt;/strong&gt;向收入最高者（可能也是最努力工作的人）征收最多 → 这类 &lt;strong&gt;progressive taxes（累进税）&lt;/strong&gt; 对激励的扭曲最大，在效率方面表现最差&lt;/li&gt;
&lt;li&gt;在一个设计良好的税收体系中，存在 &lt;strong&gt;equity（公平）与 efficiency（效率）之间的 trade-off&lt;/strong&gt;：提高效率往往意味着牺牲公平，反之亦然&lt;/li&gt;
&lt;li&gt;但现实中许多税收体系设计不佳，因此往往可以&lt;strong&gt;同时提高公平和效率&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;7. Understanding the Tax System（理解税收制度）&lt;/h2&gt;
&lt;h3&gt;7.1 Tax Base（税基）&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_34.png&quot; alt=&quot;slide 34&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义：Tax Base
The &lt;strong&gt;tax base&lt;/strong&gt; is the measure or value, such as income or property value, that determines how much tax an individual or firm pays.（税基是决定个人或企业缴纳多少税的衡量标准或价值，例如收入或财产价值。）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;税种 (Tax Type)&lt;/th&gt;
&lt;th&gt;税基 (Tax Base)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Income Tax&lt;/strong&gt; (所得税)&lt;/td&gt;
&lt;td&gt;个人或家庭的工资和投资收入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Payroll Tax&lt;/strong&gt; (工资税)&lt;/td&gt;
&lt;td&gt;雇主支付给雇员的工资&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Sales Tax / VAT&lt;/strong&gt; (销售税/增值税)&lt;/td&gt;
&lt;td&gt;所售商品的价值&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Profits Tax&lt;/strong&gt; (利润税)&lt;/td&gt;
&lt;td&gt;企业的利润&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Property Tax&lt;/strong&gt; (财产税)&lt;/td&gt;
&lt;td&gt;财产价值（如房地产或土地）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Wealth Tax&lt;/strong&gt; (财富税)&lt;/td&gt;
&lt;td&gt;个人的财富&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_35.png&quot; alt=&quot;slide 35&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;7.2 Tax Structure（税收结构）&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_36.png&quot; alt=&quot;slide 36&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 三种税收结构&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Proportional Tax (Flat Tax)&lt;/strong&gt;（比例税/单一税）：不论纳税人收入或财富多少，按税基的相同百分比征收&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Progressive Tax&lt;/strong&gt;（累进税）：高收入纳税人缴纳的税款占其收入的比例&lt;strong&gt;更高&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Regressive Tax&lt;/strong&gt;（累退税）：高收入纳税人缴纳的税款占其收入的比例&lt;strong&gt;更低&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义：Marginal Tax Rate（边际税率）
The &lt;strong&gt;marginal tax rate&lt;/strong&gt; is the percentage of an increase in income that is taxed away.（边际税率是收入增加部分中被征税的比例。）&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;7.3 中国与美国税制对比&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_37.png&quot; alt=&quot;slide 37&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;中国&lt;/strong&gt;：个人所得税税率是高度 progressive 的，但高收入阶层的逃税行为使其在实际效果上对高收入者呈 regressive&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;美国&lt;/strong&gt;：拥有复杂的税收体系，包括联邦和州层面的 sales tax、payroll tax、income tax、profits tax。总体来看，在较低收入水平呈 progressive，在较高收入水平呈 regressive&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_38.png&quot; alt=&quot;slide 38&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;8. 本章总结 (Summary)&lt;/h2&gt;
&lt;h3&gt;8.1 Excise Tax 的基本机制&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_39.png&quot; alt=&quot;slide 39&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 1&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Excise taxes 提高了消费者支付的价格，降低了生产者收到的价格，在两者之间打入 wedge&lt;/li&gt;
&lt;li&gt;Tax incidence（谁承担税负）&lt;strong&gt;不取决于谁在法律上缴税&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Tax incidence 取决于供给和需求的 price elasticities：
&lt;ul&gt;
&lt;li&gt;需求弹性 &amp;gt; 供给弹性 → 税负主要由&lt;strong&gt;生产者&lt;/strong&gt;承担&lt;/li&gt;
&lt;li&gt;供给弹性 &amp;gt; 需求弹性 → 税负主要由&lt;strong&gt;消费者&lt;/strong&gt;承担&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;8.2 税收收入与 Deadweight Loss&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_40.png&quot; alt=&quot;slide 40&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 2&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;税收收入取决于 tax rate 和征税后的交易数量&lt;/li&gt;
&lt;li&gt;Excise taxes 造成 &lt;strong&gt;deadweight loss&lt;/strong&gt;（无效率），因为它们阻碍了部分 mutually beneficial transactions&lt;/li&gt;
&lt;li&gt;税收还产生 &lt;strong&gt;administrative costs&lt;/strong&gt;（用于征税的资源）&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_41.png&quot; alt=&quot;slide 41&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 3&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Excise tax 为政府产生收入，但降低了 total surplus&lt;/li&gt;
&lt;li&gt;Total surplus 的损失&lt;strong&gt;超过&lt;/strong&gt; tax revenue，产生 deadweight loss&lt;/li&gt;
&lt;li&gt;Deadweight loss 由三角形表示，其面积等于被税收阻碍的交易的价值&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Demand 或 supply 的 elasticity 越大 → deadweight loss 越大&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;如果 demand 或 supply 是 perfectly inelastic → deadweight loss = 0&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;8.3 效率与公平的权衡&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_42.png&quot; alt=&quot;slide 42&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 4&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;一个 &lt;strong&gt;efficient tax&lt;/strong&gt; 最小化 deadweight loss 与 administrative costs 之和&lt;/li&gt;
&lt;li&gt;但 tax fairness (tax equity) 也是税收政策的目标&lt;/li&gt;
&lt;li&gt;两大原则：&lt;strong&gt;benefits principle&lt;/strong&gt; 和 &lt;strong&gt;ability-to-pay principle&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;最有效的税（lump-sum tax）不扭曲激励，但公平性最差&lt;/li&gt;
&lt;li&gt;按 ability-to-pay principle 最公平的税对激励扭曲最大，效率最差&lt;/li&gt;
&lt;li&gt;因此存在 &lt;strong&gt;equity-efficiency trade-off&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_43.png&quot; alt=&quot;slide 43&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 5&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每种税收由 &lt;strong&gt;tax base&lt;/strong&gt;（定义征税对象）和 &lt;strong&gt;tax structure&lt;/strong&gt;（规定税额如何取决于税基）组成&lt;/li&gt;
&lt;li&gt;不同的 tax base 产生不同的税种：income tax、payroll tax、sales tax、profits tax、property tax、wealth tax&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;8.4 累进税与累退税&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_44.png&quot; alt=&quot;slide 44&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 6&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Progressive tax&lt;/strong&gt;：高收入者缴纳的税款占收入比例更高&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Regressive tax&lt;/strong&gt;：高收入者缴纳的税款占收入比例更低&lt;/li&gt;
&lt;li&gt;Progressive taxes 通常由 ability-to-pay principle 来论证其合理性&lt;/li&gt;
&lt;li&gt;然而，高度 progressive 的税制显著扭曲激励，因为它导致高收入者面临高 &lt;strong&gt;marginal tax rate&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;美国税制整体上是 progressive 的，但包含了 progressive 和 regressive 税种的混合&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;9. Key Terms（关键术语）&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_45.png&quot; alt=&quot;slide 45&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;th&gt;中文翻译&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Excise Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;消费税/从量税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Incidence&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;税收归宿&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Tax Rate&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;税率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Administrative Costs&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;行政成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Benefits Principle&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;受益原则&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Ability-to-Pay Principle&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;支付能力原则&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Lump-Sum Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;一次性总付税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Trade-off between Equity and Efficiency&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;公平与效率的权衡&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Tax Base&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;税基&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Tax Structure&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;税收结构&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Income Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;所得税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Payroll Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;工资税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Sales Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;销售税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Profits Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;利润税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Property Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;财产税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Wealth Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;财富税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Proportional Tax (Flat Tax)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;比例税/单一税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Progressive Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;累进税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Regressive Tax&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;累退税&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Marginal Tax Rate&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;边际税率&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Deadweight Loss&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;无谓损失&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Laffer Curve&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;拉弗曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Tax Wedge&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;税收楔子&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
</content:encoded></item><item><title>ECO2011 C4：Price Controls and Quotas</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c4-price-controls-and-quotas/chapter-5---price-controls-and-quotas/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c4-price-controls-and-quotas/chapter-5---price-controls-and-quotas/</guid><pubDate>Sun, 07 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 5: Price Controls and Quotas — Meddling with Markets&lt;/h1&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;&lt;/p&gt;
&lt;h2&gt;1. 为什么政府要干预价格？(Why Governments Control Prices)&lt;/h2&gt;
&lt;p&gt;在自由市场中，市场价格会自动移动到 &lt;strong&gt;Quantity Supplied = Quantity Demanded&lt;/strong&gt; 的水平，即均衡价格 (Equilibrium Price)。然而，这个均衡价格并不总是让买方或卖方满意。因此，政府有时会通过 &lt;strong&gt;价格管制 (Price Controls)&lt;/strong&gt; 来干预市场——即对市场价格的上限或下限施加法律限制。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 价格管制 (Price Controls)
&lt;strong&gt;Price controls&lt;/strong&gt; are legal restrictions on how high or low a market price may go. 其分为两类：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;价格上限 (Price Ceiling)&lt;/strong&gt;: 卖方对商品或服务可以收取的&lt;strong&gt;最高价格&lt;/strong&gt; (maximum price)。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;价格下限 (Price Floor)&lt;/strong&gt;: 买方必须支付的&lt;strong&gt;最低价格&lt;/strong&gt; (minimum price)。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 本章学习目标 (What You Will Learn)&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;价格管制和数量管制的含义——两种政府干预市场的方式&lt;/li&gt;
&lt;li&gt;价格和数量管制如何产生问题，并导致市场&lt;strong&gt;低效率 (inefficient)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;为什么对市场干预的&lt;strong&gt;可预测副作用 (predictable side effects)&lt;/strong&gt; 让经济学家对干预措施持怀疑态度&lt;/li&gt;
&lt;li&gt;谁从市场干预中受益，谁受损，以及为什么尽管存在已知问题，这些干预仍被使用&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;2. 价格上限 (Price Ceilings)&lt;/h2&gt;
&lt;h3&gt;2.1 基本概念&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 价格上限 (Price Ceiling)
&lt;strong&gt;Price ceiling&lt;/strong&gt; 是政府设定的&lt;strong&gt;低于均衡价格&lt;/strong&gt;的最高合法价格。价格上限通常是在危机时期施加的——战争、农作物歉收、自然灾害——因为这些事件往往导致价格突然飙升，伤害大多数人，同时使少数人获得暴利。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;历史上的例子包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;二战期间美国对铝和钢铁的价格管制&lt;/li&gt;
&lt;li&gt;世界各地城市的&lt;strong&gt;租金管制 (Rent Control)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;委内瑞拉对基本食品的价格管制&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.2 公寓市场：无政府干预时的均衡&lt;/h3&gt;
&lt;p&gt;首先来看在没有政府干预的情况下，公寓市场如何运作：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在没有政府干预时，公寓市场在 &lt;strong&gt;点 E&lt;/strong&gt; 处达到均衡：市场租金为 &lt;strong&gt;$1,000/月&lt;/strong&gt;，有 &lt;strong&gt;200 万套公寓&lt;/strong&gt; 被租出。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 需求表与供给表 (Demand and Supply Schedule for Apartments)&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Monthly Rent (per apartment)&lt;/th&gt;
&lt;th&gt;Quantity Demanded (millions)&lt;/th&gt;
&lt;th&gt;Quantity Supplied (millions)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$1,400&lt;/td&gt;
&lt;td&gt;1.6&lt;/td&gt;
&lt;td&gt;2.4&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1,300&lt;/td&gt;
&lt;td&gt;1.7&lt;/td&gt;
&lt;td&gt;2.3&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1,200&lt;/td&gt;
&lt;td&gt;1.8&lt;/td&gt;
&lt;td&gt;2.2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1,100&lt;/td&gt;
&lt;td&gt;1.9&lt;/td&gt;
&lt;td&gt;2.1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;$1,000&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;2.0&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;2.0&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$900&lt;/td&gt;
&lt;td&gt;2.1&lt;/td&gt;
&lt;td&gt;1.9&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$800&lt;/td&gt;
&lt;td&gt;2.2&lt;/td&gt;
&lt;td&gt;1.8&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$700&lt;/td&gt;
&lt;td&gt;2.3&lt;/td&gt;
&lt;td&gt;1.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$600&lt;/td&gt;
&lt;td&gt;2.4&lt;/td&gt;
&lt;td&gt;1.6&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.3 价格上限的效果 (The Effects of a Price Ceiling)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当政府将租金上限定在 &lt;strong&gt;$800/月&lt;/strong&gt;（低于均衡价格 $1,000）时：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 关键结果&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;供给量下降至 &lt;strong&gt;180 万套&lt;/strong&gt;（点 A）&lt;/li&gt;
&lt;li&gt;需求量上升至 &lt;strong&gt;220 万套&lt;/strong&gt;（点 B）&lt;/li&gt;
&lt;li&gt;产生 &lt;strong&gt;40 万套的持续短缺 (Persistent Shortage)&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这 40 万人是愿意以合法价格 $800 租房但找不到房子的人。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 价格上限的效果分类&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;情况&lt;/th&gt;
&lt;th&gt;位置&lt;/th&gt;
&lt;th&gt;效果&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Binding (有约束力)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;低于均衡价格&lt;/td&gt;
&lt;td&gt;造成短缺 (Shortage)；卖方必须配给稀缺商品；导致低效的配给机制&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Not Binding (无约束力)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;高于均衡价格&lt;/td&gt;
&lt;td&gt;对价格或交易量没有影响&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.4 价格上限导致低效的低交易量 (Inefficiently Low Quantity)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;p&gt;价格上限将交易量压低至市场均衡量之下，造成 &lt;strong&gt;无谓损失 (Deadweight Loss)&lt;/strong&gt;。图中阴影三角形面积代表着由于交易量过低而损失的总剩余 (Total Surplus)。&lt;/p&gt;
&lt;h3&gt;2.5 价格上限如何导致低效率 (How Price Ceilings Cause Inefficiency)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 价格上限导致的四类低效率&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Inefficient Allocation to Consumers (对消费者的无效分配)&lt;/strong&gt;: 非常想要且愿意付高价的人得不到商品，而那些不太在意、只愿付低价的人反而得到了。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Wasted Resources (资源浪费)&lt;/strong&gt;: 人们花费金钱、精力和时间去应对由价格上限造成的短缺——例如排长队。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Inefficiently Low Quality (低效的低质量)&lt;/strong&gt;: 卖方通过降低质量来削减成本，因为价格被压低后无法通过提高质量来竞争。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Black Markets (黑市)&lt;/strong&gt;: 非法以更高价格交易商品的地下市场往往会出现，且因为非法而通常效率低下。&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.6 案例分析：1970 年代美国的汽油价格管制&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] Economics in Action: 汽油价格管制的经济代价&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;背景&lt;/strong&gt;: 1973 年中东战争导致世界市场石油价格上涨，原油成本上升减少了汽油供给，推高了市场价格。尼克松总统为了稳定汽油价格，引入了价格管制。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;结果&lt;/strong&gt;: 消费者被迫&lt;strong&gt;排队约 3 小时&lt;/strong&gt;才能给自己的车加满油。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;经济计算&lt;/strong&gt;:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;假设价格上限使每加仑汽油价格降低了 $1&lt;/li&gt;
&lt;li&gt;排队 3 小时购买 10 加仑汽油，节省 $10&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;机会成本 (Opportunity Cost)&lt;/strong&gt;: $5/小时&lt;/li&gt;
&lt;li&gt;排队总时间价值：3 × $5 = &lt;strong&gt;$15&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;低价格带来的收益 &amp;lt; 时间的机会成本&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;消费者的经济损失: $10 − $15 = −$5&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;结论：消费者浪费的资源（排队时间）可能抵消了低价带来的任何好处，甚至最终总成本比没有管制时更高。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.7 为什么价格上限仍然存在？——纽约租金管制&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 既然价格上限伤害大多数人，为什么它们仍然存在？&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;价格上限虽然伤害大多数居民，但&lt;strong&gt;使少数租户获得比无管制市场便宜得多的住房&lt;/strong&gt;。这些受益者通常比受害者更有组织、更有政治影响力。&lt;/li&gt;
&lt;li&gt;当价格上限已经实施很长时间后，&lt;strong&gt;买家可能对没有管制会发生什么缺乏现实认知&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;政府官员常常根本不理解供需分析！&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.8 租金管制的赢家与输家 (Winners and Losers from Rent Control)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 福利分析 (Welfare Analysis)&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Panel (a) — 租金管制前&lt;/strong&gt;: 展示了自由市场均衡下的消费者剩余 (Consumer Surplus) 和生产者剩余 (Producer Surplus)。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Panel (b) — 租金管制后&lt;/strong&gt;: 对仍能租到公寓的消费者来说，消费者剩余&lt;strong&gt;增加了&lt;/strong&gt;；但生产者剩余和&lt;strong&gt;总剩余 (Total Surplus) 减少&lt;/strong&gt;了。消费者剩余的增加部分是从生产者剩余转移而来的，同时还产生了无谓损失 (Deadweight Loss)。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.9 全球视角：孟买的租金管制&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] For Inquiring Minds: Rent Control, Mumbai Style
2006 年 5 月，孟买一栋租金管制公寓楼因年久失修而倒塌，其中四层坍塌导致三人死亡。尽管市政府要求撤离，&lt;strong&gt;58 名租户拒绝离开&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;孟买的租金管制始于 1947 年，旨在应对因印巴冲突难民涌入造成的严重住房短缺。该政策被延长了 &lt;strong&gt;20 次&lt;/strong&gt;，如今适用于市中心约 &lt;strong&gt;60%&lt;/strong&gt; 的建筑。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 租金管制的长期后果（孟买案例）&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;租户将公寓传给&lt;strong&gt;继承人&lt;/strong&gt;，或将居住权&lt;strong&gt;出售&lt;/strong&gt;给其他租户。&lt;/li&gt;
&lt;li&gt;租金管制建筑的&lt;strong&gt;房东遭受了严重的经济损失&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;公寓&lt;strong&gt;质量随时间严重恶化&lt;/strong&gt;，导致住房条件越来越差。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.10 短期 vs. 长期的租金管制&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 短期与长期的弹性差异&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;时间维度&lt;/th&gt;
&lt;th&gt;供给特征&lt;/th&gt;
&lt;th&gt;需求特征&lt;/th&gt;
&lt;th&gt;租金管制的效果&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;短期 (Short Run)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;公寓供给固定（缺乏弹性）&lt;/td&gt;
&lt;td&gt;需求相对缺乏弹性&lt;/td&gt;
&lt;td&gt;短缺较小&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;长期 (Long Run)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;供给和需求都更具弹性&lt;/td&gt;
&lt;td&gt;供给和需求都更具弹性&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;短缺大幅增加&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;因为长期中供给和需求都更灵活 (more flexible)，租金管制最终会导致可用公寓数量出现&lt;strong&gt;巨大的短缺&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;2.11 委内瑞拉：饥饿与价格管制&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] Economics in Action: Hunger and Price Controls in Venezuela
在委内瑞拉加拉加斯，超市购物是一种奇特的体验：货架上摆满了苏格兰威士忌和进口奶酪，但&lt;strong&gt;黑豆和牛肉等基本主食却因价格管制而常常缺货&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;自 1998 年以来，总统推行的政策偏向穷人和工人阶级，包括对基本食品（豆类、鸡肉、糖等）实施价格管制。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 委内瑞拉价格管制的后果
这些政策导致了：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;偶发性短缺 (sporadic shortages)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;消费者支出的增加&lt;/li&gt;
&lt;li&gt;不受价格管制的商品价格&lt;strong&gt;急剧上升&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;对受价格管制商品的&lt;strong&gt;需求增加&lt;/strong&gt;（因为相对便宜）&lt;/li&gt;
&lt;li&gt;货币大幅贬值导致&lt;strong&gt;进口食品下降&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;最终结果：&lt;strong&gt;全国食品商店货架空无一物&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;3. 价格下限 (Price Floors)&lt;/h2&gt;
&lt;h3&gt;3.1 基本概念&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 价格下限 (Price Floor)
&lt;strong&gt;Price floor&lt;/strong&gt; 是政府设定的&lt;strong&gt;高于均衡价格&lt;/strong&gt;的最低合法价格。有时政府干预是为了&lt;strong&gt;推高&lt;/strong&gt;市场价格而不是压低它。价格下限旨在帮助市场中的&lt;strong&gt;卖方&lt;/strong&gt;（例如通过为农产品设定价格下限来帮助农民）。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;最低工资 (Minimum Wage)&lt;/strong&gt; 是工资率（劳动的市场价格）的法定下限。&lt;/p&gt;
&lt;p&gt;与价格上限一样，价格下限虽然旨在帮助某些人，但会产生&lt;strong&gt;可预测且不受欢迎的副作用 (predictable and undesirable side effects)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.2 价格下限的效果 —— 黄油市场&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;p&gt;当政府将黄油价格下限定在 &lt;strong&gt;$1.20/磅&lt;/strong&gt;（高于均衡价格）时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;需求量&lt;/strong&gt;下降至 &lt;strong&gt;900 万磅&lt;/strong&gt;（点 A）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;供给量&lt;/strong&gt;上升至 &lt;strong&gt;1200 万磅&lt;/strong&gt;（点 B）&lt;/li&gt;
&lt;li&gt;产生 &lt;strong&gt;300 万磅的持续过剩 (Persistent Surplus)&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 价格下限的效果分类&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;情况&lt;/th&gt;
&lt;th&gt;位置&lt;/th&gt;
&lt;th&gt;效果&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Binding (有约束力)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;高于均衡价格&lt;/td&gt;
&lt;td&gt;造成过剩 (Surplus)；部分卖方无法卖出他们想卖的量；政府通常需要授予许可证或买入（然后销毁）过剩产品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Not Binding (无约束力)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;低于均衡价格&lt;/td&gt;
&lt;td&gt;对市场没有影响&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;3.3 价格下限如何导致低效率&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 价格下限导致的五类低效率&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Inefficiently Low Quantity (低效的低交易量)&lt;/strong&gt;: 交易量低于均衡水平&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Inefficient Allocation of Sales Among Sellers (对卖方销售的无效分配)&lt;/strong&gt;: 愿意以最低价格卖出的卖方不一定是最终卖出的人&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Wasted Resources (资源浪费)&lt;/strong&gt;: 为处理过剩产品而浪费的资源&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Inefficiently High Quality (低效的高质量)&lt;/strong&gt;: 卖方提供高价高质的商品，即使买方更偏好低价低质&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Temptation to Break the Law (违法的诱惑)&lt;/strong&gt;: 以低于法定价格出售&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.4 价格下限导致低效的低交易量&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;p&gt;价格下限将需求量压低至市场均衡量之下，同样造成无谓损失 (Deadweight Loss)。图中阴影三角形显示了由于交易量过低而损失的福利。&lt;/p&gt;
&lt;h3&gt;3.5 低效分配与低效高质&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 两个关键的低效率&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Inefficient Allocation of Sales Among Sellers&lt;/strong&gt;: 价格下限导致对卖方销售的无效分配——那些愿意以最低价格卖出商品的卖方并不总是真正卖出的人。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Inefficiently High Quality&lt;/strong&gt;: 卖方提供高效率的高质量商品，即使买方更偏好低价格下的低质量。例如：在最低工资下，雇主可能只雇佣更有经验的工人，即使年轻人愿意以更低工资换取在职培训。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.6 注意事项：上限、下限与数量&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] PITFALLS: Ceilings, Floors, and Quantities&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Price ceiling&lt;/strong&gt; 将价格&lt;strong&gt;向下&lt;/strong&gt;推 → 更少的卖方愿意卖&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Price floor&lt;/strong&gt; 将价格&lt;strong&gt;向上&lt;/strong&gt;推 → 更少的买方愿意买&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;两者都减少了实际买卖的数量 (Both reduce the quantity bought and sold)&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;关键规则 (The Key Rule)&lt;/strong&gt;:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;如果卖方不想卖那么多而买方想买那么多 → 由&lt;strong&gt;卖方&lt;/strong&gt;决定实际销售量（买方不能强迫不愿卖的人卖）&lt;/li&gt;
&lt;li&gt;如果买方不想买那么多而卖方想卖那么多 → 由&lt;strong&gt;买方&lt;/strong&gt;决定实际销售量（卖方不能强迫不愿买的人买）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;简而言之：&lt;strong&gt;数量由市场较&quot;短&quot;的那一方决定（The short side of the market determines the actual quantity transacted.）&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.7 最低工资 (The Minimum Wage)&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 最低工资 (Minimum Wage) 的市场分析&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;市场：&lt;strong&gt;劳动力市场 (Market for Labor)&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;Workers → Supply of Labor&lt;/li&gt;
&lt;li&gt;Firms → Demand for Labor&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;如果最低工资低于均衡工资&lt;/strong&gt; → 对市场没有影响 (Not binding)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;如果最低工资高于均衡工资&lt;/strong&gt; →
&lt;ol&gt;
&lt;li&gt;想工作的工人数量&lt;strong&gt;增加&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;雇主提供的岗位数量&lt;strong&gt;减少&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;导致&lt;strong&gt;失业 (Unemployment)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;有工作的工人获得&lt;strong&gt;更高收入&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;找不到工作的工人获得&lt;strong&gt;更低收入&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 最低工资对不同群体的影响&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;群体&lt;/th&gt;
&lt;th&gt;影响&lt;/th&gt;
&lt;th&gt;原因&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;高技能/有经验工人 (Highly skilled &amp;amp; experienced)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;不受影响 (Not affected)&lt;/td&gt;
&lt;td&gt;他们的均衡工资远高于最低工资 → 最低工资对他们&lt;strong&gt;没有约束力 (not binding)&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;青少年劳动者 (Teenage labor)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;受显著影响&lt;/td&gt;
&lt;td&gt;技能和经验最少，均衡工资低，愿意接受低工资换取在职培训 → 最低工资&lt;strong&gt;有约束力 (binding)&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;实证结论&lt;/strong&gt;: 最低工资每提高 &lt;strong&gt;10%&lt;/strong&gt;，青少年就业率下降 &lt;strong&gt;1% 至 3%&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.8 南欧的&quot;黑色劳动&quot;&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] Economics in Action: &quot;Black Labor&quot; in Southern Europe
许多欧洲国家的最低工资非常高。这种价格下限造成的持续过剩表现为&lt;strong&gt;高失业率&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;在劳动法执行不严的国家（如意大利和西班牙），广泛存在&lt;strong&gt;法律规避 (evasion of the law)&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;工人被公司以&lt;strong&gt;低于最低工资&lt;/strong&gt;的水平雇佣&lt;/li&gt;
&lt;li&gt;公司不提供&lt;strong&gt;医疗保险和退休福利&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;许多工作未被申报 (unreported)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;西班牙等待领取失业救济金的人们甚至抱怨&lt;strong&gt;排队时间太长，耽误了他们回去工作&lt;/strong&gt;——这是一个关于非正规就业的讽刺性现实。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;4. 数量管制 (Quantity Controls / Quotas)&lt;/h2&gt;
&lt;h3&gt;4.1 基本概念&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 数量管制 (Quantity Controls / Quotas)
&lt;strong&gt;Quantity control / Quota&lt;/strong&gt; 是对可以买卖的某种商品数量的&lt;strong&gt;上限 (upper limit)&lt;/strong&gt;。被合法允许交易的总量称为 &lt;strong&gt;Quota Limit&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;核心概念：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;License (许可证)&lt;/strong&gt;: 赋予其所有者&lt;strong&gt;供给某种商品的权利&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Demand Price (需求价格)&lt;/strong&gt;: 在给定数量下，消费者愿意支付的价格。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Supply Price (供给价格)&lt;/strong&gt;: 在给定数量下，生产者愿意供给的价格。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;典型案例：纽约市的&lt;strong&gt;出租车牌照制度 (Taxi Medallion System)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.2 出租车市场：无政府干预时的均衡&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在没有政府干预的情况下，出租车市场在点 E 处达到均衡：&lt;strong&gt;每年 1000 万次乘车&lt;/strong&gt;，每次车费 &lt;strong&gt;$5&lt;/strong&gt;。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 出租车乘车需求与供给表&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Fare (per ride)&lt;/th&gt;
&lt;th&gt;Quantity Demanded (millions/year)&lt;/th&gt;
&lt;th&gt;Quantity Supplied (millions/year)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$7.00&lt;/td&gt;
&lt;td&gt;6&lt;/td&gt;
&lt;td&gt;14&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$6.50&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;13&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$6.00&lt;/td&gt;
&lt;td&gt;8&lt;/td&gt;
&lt;td&gt;12&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$5.50&lt;/td&gt;
&lt;td&gt;9&lt;/td&gt;
&lt;td&gt;11&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;$5.00&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;10&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;10&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$4.50&lt;/td&gt;
&lt;td&gt;11&lt;/td&gt;
&lt;td&gt;9&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$4.00&lt;/td&gt;
&lt;td&gt;12&lt;/td&gt;
&lt;td&gt;8&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$3.50&lt;/td&gt;
&lt;td&gt;13&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$3.00&lt;/td&gt;
&lt;td&gt;14&lt;/td&gt;
&lt;td&gt;6&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.3 配额对出租车市场的影响&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_32.png&quot; alt=&quot;slide 32&quot; /&gt;&lt;/p&gt;
&lt;p&gt;政府通过只出售 &lt;strong&gt;800 万&lt;/strong&gt; 张牌照来实施配额（以黑色竖线表示）：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 配额的核心效果&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;消费者支付的价格上升到 &lt;strong&gt;$6/次&lt;/strong&gt;（800 万次乘车的 Demand Price，点 A）&lt;/li&gt;
&lt;li&gt;供给价格仅为 &lt;strong&gt;$4/次&lt;/strong&gt;（800 万次乘车的 Supply Price，点 B）&lt;/li&gt;
&lt;li&gt;两者之差即为 &lt;strong&gt;Quota Rent&lt;/strong&gt;（配额租金）：&lt;strong&gt;$6 − $4 = $2/次&lt;/strong&gt;——归属于牌照持有者的收益&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;The quota rent drives a &lt;strong&gt;wedge&lt;/strong&gt; between the demand price and the supply price. 由于配额阻止了互利的交易，产生了&lt;strong&gt;无谓损失 (Deadweight Loss)&lt;/strong&gt;（阴影三角形）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.4 数量管制的解剖学&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_33.png&quot; alt=&quot;slide 33&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Quota Rent (配额租金)
数量管制（配额）在 Demand Price 和 Supply Price 之间打入了一个 &lt;strong&gt;楔子 (Wedge)&lt;/strong&gt;：买方支付的价格最终&lt;strong&gt;高于&lt;/strong&gt;卖方收到的价格。&lt;/p&gt;
&lt;p&gt;Demand Price 与 Supply Price 在配额限制处的差额就是 &lt;strong&gt;Quota Rent&lt;/strong&gt;——牌照持有者因拥有销售权而获得的收益。当牌照可以交易时，Quota Rent 等于&lt;strong&gt;牌照的市场价格&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;$$
\text{Quota Rent} = \text{Demand Price} - \text{Supply Price}
$$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.5 消费配给券与生产许可证&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_34.png&quot; alt=&quot;slide 34&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 两种常见的数量管制工具&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Consumption Ration Coupons (消费配给券)&lt;/strong&gt;: 通常在战争或其他社会动荡导致广泛短缺的时期发行。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Production Licenses (生产许可证)&lt;/strong&gt;: 政府向企业施加（有时需付费）以限制产量。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.6 数量管制的成本&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_35.png&quot; alt=&quot;slide 35&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 数量管制的代价&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;互利的交易无法发生&lt;/strong&gt; (Mutually beneficial transactions don&apos;t occur)&lt;/li&gt;
&lt;li&gt;牌照持有者获得&lt;strong&gt;超额利润 (extra-normal profits)&lt;/strong&gt;，这给了他们追求政治行动以维护配额的激励&lt;/li&gt;
&lt;li&gt;价格取决于谁持有牌照：
&lt;ul&gt;
&lt;li&gt;如果&lt;strong&gt;买方持有牌照&lt;/strong&gt; → 价格降至 Supply Price&lt;/li&gt;
&lt;li&gt;如果&lt;strong&gt;卖方持有牌照&lt;/strong&gt; → 价格升至 Demand Price&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;激励非法活动&lt;/strong&gt;——为规避配额而产生违法行为&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;危险的、无牌照的&quot;黑车&quot;&lt;/strong&gt; 是数量管制的一个典型副作用&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.7 案例分析：新泽西海岸的蛤蜊配额&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_36.png&quot; alt=&quot;slide 36&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] Economics in Action: The Clams of Jersey Shore&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;背景&lt;/strong&gt;: 1980 年代，过度捕捞威胁到新泽西的蛤蜊资源的灭绝。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;政策&lt;/strong&gt;: 美国政府引入了&lt;strong&gt;蛤蜊配额 (clam quota)&lt;/strong&gt;，设定了捕捞总量的上限，并根据渔船的历史捕捞量分配许可证。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;结果&lt;/strong&gt;:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;渔船主享受到&lt;strong&gt;更高的蛤蜊价格&lt;/strong&gt;和&lt;strong&gt;更高的利润&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;渔船主还获得了可以&lt;strong&gt;出售的有价值的许可证&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这是配额制度可以实现环境可持续性的一个案例——但也创造了寻租行为 (rent-seeking) 的激励。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;5. 政府管制的共同效应&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_37.png&quot; alt=&quot;slide 37&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] The Common Effect of Government Controls
&lt;strong&gt;Price ceilings, price floors, and quotas — all three decrease the amount traded (if they are binding) and create deadweight loss.&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;管制类型&lt;/th&gt;
&lt;th&gt;价格方向&lt;/th&gt;
&lt;th&gt;机制&lt;/th&gt;
&lt;th&gt;结果&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price Ceiling&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;向下推&lt;/td&gt;
&lt;td&gt;更少的卖方愿意卖&lt;/td&gt;
&lt;td&gt;短缺 (Shortage)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price Floor&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;向上推&lt;/td&gt;
&lt;td&gt;更少的买方愿意买&lt;/td&gt;
&lt;td&gt;过剩 (Surplus)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Quota&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;直接限制数量&lt;/td&gt;
&lt;td&gt;限制交易量&lt;/td&gt;
&lt;td&gt;Wedge + Quota Rent&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;核心原则再次强调&lt;/strong&gt;: 数量由市场的 &lt;strong&gt;&quot;短边&quot; (the short side)&lt;/strong&gt; 决定：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;卖方不想卖那么多 → 卖方决定实际销售量&lt;/li&gt;
&lt;li&gt;买方不想买那么多 → 买方决定实际销售量&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;6. 本章总结 (Summary)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_38.png&quot; alt=&quot;slide 38&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 1: 政府干预的基本逻辑
即使市场是有效率的，政府也常常干预以追求更大的公平性，或取悦某个有影响力的利益集团。干预形式包括价格管制或数量管制，两者都会产生&lt;strong&gt;可预测且不受欢迎的副作用&lt;/strong&gt;：各种形式的低效率和非法活动。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_39.png&quot; alt=&quot;slide 39&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 2: 价格上限 (Price Ceiling)
价格上限（低于均衡价格的最高市场价格）使成功的买家受益，但导致&lt;strong&gt;持续的短缺 (persistent shortages)&lt;/strong&gt;。因为价格维持在均衡价格之下，需求量增加而供给量减少。这导致了可预测的问题：&lt;strong&gt;低效的低交易量、对消费者的无效分配、资源浪费、低效的低质量&lt;/strong&gt;，以及鼓励&lt;strong&gt;非法活动和黑市&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_40.png&quot; alt=&quot;slide 40&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 3: 价格下限 (Price Floor)
价格下限（高于均衡价格的最低市场价格）使成功的卖方受益，但导致&lt;strong&gt;持续的过剩 (persistent surplus)&lt;/strong&gt;。价格下限导致的低效率包括：&lt;strong&gt;低效的低交易量、对卖方销售的无效分配、资源浪费、低效的高质量&lt;/strong&gt;。同样鼓励非法活动和黑市。最广为人知的价格下限是&lt;strong&gt;最低工资 (Minimum Wage)&lt;/strong&gt;，但价格下限也常用于农产品。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_41.png&quot; alt=&quot;slide 41&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] Summary 4: 数量管制 (Quantity Controls / Quotas)
数量管制（配额）限制可以买卖的商品数量。允许销售的总量是 &lt;strong&gt;Quota Limit&lt;/strong&gt;。政府向个人颁发 &lt;strong&gt;Licenses&lt;/strong&gt;——销售给定数量商品的权利。配额在 &lt;strong&gt;Demand Price&lt;/strong&gt; 和 &lt;strong&gt;Supply Price&lt;/strong&gt; 之间打入了一个 &lt;strong&gt;Wedge&lt;/strong&gt;；这个楔子等于 &lt;strong&gt;Quota Rent&lt;/strong&gt;。数量管制同样鼓励非法活动。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;7. 关键词汇 (Key Terms)&lt;/h2&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_42.png&quot; alt=&quot;slide 42&quot; /&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;English Term&lt;/th&gt;
&lt;th&gt;中文翻译&lt;/th&gt;
&lt;th&gt;简要定义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price Controls&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;价格管制&lt;/td&gt;
&lt;td&gt;Legal restrictions on how high or low a market price may go&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price Ceiling&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;价格上限&lt;/td&gt;
&lt;td&gt;A maximum price sellers are allowed to charge&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Price Floor&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;价格下限&lt;/td&gt;
&lt;td&gt;A minimum price buyers are required to pay&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Inefficient Allocation to Consumers&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;对消费者的无效分配&lt;/td&gt;
&lt;td&gt;Those who want the good most don&apos;t get it; those who care least do&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Wasted Resources&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;资源浪费&lt;/td&gt;
&lt;td&gt;People expend money, effort, and time to cope with shortages&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Inefficiently Low Quality&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;低效的低质量&lt;/td&gt;
&lt;td&gt;Sellers reduce quality to cut costs when price is capped&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Inefficiently High Quality&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;低效的高质量&lt;/td&gt;
&lt;td&gt;Sellers offer high-quality goods at high prices under price floors&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Inefficient Allocation of Sales Among Sellers&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;对卖方销售的无效分配&lt;/td&gt;
&lt;td&gt;Those willing to sell at lowest price don&apos;t always manage to sell&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Black Markets&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;黑市&lt;/td&gt;
&lt;td&gt;Illegal markets trading goods at higher prices&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Minimum Wage&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;最低工资&lt;/td&gt;
&lt;td&gt;A legal floor on the wage rate (market price of labor)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Quantity Control / Quota&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;数量管制 / 配额&lt;/td&gt;
&lt;td&gt;An upper limit on the quantity of a good that can be bought or sold&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Quota Limit&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;配额上限&lt;/td&gt;
&lt;td&gt;The total amount that can be legally transacted&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;License&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;许可证&lt;/td&gt;
&lt;td&gt;Gives its owner the right to supply a good&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Demand Price&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;需求价格&lt;/td&gt;
&lt;td&gt;The price at which consumers will demand a given quantity&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Supply Price&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;供给价格&lt;/td&gt;
&lt;td&gt;The price at which producers will supply a given quantity&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Wedge&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;楔子&lt;/td&gt;
&lt;td&gt;The gap between demand price and supply price created by a quota&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Quota Rent&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;配额租金&lt;/td&gt;
&lt;td&gt;Earnings that accrue to the license-holder; = Demand Price − Supply Price&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Deadweight Loss&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;无谓损失&lt;/td&gt;
&lt;td&gt;The total surplus lost due to inefficiently low quantity transacted&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
</content:encoded></item><item><title>ECO2011 C1：Economic Models — Trade-offs and Trades</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c1-trade-and-trade-off/chapter-2---economic-models-trade-offs-and-trades/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c1-trade-and-trade-off/chapter-2---economic-models-trade-offs-and-trades/</guid><pubDate>Thu, 04 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;第 2 章：Economic Models — Trade-offs and Trades&lt;/h1&gt;
&lt;h2&gt;概述：经济学思维入门 (Overview: An Introduction to Economic Thinking)&lt;/h2&gt;
&lt;p&gt;今天的课程内容涵盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;为什么 &lt;strong&gt;模型 (Models)&lt;/strong&gt;——即对现实的简化表示——在经济学中扮演着至关重要的角色&lt;/li&gt;
&lt;li&gt;两个简单但重要的模型：&lt;strong&gt;生产可能性边界 (Production Possibility Frontier, PPF)&lt;/strong&gt; 和 &lt;strong&gt;比较优势 (Comparative Advantage)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;循环流向图 (Circular-Flow Diagram)&lt;/strong&gt;，一个对经济体的图示化表达&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;实证经济学 (Positive Economics)&lt;/strong&gt; 与 &lt;strong&gt;规范经济学 (Normative Economics)&lt;/strong&gt; 之间的区别&lt;/li&gt;
&lt;li&gt;经济学家何时意见一致，以及他们为何有时会产生分歧&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;经济学中的模型 (Models in Economics)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;定义：Economic Model&lt;/strong&gt;
&lt;strong&gt;模型 (Model)&lt;/strong&gt; 是对现实情境的简化表示，用于帮助我们更好地理解现实生活中的情况。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;经济学家使用模型的方式包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;创建一个真实但简化的经济体&lt;/strong&gt;——例如，研究香烟在二战战俘营中如何充当货币&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;在计算机上模拟经济体&lt;/strong&gt;——例如，税收模型、货币模型以及其他计算模拟&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;在使用模型时，经济学家力求将经济学尽可能地视为一门实验科学——&lt;strong&gt;一次只允许一个变量发生变化&lt;/strong&gt;。这一点由一个至关重要的假设来体现：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;&quot;其他条件不变&quot;假设 (The &quot;Other Things Equal&quot; Assumption / Ceteris Paribus)&lt;/strong&gt;
在我们分析某一因素变化所带来的影响时，所有其他相关因素均保持不变。这一假设使我们能够将因果关系孤立出来进行分析。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!tip] &lt;strong&gt;类比 (Analogy)&lt;/strong&gt;
正如&lt;strong&gt;地图&lt;/strong&gt;是对世界的一种简化表示，帮助我们理解地理一样，&lt;strong&gt;经济模型&lt;/strong&gt;也是一种简化表示，帮助我们理解现实世界的经济问题。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;权衡取舍：生产可能性边界 (Trade-offs: The Production Possibility Frontier, PPF)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;定义：Production Possibility Frontier (PPF)&lt;/strong&gt;
&lt;strong&gt;生产可能性边界 (Production Possibility Frontier, PPF)&lt;/strong&gt; 描绘了一个只生产两种商品的经济体所面临的权衡取舍。它展示了&lt;strong&gt;在给定另一种商品产量的前提下，一种商品所能生产的最大数量&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;PPF 通过以下方式帮助我们更好地理解权衡取舍：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;考虑一个&lt;strong&gt;只生产两种商品的简化经济体&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;用&lt;strong&gt;图形&lt;/strong&gt;的方式展示这种权衡取舍&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;PPF 模型有助于回答以下关键问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;我们能生产&lt;strong&gt;多少&lt;/strong&gt;？&lt;/li&gt;
&lt;li&gt;增加某种商品的生产会给我们带来&lt;strong&gt;什么代价&lt;/strong&gt;？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;是否值得从其他地方进口&lt;/strong&gt;该商品？&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;理解 PPF 图形 (Understanding the PPF Graph)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] &lt;strong&gt;解读 PPF（图 2.1）&lt;/strong&gt;
PPF 描绘了一个生产两种商品的经济体所面临的权衡取舍。以 Boeing 为例：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Boeing 能够生产的 &lt;strong&gt;Dreamliners&lt;/strong&gt; 的最大数量取决于它制造的&lt;strong&gt;小型喷气式飞机 (small jets)&lt;/strong&gt; 的数量，反之亦然。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;可行的生产区域&lt;/strong&gt;由曲线&lt;em&gt;内部或曲线上&lt;/em&gt;的面积表示。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;点 C&lt;/strong&gt; → 可行但&lt;strong&gt;没有效率&lt;/strong&gt;（资源未充分利用）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;点 A 和点 B&lt;/strong&gt; → 可行且&lt;strong&gt;在生产上是有效率的 (efficient in production)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;点 D&lt;/strong&gt; → 在给定的资源和技术条件下&lt;strong&gt;不可行&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;机会成本 (Opportunity Cost)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;定义：Opportunity Cost&lt;/strong&gt;
&lt;strong&gt;机会成本 (Opportunity Cost)&lt;/strong&gt; 是为了获得某样商品而必须放弃的东西。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;Boeing 的生产可能性表 (Production Possibilities Schedule for Boeing)&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Dreamliners&lt;/th&gt;
&lt;th&gt;Small Jets&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;30&lt;/td&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;15&lt;/td&gt;
&lt;td&gt;20&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;14.25&lt;/td&gt;
&lt;td&gt;21&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;13.5&lt;/td&gt;
&lt;td&gt;22&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;12.75&lt;/td&gt;
&lt;td&gt;23&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;12&lt;/td&gt;
&lt;td&gt;24&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;9&lt;/td&gt;
&lt;td&gt;28&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;0&lt;/td&gt;
&lt;td&gt;40&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;从表中可以看出：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;每架 Dreamliner&lt;/strong&gt; 的机会成本是 &lt;strong&gt;1⅓ 架 small jets&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;每架 Small Jet&lt;/strong&gt; 的机会成本是 &lt;strong&gt;¾ 架 Dreamliner&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;递增的机会成本 (Increasing Opportunity Cost)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Increasing Opportunity Cost&lt;/strong&gt;
随着某种商品的产量越来越大，&lt;strong&gt;多生产一单位该商品的机会成本也随之增加&lt;/strong&gt;。这是因为越来越不合适的资源被重新配置去生产该商品。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;PPF 的&lt;strong&gt;向外凸出的形状 (bowed-out shape)&lt;/strong&gt; 反映了这种递增的机会成本：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] &lt;strong&gt;解读图 2.2&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;要生产&lt;strong&gt;前 20 架 small jets&lt;/strong&gt;，Boeing 必须放弃 &lt;strong&gt;5 架 Dreamliners&lt;/strong&gt;（相对便宜）&lt;/li&gt;
&lt;li&gt;要再生产&lt;strong&gt;额外的 20 架 small jets&lt;/strong&gt;，Boeing 必须再放弃 &lt;strong&gt;25 架 Dreamliners&lt;/strong&gt;（代价大得多）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;出现这种情况的原因是，最适合生产 Dreamliners 的资源被逐步转移去制造 small jets——每多生产一架 small jet，所放弃的 Dreamliners 数量就越多。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;经济增长与 PPF (Economic Growth and the PPF)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Economic Growth&lt;/strong&gt;
&lt;strong&gt;经济增长 (Economic Growth)&lt;/strong&gt; 导致 &lt;strong&gt;PPF 向外移动&lt;/strong&gt;，因为生产可能性得到了扩展。经济体现在可以生产更多的每一种商品。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] &lt;strong&gt;解读图 2.3&lt;/strong&gt;
如果生产最初位于&lt;strong&gt;点 A&lt;/strong&gt;（20 架 small jets 和 25 架 Dreamliners），在经济增长之后，它可以移动到&lt;strong&gt;点 E&lt;/strong&gt;（25 架 small jets 和 30 架 Dreamliners）——&lt;em&gt;两种&lt;/em&gt;商品都更多了。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;经济增长有两个基本来源：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;生产要素 (factors of production) 的增加&lt;/strong&gt;——即土地 (land)、劳动 (labor)、资本 (capital) 和人力资本 (human capital) 等资源&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;技术的进步 (improved technology)&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;比较优势与贸易收益 (Comparative Advantage and Gains from Trade)&lt;/h2&gt;
&lt;h3&gt;两个国家的生产可能性 (Production Possibilities for Two Countries)&lt;/h3&gt;
&lt;p&gt;让我们考虑两个国家：&lt;strong&gt;美国 (United States)&lt;/strong&gt; 和 &lt;strong&gt;巴西 (Brazil)&lt;/strong&gt;。每个国家都有一条&lt;strong&gt;直线型的 PPF&lt;/strong&gt;（即不变的机会成本）。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] &lt;strong&gt;美国的 PPF（图 2.4，左图）&lt;/strong&gt;
对美国而言，每架 small jet 的机会成本始终是 &lt;strong&gt;¾ 架 large jet&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] &lt;strong&gt;巴西的 PPF（图 2.4，右图）&lt;/strong&gt;
对巴西而言，每架 small jet 的机会成本始终是 &lt;strong&gt;⅓ 架 large jet&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;比较机会成本 (Comparing Opportunity Costs)&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;美国的机会成本 (U.S. Opportunity Cost)&lt;/th&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;巴西的机会成本 (Brazilian Opportunity Cost)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;一架 small jet&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;¾ 架 large jet&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;&amp;gt;&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;⅓ 架 large jet&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;一架 large jet&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;⁴⁄₃ 架 small jets&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;&amp;lt;&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;3 架 small jets&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;巴西生产 small jets 的&lt;strong&gt;机会成本更低&lt;/strong&gt;（⅓ vs. ¾ 架 large jet）。美国生产 large jets 的&lt;strong&gt;机会成本更低&lt;/strong&gt;（⁴⁄₃ vs. 3 架 small jets）。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Comparative Advantage&lt;/strong&gt;
如果一个国家在生产某种商品时拥有&lt;strong&gt;最低的机会成本&lt;/strong&gt;，那么该国在该商品的生产上具有&lt;strong&gt;比较优势 (Comparative Advantage)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;当两个国家各自专门生产自己具有比较优势的商品，然后进行贸易时，双方都会变得更好：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;巴西&lt;/strong&gt;应当为两个国家制造 small jets → 它的机会成本仅为 ⅓ 架 large jet（而美国为 ¾ 架）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;美国&lt;/strong&gt;应当为两个国家制造 large jets → 它的机会成本仅为 ⁴⁄₃ 架 small jets（而巴西为 3 架）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;可视化贸易收益 (Visualizing Gains from Trade)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!note] &lt;strong&gt;图 2.5：Comparative Advantage 与贸易收益&lt;/strong&gt;
通过专业化分工和贸易，两个国家可以生产&lt;strong&gt;并消费&lt;/strong&gt;更多的两种商品：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;巴西专门生产 small jets（其比较优势所在）&lt;/li&gt;
&lt;li&gt;美国专门生产 large jets（其比较优势所在）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;结果：&lt;/strong&gt; 每个国家都可以比不进行贸易时消费更多的两种商品。&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;量化贸易收益 (Quantifying the Gains)&lt;/h3&gt;
&lt;p&gt;美国和巴西都从贸易中获得了收益：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;美国的消费&lt;/strong&gt;：large jets 增加了 &lt;strong&gt;2&lt;/strong&gt; 架，small jets 增加了 &lt;strong&gt;4&lt;/strong&gt; 架&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;巴西的消费&lt;/strong&gt;：large jets 增加了 &lt;strong&gt;2&lt;/strong&gt; 架，small jets 增加了 &lt;strong&gt;4&lt;/strong&gt; 架&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;美国在生产 large jets 方面具有&lt;strong&gt;比较优势 (comparative advantage)&lt;/strong&gt;，在生产 small jets 方面具有&lt;strong&gt;比较劣势 (comparative disadvantage)&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;比较优势 vs. 绝对优势 (Comparative vs. Absolute Advantage)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] &lt;strong&gt;不要混淆 Comparative Advantage 和 Absolute Advantage！&lt;/strong&gt;
这是经济学中最常见的错误之一。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Absolute Advantage&lt;/strong&gt;
如果一个人（或国家）在某项活动中能够比别人做得更好——用同样的资源生产出更多的产出——那么他（或该国）就具有&lt;strong&gt;绝对优势 (Absolute Advantage)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Comparative Advantage&lt;/strong&gt;
如果一个人（或国家）生产某种商品的&lt;strong&gt;机会成本&lt;/strong&gt;比别人&lt;strong&gt;更低&lt;/strong&gt;，那么他（或该国）就具有&lt;strong&gt;比较优势 (Comparative Advantage)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;关键洞察：&lt;/strong&gt; 仅仅因为美国在&lt;em&gt;两种&lt;/em&gt;商品上都能生产得更多（即在两种商品上都具有绝对优势），并不意味着我们不进行贸易会更好。要关注&lt;strong&gt;机会成本&lt;/strong&gt;：既然巴西生产 small jets 的成本更低，美国&lt;em&gt;将会从&lt;/em&gt;从巴西进口 small jets 中获益。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;课堂练习：检验你的理解 (Class Exercise: Check Your Understanding)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] &lt;strong&gt;练习题 (Practice Problem)&lt;/strong&gt;
假设在澳大利亚，一个工人收获 10 公斤苹果需要 &lt;strong&gt;2 小时&lt;/strong&gt;，收获 10 公斤西红柿需要 &lt;strong&gt;4 小时&lt;/strong&gt;。假设在巴西，一个工人收获 10 公斤苹果需要 &lt;strong&gt;4 小时&lt;/strong&gt;，收获 10 公斤西红柿需要 &lt;strong&gt;5 小时&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;以下哪个陈述是正确的？&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;A. 巴西在生产西红柿方面具有比较优势&lt;/li&gt;
&lt;li&gt;B. 巴西在生产苹果方面具有比较优势&lt;/li&gt;
&lt;li&gt;C. 巴西在两种商品的生产上都具有绝对优势&lt;/li&gt;
&lt;li&gt;D. 在这两个国家之间的贸易中，澳大利亚会获益而巴西会受损&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!success] &lt;strong&gt;答案：A — 巴西在生产西红柿方面具有比较优势。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;逐步解析：&lt;/strong&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;在&lt;strong&gt;澳大利亚&lt;/strong&gt;，收获 10 蒲式耳西红柿的机会成本是 &lt;strong&gt;20 蒲式耳苹果&lt;/strong&gt;（西红柿 4 小时 ÷ 苹果 2 小时 = 2 倍时间 → 2 × 10 = 放弃 20 个苹果）&lt;/li&gt;
&lt;li&gt;在&lt;strong&gt;巴西&lt;/strong&gt;，收获 10 蒲式耳西红柿的机会成本是 &lt;strong&gt;12.5 蒲式耳苹果&lt;/strong&gt;（西红柿 5 小时 ÷ 苹果 4 小时 = 1.25 倍时间 → 1.25 × 10 = 放弃 12.5 个苹果）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;澳大利亚&lt;/strong&gt;在两种商品上都具有&lt;em&gt;绝对优势&lt;/em&gt;（每种商品所需时间都更少），但在种植西红柿方面也表现出&lt;em&gt;更高的机会成本&lt;/em&gt;（20 vs. 12.5 个苹果）&lt;/li&gt;
&lt;li&gt;因此，&lt;strong&gt;巴西&lt;/strong&gt;在西红柿方面具有&lt;strong&gt;比较优势&lt;/strong&gt;（机会成本更低）&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;交易：循环流向图 (Transactions: The Circular-Flow Diagram)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;The Circular-Flow Diagram&lt;/strong&gt;
&lt;strong&gt;循环流向图 (Circular-Flow Diagram)&lt;/strong&gt; 是对经济体中生产与交易的一种图示化表达。实物（商品、服务、劳动、原材料）的流动沿着&lt;strong&gt;一个方向&lt;/strong&gt;进行，而用于支付这些实物的&lt;strong&gt;货币&lt;/strong&gt;则沿着&lt;strong&gt;相反的方向&lt;/strong&gt;流动。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;逐步构建循环流向图 (Building the Circular-Flow, Piece by Piece)&lt;/h3&gt;
&lt;p&gt;循环流向图将两个关键的经济主体联系起来：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Households&lt;/strong&gt;
&lt;strong&gt;家庭 (Household)&lt;/strong&gt; 是一个人或一群共享收入的人。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Firms&lt;/strong&gt;
&lt;strong&gt;企业 (Firm)&lt;/strong&gt; 是生产商品和服务以供出售的组织。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;家庭 (Households)：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;拥有&lt;strong&gt;生产要素 (factors of production)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;将其出租给企业以获取&lt;strong&gt;收入&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;使用收入来&lt;strong&gt;购买和消费&lt;/strong&gt;商品和服务&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;企业 (Firms)：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;雇用&lt;/strong&gt;生产要素&lt;/li&gt;
&lt;li&gt;使用它们来&lt;strong&gt;生产&lt;/strong&gt;商品和服务&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;出售&lt;/strong&gt;商品和服务以获得资金来支付家庭&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;两个关键市场 (Two Key Markets)&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;商品与服务市场 (Markets for Goods and Services)&lt;/strong&gt;——企业将其生产的商品和服务出售给家庭&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;要素市场 (Factor Markets)&lt;/strong&gt;——企业购买其生产所需的资源（即生产要素）&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] &lt;strong&gt;为什么 Factor Markets 很重要&lt;/strong&gt;
要素市场决定了经济体的&lt;strong&gt;收入如何分配 (income is distributed)&lt;/strong&gt;——即生产成果如何在各种生产要素的所有者之间进行划分。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;使用模型：实证经济学与规范经济学 (Using Models: Positive vs. Normative Economics)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Positive Economics&lt;/strong&gt;
&lt;strong&gt;实证经济学 (Positive Economics)&lt;/strong&gt; 是描述经济体&lt;strong&gt;实际如何运作&lt;/strong&gt;的经济分析分支。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;预测 (Forecast)&lt;/strong&gt; 是对未来的简单预言，属于实证经济学的范畴。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;示例：&lt;/strong&gt; &quot;如果政府对这个市场增税，生产数量将会下降。&quot;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &lt;strong&gt;Normative Economics&lt;/strong&gt;
&lt;strong&gt;规范经济学 (Normative Economics)&lt;/strong&gt; 对经济体&lt;strong&gt;应该如何运作&lt;/strong&gt;做出&lt;strong&gt;规范性建议 (prescriptions)&lt;/strong&gt;。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;示例：&lt;/strong&gt; &quot;政府在关注经济增长的同时，也应该同样关注环境退化问题。&quot;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!important] &lt;strong&gt;关键区别 (Key Distinction)&lt;/strong&gt;
经济学家可以为&lt;strong&gt;实证性问题&lt;/strong&gt;找到&lt;strong&gt;正确答案&lt;/strong&gt;，但对于涉及&lt;strong&gt;价值判断 (value judgments)&lt;/strong&gt; 的&lt;strong&gt;规范性问题&lt;/strong&gt;，通常无法做到这一点。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;快速判断：实证还是规范？(Quick Check: Positive or Normative?)&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;陈述 (Statement)&lt;/th&gt;
&lt;th&gt;类型 (Type)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;超过 60% 的女性参与劳动力市场&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;实证 (Positive)&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;应该实施租金管制法，因为它们有助于实现住房的公平或公正&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;规范 (Normative)&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;社会应该采取措施终结枪支暴力&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;规范 (Normative)&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;吸烟者将增加的医疗成本转嫁给了整个社会&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;实证 (Positive)&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;单身母亲陷入贫困的可能性是已婚母亲的两倍以上&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;实证 (Positive)&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;经济学家何时以及为何产生分歧 (When and Why Economists Disagree)&lt;/h2&gt;
&lt;p&gt;报纸往往倾向于&lt;strong&gt;夸大&lt;/strong&gt;经济学家之间观点的差异。经济学家之间存在合法分歧的主要原因有两个：&lt;/p&gt;
&lt;h3&gt;1. 关于模型的分歧 (Disagreement about Models)&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;经济建模需要进行&lt;strong&gt;简化假设 (simplifying assumptions)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;两位经济学家可以合理地就&lt;strong&gt;哪些模型和简化方式更为恰当&lt;/strong&gt;产生分歧&lt;/li&gt;
&lt;li&gt;在大多数情况下，这类争议&lt;strong&gt;最终会得到解决&lt;/strong&gt;（尽管可能需要很长时间）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;2. 关于价值观的分歧 (Disagreement about Values)&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;经济学家可能会就哪个更重要产生分歧：&lt;strong&gt;收入不平等 (income inequality)&lt;/strong&gt; 还是&lt;strong&gt;收入增长 (income growth)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;经济学常常&lt;strong&gt;与政治纠缠在一起&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;强大的利益集团会寻找并推广那些给出支持性意见的经济学家&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;本章总结 (Chapter Summary)&lt;/h2&gt;
&lt;h3&gt;1. 经济学中的模型 (Models in Economics)&lt;/h3&gt;
&lt;p&gt;几乎所有的经济学都建立在&lt;strong&gt;模型&lt;/strong&gt;之上。经济模型中一个重要的假设是**&quot;其他条件不变&quot;假设 (the &quot;other things equal&quot; assumption / ceteris paribus)**，它允许我们在保持所有其他相关因素不变的情况下，分析某一因素变化所带来的影响。&lt;/p&gt;
&lt;h3&gt;2. 生产可能性边界 (The Production Possibility Frontier, PPF)&lt;/h3&gt;
&lt;p&gt;一个重要的经济模型是&lt;strong&gt;生产可能性边界 (production possibility frontier)&lt;/strong&gt;。它说明了：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;机会成本 (Opportunity cost)&lt;/strong&gt;——必须放弃的东西&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;效率 (Efficiency)&lt;/strong&gt;——在边界上生产 vs. 在边界内部生产&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;经济增长 (Economic growth)&lt;/strong&gt;——PPF 向外移动&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;经济增长有两个基本来源：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;生产要素 (factors of production)&lt;/strong&gt; 的增加（土地、劳动、资本、人力资本）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;技术的进步 (improved technology)&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;3. 比较优势与贸易收益 (Comparative Advantage and Gains from Trade)&lt;/h3&gt;
&lt;p&gt;另一个重要模型是&lt;strong&gt;比较优势 (comparative advantage)&lt;/strong&gt;，它解释了个人和国家之间贸易收益的来源。每个人在某种事物上都具有比较优势。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 这常常与&lt;strong&gt;绝对优势 (absolute advantage)&lt;/strong&gt; 混淆——后者是指比任何人都更好地生产某种商品或服务的能力。关键在于&lt;strong&gt;机会成本&lt;/strong&gt;，而非绝对的生产率。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4. 循环流向图 (The Circular-Flow Diagram)&lt;/h3&gt;
&lt;p&gt;在最简单的经济体中，人们进行&lt;strong&gt;物物交换 (barter)&lt;/strong&gt;，即用商品和服务直接相互交换——而不是像现代经济体那样用货币进行交易。&lt;strong&gt;循环流向图 (circular-flow diagram)&lt;/strong&gt; 将经济体内部的交易表示为家庭与企业之间商品、服务和货币的流动。这些交易发生在以下市场：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;商品与服务市场 (markets for goods and services)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;要素市场 (factor markets)&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;5. 实证经济学与规范经济学 (Positive vs. Normative Economics)&lt;/h3&gt;
&lt;p&gt;经济学家将经济模型用于：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;实证经济学 (Positive economics)&lt;/strong&gt;，描述经济体&lt;em&gt;实际上如何运作&lt;/em&gt;（通常涉及做出预测）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;规范经济学 (Normative economics)&lt;/strong&gt;，规定经济体&lt;em&gt;应该如何运作&lt;/em&gt;（涉及价值判断）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;经济学家可以为实证性问题找到正确答案，但通常无法为规范性问题做到这一点。&lt;/p&gt;
&lt;h3&gt;6. 经济学家为何产生分歧 (Why Economists Disagree)&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;他们可能就&lt;strong&gt;在模型中采用哪些简化方式&lt;/strong&gt;产生分歧&lt;/li&gt;
&lt;li&gt;他们可能——和所有人一样——就&lt;strong&gt;价值观&lt;/strong&gt;产生分歧&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;关键术语 (Key Terms)&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;术语 (Term)&lt;/th&gt;
&lt;th&gt;定义 (Definition)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Model&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;对现实情境的简化表示，用于理解现实生活中的情况&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Other things equal assumption&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;在分析某一变量时，所有其他相关因素均保持不变 (ceteris paribus)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Production possibility frontier (PPF)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;一张图，展示在给定另一种商品产量的前提下，一种商品所能生产的最大数量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Factors of production&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;用于生产商品和服务的资源（土地、劳动、资本、人力资本）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Technology&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;生产商品和服务的技术手段&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Comparative advantage&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;生产者因生产某种商品的机会成本最低而持有的优势&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Absolute advantage&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;比其他人更好（更有效率）地生产某种商品或服务的能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Barter&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;直接用商品和服务相互交换&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Circular-flow diagram&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;将交易表示为商品、服务和货币流动的图示化表达&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Household&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;一个或一群共享收入的人&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Firm&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;生产商品和服务以供出售的组织&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Markets for goods and services&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;企业将商品和服务出售给家庭的市场&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Factor markets&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;企业从家庭购买生产要素的市场&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Income distribution&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;总收入如何在各种生产要素的所有者之间进行划分&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Positive economics&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;描述经济体实际如何运作的经济分析&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Normative economics&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;规定经济体应该如何运作的经济分析&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Forecast&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;对未来的简单预测&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Specialization&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;专注于生产自己具有比较优势的商品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Equilibrium&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;经济力量达到平衡的状态&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Efficient&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;在给定可用资源的情况下生产出最大可能的产出&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Equity&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;经济成果分配中的公平性&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
</content:encoded></item><item><title>ECO2011 C3：Consumer and Producer Surplus</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c3-consumer-and-producer-surplus/chapter-4---consumer-and-producer-surplus/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c3-consumer-and-producer-surplus/chapter-4---consumer-and-producer-surplus/</guid><pubDate>Thu, 04 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 4: Consumer and Producer Surplus&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心主题
本章从&lt;strong&gt;福利经济学 (Welfare Economics)&lt;/strong&gt; 的视角出发，探讨资源配置如何影响经济福祉 (economic well-being)。核心问题是：市场均衡能否实现社会总剩余的最大化？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;1. 福利经济学基础概念&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 关键术语&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;效用 (Utility)&lt;/strong&gt;：消费者从消费中获得的利益 (benefit that consumers derive from consumption)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;购买意愿 (Willingness to Pay, WTP)&lt;/strong&gt;：买家愿意为一件商品支付的最高金额 (maximum amount that a buyer will pay for a good)；它代表了买家从该商品中能获得的效用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;生产成本 (Production Cost)&lt;/strong&gt;：卖家为生产一件商品必须放弃的一切的价值 (value of everything a seller must give up to produce a good)；它衡量了卖家的&lt;strong&gt;出售意愿 (willingness to sell)&lt;/strong&gt;，即卖家愿意出售的最低价格&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;这两个基础概念构成了本章全部分析的起点：WTP 决定了需求曲线 (Demand Curve)，而生产成本决定了供给曲线 (Supply Curve)。&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;2. 本章学习目标&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] WHAT YOU WILL LEARN&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;消费者剩余 (Consumer Surplus)&lt;/strong&gt; 是什么，以及它与需求曲线的关系&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;生产者剩余 (Producer Surplus)&lt;/strong&gt; 是什么，以及它与供给曲线的关系&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总剩余 (Total Surplus)&lt;/strong&gt; 是什么，如何用它衡量贸易收益 (gains from trade)，以及为什么它能说明市场运作的优良&lt;/li&gt;
&lt;li&gt;为什么&lt;strong&gt;产权 (Property Rights)&lt;/strong&gt; 和作为经济信号的&lt;strong&gt;价格 (Prices as Economic Signals)&lt;/strong&gt; 对市场的顺畅运行至关重要&lt;/li&gt;
&lt;li&gt;为什么市场通常能带来&lt;strong&gt;有效结果 (efficient outcomes)&lt;/strong&gt;，尽管市场有时也会&lt;strong&gt;失灵 (fail)&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;3. 消费者剩余与需求曲线 (Consumer Surplus and the Demand Curve)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;个人消费者剩余 (Individual Consumer Surplus)&lt;/strong&gt;：单个买家从购买商品中获得的净收益 (net gain)，等于买家的 &lt;strong&gt;购买意愿 (Willingness to Pay)&lt;/strong&gt; 与 &lt;strong&gt;市场价格 (Market Price)&lt;/strong&gt; 之间的差额。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总消费者剩余 (Total Consumer Surplus)&lt;/strong&gt;：市场中所有买家的个人消费者剩余之和。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;在任意数量下，需求曲线给出的价格等于&lt;strong&gt;边际买家 (Marginal Buyer)&lt;/strong&gt; 的购买意愿。因此，需求曲线反映了买家的购买意愿，消费者剩余就是&lt;strong&gt;需求曲线下方、市场价格上方的面积&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.1 二手教科书的需求曲线&lt;/h3&gt;
&lt;p&gt;下面是二手教科书市场的一个简单模型，仅有五位潜在消费者。由于人数有限，需求曲线呈阶梯状 (step-shaped)：每一个台阶代表一位消费者，台阶的高度表示该消费者的 WTP。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Potential Buyers&lt;/th&gt;
&lt;th&gt;Willingness to Pay&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Aleisha&lt;/td&gt;
&lt;td&gt;$59&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Brad&lt;/td&gt;
&lt;td&gt;$45&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Claudia&lt;/td&gt;
&lt;td&gt;$35&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Darren&lt;/td&gt;
&lt;td&gt;$25&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Edwina&lt;/td&gt;
&lt;td&gt;$10&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;这张表与传统的 Demand Schedule（需求表）逻辑一致——当价格高于某人的 WTP 时，该消费者不会购买；当价格等于或低于 WTP 时，消费者才会购买。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;Figure 4-1 &amp;amp; 4-2: Consumer Surplus in the Used Textbook Market&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-1 解读（来自演讲者备注）
市场中仅有五位潜在消费者，因此需求曲线呈阶梯状。每一个台阶代表一位消费者，其高度表示该消费者的 WTP。Aleisha 的 WTP 最高，为 $59；Brad 为 $45；Claudia 为 $35；Darren 为 $25；Edwina 最低，为 $10。当价格为 $59 时，需求量仅为一本（Aleisha）；价格为 $45 时，需求量为两本（Aleisha + Brad），以此类推，直到价格降至 $10 时，五位学生才全部愿意购买。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.2 计算消费者剩余&lt;/h3&gt;
&lt;p&gt;当市场价格为 $30 时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Aleisha 的剩余 = $59 − $30 = &lt;strong&gt;$29&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Brad 的剩余 = $45 − $30 = &lt;strong&gt;$15&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Claudia 的剩余 = $35 − $30 = &lt;strong&gt;$5&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Darren (WTP $25 &amp;lt; $30) 和 Edwina (WTP $10 &amp;lt; $30) 不会购买，剩余为 $0&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总消费者剩余 = $29 + $15 + $5 = $49&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-2 解读（来自演讲者备注）
在价格为 $30 时，Aleisha、Brad 和 Claudia 各自购买了一本书，而 Darren 和 Edwina 则不买。三人的个人消费者剩余由阴影矩形的面积表示。总消费者剩余为整个阴影区域——$29 + $15 + $5 = $49。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;3.3 平滑需求曲线下的消费者剩余&lt;/h3&gt;
&lt;p&gt;当市场中有大量潜在买家时，需求曲线变得平滑。以 iPad 为例：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;Figure 4-3: Consumer Surplus (iPads)&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-3 解读（来自演讲者备注）
由于存在大量潜在买家，iPad 的需求曲线是平滑的。当价格为 $500 时，需求量为 100 万台。此价格下的消费者剩余等于阴影区域——需求曲线下方、价格上方的面积。这个面积代表了消费者在价格为 $500 时购买和消费 iPad 所获的总净收益。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;4. 价格变动如何影响消费者剩余&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心原理
价格下降会&lt;strong&gt;增加&lt;/strong&gt;消费者剩余（买家总是希望支付更低的价格）。&lt;/p&gt;
&lt;p&gt;价格下降通过两个渠道增加消费者剩余：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;原有买家的收益&lt;/strong&gt; (gain to original buyers)：在原价就会购买的消费者，现在享受更低的价格&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;新增买家的收益&lt;/strong&gt; (gain to new buyers)：被更低的价格吸引而进入市场的新消费者&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.1 教科书市场：价格从 $30 降至 $20&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;Figure 4-4: Consumer Surplus and a Fall in the Price of Used Textbooks&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-4 解读（来自演讲者备注）
价格从 $30 降至 $20 带来的消费者剩余增加包含两部分：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;深蓝色矩形&lt;/strong&gt;：原价 $30 时就会购买的三人 (Aleisha, Brad, Claudia)，每人获得 $10 的剩余增加 → 3 × $10 = $30&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;浅蓝色三角形&lt;/strong&gt;：原价下不会购买，但新价下愿意购买的 Darren。Darren 的 WTP 为 $25，现在获得消费者剩余 $5&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总增加额 = $30 + $5 = $35&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;同理，如果价格从 $20 涨回 $30，消费者剩余将减少同样的金额 ($35)。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;4.2 iPad 市场：价格从 $2,000 降至 $500&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;Figure 4-5: A Fall in the Market Price Increases Consumer Surplus&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-5 解读（来自演讲者备注）
iPad 价格从 $2,000 降至 $500，导致需求量和消费者剩余同时增加。总消费者剩余的变化等于两个阴影区域之和：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;深蓝色区域&lt;/strong&gt;：代表原有 200,000 位消费者每人获得 $1,500 的剩余增加&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;浅蓝色区域&lt;/strong&gt;：代表那些 WTP 在 $500 至 $2,000 之间的新增消费者获得的剩余&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;反之，价格上涨将导致消费者剩余等量减少。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂思考
价格下跌时，哪类消费者获益更多——是原有买家还是新增买家？为什么经济学家要区分这两个渠道？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;5. 生产者剩余与供给曲线 (Producer Surplus and the Supply Curve)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;成本 (Cost)&lt;/strong&gt;：潜在卖家愿意出售商品的最低价格 (lowest price at which a seller is willing to sell)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;个人生产者剩余 (Individual Producer Surplus)&lt;/strong&gt;：单个卖家从销售中获得的净收益，等于&lt;strong&gt;实际收到的价格&lt;/strong&gt;与&lt;strong&gt;卖家成本&lt;/strong&gt;之间的差额&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总生产者剩余 (Total Producer Surplus)&lt;/strong&gt;：市场中所有卖家的个人生产者剩余之和&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.1 二手教科书的供给曲线&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Potential Sellers&lt;/th&gt;
&lt;th&gt;Cost&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Engelbert&lt;/td&gt;
&lt;td&gt;$5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Donna&lt;/td&gt;
&lt;td&gt;$15&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Carlos&lt;/td&gt;
&lt;td&gt;$25&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Betty&lt;/td&gt;
&lt;td&gt;$35&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Andrew&lt;/td&gt;
&lt;td&gt;$45&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;当市场价格为 $30 时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Andrew (成本 $5) 的剩余 = $30 − $5 = &lt;strong&gt;$25&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Betty (成本 $15) 的剩余 = $30 − $15 = &lt;strong&gt;$15&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Carlos (成本 $25) 的剩余 = $30 − $25 = &lt;strong&gt;$5&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Donna (成本 $35 &amp;gt; $30) 和 Engelbert (成本 $45 &amp;gt; $30) 不会出售，剩余为 $0&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总生产者剩余 = $25 + $15 + $5 = $45&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;Figure 4-7: Producer Surplus in the Used-Textbook Market&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-7 解读（来自演讲者备注）
在价格 $30 时，Andrew、Betty 和 Carlos 各自卖出一本书并获得生产者剩余（阴影矩形）。Donna 和 Engelbert 的成本高于 $30，故不愿出售，剩余为零。总生产者剩余为整个阴影区域 → $25 + $15 + $5 = $45。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;5.2 平滑供给曲线下的生产者剩余&lt;/h3&gt;
&lt;p&gt;以小麦 (wheat) 市场为例：&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;Figure 4-8: Producer Surplus (Wheat)&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-8 解读（来自演讲者备注）
这是小麦的供给曲线。在每蒲式耳 $5 的价格下，农民供应 100 万蒲式耳。此价格下的生产者剩余等于阴影区域——供给曲线上方、价格下方的面积。这是生产者（农民）以 $5 的价格供应产品所获得的总收益。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;6. 价格变动如何影响生产者剩余&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心原理
价格上升会&lt;strong&gt;增加&lt;/strong&gt;生产者剩余（卖家总是希望收到更高的价格）。&lt;/p&gt;
&lt;p&gt;价格上升通过两个渠道增加生产者剩余：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;原有卖家的收益&lt;/strong&gt; (gain to original sellers)：在原价就会出售的生产者&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;新增卖家的收益&lt;/strong&gt; (gain to new sellers)：被高价吸引进入市场的新生产者&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h3&gt;6.1 小麦市场：价格从 $5 升至 $7&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_17.png&quot; alt=&quot;Figure 4-9: A Rise in the Price Increases Producer Surplus&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-9 解读（来自演讲者备注）
小麦价格从 $5 升至 $7，供给量从 100 万增至 150 万蒲式耳：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;深红色矩形&lt;/strong&gt;：原有 100 万蒲式耳的供应者，每蒲式耳获得 $2 的额外生产者剩余&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;浅红色三角形&lt;/strong&gt;：新增 50 万蒲式耳的供应者所获得的生产者剩余&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;同理，价格下跌将导致生产者剩余等量减少。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;7. 总剩余与贸易收益 (Total Surplus and the Gains from Trade)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 定义
&lt;strong&gt;总剩余 (Total Surplus)&lt;/strong&gt; = 消费者剩余 (Consumer Surplus) + 生产者剩余 (Producer Surplus)&lt;/p&gt;
&lt;p&gt;总剩余是市场中消费者和生产者从交易中获得的总净收益 (total net gain)，也是社会从商品的生产和消费中获得的总利益。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;7.1 总剩余的图示&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;Figure 4-11: Total Surplus&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-11 解读（来自演讲者备注）
在二手教科书市场中，均衡价格为 $30，均衡数量为 1,000 本书：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;蓝色区域&lt;/strong&gt; = 消费者剩余（需求曲线下方、价格上方）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;红色区域&lt;/strong&gt; = 生产者剩余（供给曲线上方、价格下方）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;蓝色 + 红色&lt;/strong&gt; = 总剩余，即社会从生产和消费该商品中获得的全部利益&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;7.2 贸易收益的含义&lt;/h3&gt;
&lt;p&gt;消费者和生产者之所以比没有市场时变得更好，正是因为存在&lt;strong&gt;贸易收益 (Gains from Trade)&lt;/strong&gt;。这些贸易收益解释了为什么参与市场经济比每个人都自给自足要好。&lt;/p&gt;
&lt;p&gt;但这就引出了一个更深层次的问题：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 核心问题
我们是否已经达到了&lt;strong&gt;最大化&lt;/strong&gt;的福祉？这引出了市场&lt;strong&gt;效率 (Efficiency)&lt;/strong&gt; 的问题。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;8. 市场的效率：一个初步观点 (The Efficiency of Markets: A Preliminary View)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心论断
&lt;strong&gt;在竞争市场均衡 (Market Equilibrium) 下，总剩余达到最大可能值。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;市场均衡以如下方式配置消费和生产：使社会获得最高可能的收益。任何偏离市场均衡的改变都会&lt;strong&gt;降低&lt;/strong&gt;总剩余。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;8.1 三种可能&quot;改善&quot;总剩余的尝试——为什么它们都失败了&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 重要论证&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;经济学家考虑了三种试图增加总剩余的方法，结果证明&lt;strong&gt;全部都会降低总剩余&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;方式&lt;/th&gt;
&lt;th&gt;操作&lt;/th&gt;
&lt;th&gt;结果&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;重新分配消费&lt;/strong&gt; (Reallocate Consumption)&lt;/td&gt;
&lt;td&gt;将商品从市场均衡中的买家手中夺走，交给原本不会购买的潜在消费者&lt;/td&gt;
&lt;td&gt;消费者剩余降低&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;重新分配销售&lt;/strong&gt; (Reallocate Sales)&lt;/td&gt;
&lt;td&gt;阻止市场均衡中的卖家出售，强迫原本不会出售的潜在卖家出售&lt;/td&gt;
&lt;td&gt;生产者剩余降低&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;改变交易数量&lt;/strong&gt; (Change Quantity)&lt;/td&gt;
&lt;td&gt;强迫交易多于或少于均衡数量&lt;/td&gt;
&lt;td&gt;总剩余降低&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h4&gt;8.1.1 重新分配消费降低消费者剩余&lt;/h4&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;Figure 4-12: Reallocating Consumption Lowers Consumer Surplus&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-12 解读（来自演讲者备注）
Ana (点 A) 的 WTP 为 $35，Bob (点 B) 的 WTP 仅为 $25。在市场均衡价格 $30 下，Ana 购买了一本书而 Bob 没有。如果我们将书从 Ana 手中拿走交给 Bob，消费者剩余将减少 $10 (即 $35 − $25)，因此总剩余也减少 $10。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;8.1.2 重新分配销售降低生产者剩余&lt;/h4&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;Figure 4-13: Reallocating Sales Lowers Producer Surplus&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-13 解读（来自演讲者备注）
Yvonne (点 Y) 的成本为 $35，Xavier (点 X) 的成本为 $25。在市场均衡价格 $30 下，Xavier 卖书而 Yvonne 不卖。如果我们阻止 Xavier 出售，并强迫 Yvonne 出售她的书，生产者剩余将减少 $10 (即 $35 − $25)，总剩余也随之减少 $10。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;8.1.3 改变交易数量降低总剩余&lt;/h4&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;Figure 4-14a: Changing the Quantity Lowers Total Surplus — Below Equilibrium&quot; /&gt;
&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;Figure 4-14b: Changing the Quantity Lowers Total Surplus — Above Equilibrium&quot; /&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 图 4-14 解读（来自演讲者备注）&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;低于均衡数量 (Q &amp;lt; 1,000)&lt;/strong&gt;：如果阻止 Xavier (点 X, 成本 $25) 将书卖给像 Ana (点 A, WTP $35) 这样的人，总剩余将下降 $10 (= $35 − $25)。即，任何低于均衡数量 1,000 的交易水平都会使总剩余下降。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;高于均衡数量 (Q &amp;gt; 1,000)&lt;/strong&gt;：如果强迫 Yvonne (点 Y, 成本 $35) 将书卖给像 Bob (点 B, WTP $25) 这样的人，总剩余同样下降 $10 (= $35 − $25)。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;结论&lt;/strong&gt;：在市场均衡下，所有互惠交易——且&lt;strong&gt;仅&lt;/strong&gt;有互惠交易——才会发生。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;8.2 均衡数量的效率&lt;/h3&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;The Efficiency of the Equilibrium Quantity&quot; /&gt;&lt;/p&gt;
&lt;p&gt;上图清晰地展示了为什么均衡数量是最优的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;在均衡数量左侧&lt;/strong&gt; (如 $Q_1$)：买家估值 (Value to Buyers) &amp;gt; 卖家成本 (Cost to Sellers) → 存在尚未实现的互惠交易，应增加产量&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;在均衡数量右侧&lt;/strong&gt; (如 $Q_2$)：买家估值 &amp;lt; 卖家成本 → 交易不再互惠，应减少产量&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仅在均衡数量处&lt;/strong&gt;：买家估值恰好覆盖卖家成本，所有互惠交易均已实现&lt;/li&gt;
&lt;/ul&gt;
&lt;hr /&gt;
&lt;h2&gt;9. 市场均衡最大化总剩余的四项功能&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 四项功能 (Four Functions of Market Equilibrium)&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;市场均衡通过以下四项功能实现总剩余最大化：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;将消费分配给最看重商品的潜在买家&lt;/strong&gt;——即那些 WTP 最高的消费者&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;将销售分配给最看重销售权的潜在卖家&lt;/strong&gt;——即那些成本最低的生产者&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;确保每个实际购买的消费者对商品的估值，高于每个实际出售的卖家的成本&lt;/strong&gt;——所有发生的交易都是互惠 (mutually beneficial) 的&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;确保每个未购买的潜在消费者对商品的估值，低于每个未出售的潜在卖家的成本&lt;/strong&gt;——不存在被遗漏的互惠交易&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;这四项功能执行完毕后，任何偏离市场均衡的资源配置方式都会降低总剩余。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;10. 市场效率 vs. 公平 (Efficiency vs. Equality)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 类比：分蛋糕 (The Pie Analogy)&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;效率 (Efficiency)&lt;/strong&gt;：蛋糕是否做得尽可能大？即社会所有成员获得的总剩余是否最大化？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;公平/平等 (Equality)&lt;/strong&gt;：蛋糕如何切分？即经济繁荣是否在社会成员之间均匀分配？&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;11. 市场效率的三个注意事项 (Three Caveats)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] Caveat 1: 效率 ≠ 公平
市场可能是&lt;strong&gt;有效率&lt;/strong&gt;的，但不一定是&lt;strong&gt;公平&lt;/strong&gt;的。事实上，公平 (equity/fairness) 常常与效率发生冲突。因为社会关心公平，政府以降低效率为代价换取更大公平的干预可能是合理的。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] Caveat 2: 市场可能失灵 (Market Failure)
在某些明确界定的条件下，市场可能无法实现效率。当这种情况发生时，市场不再最大化总剩余。典型的市场失灵来源包括：外部性 (externalities)、公共品 (public goods)、不完全竞争 (imperfect competition) 等。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] Caveat 3: 效率 ≠ 每个人都得到最好结果
即使市场均衡最大化总剩余，也&lt;strong&gt;不意味着它对每个个体消费者和生产者都是最好的结果&lt;/strong&gt;。例如，一个维持高价的&lt;strong&gt;价格下限 (Price Floor)&lt;/strong&gt; 会让某些卖家受益。但在市场均衡下，没有任何办法可以在不损害他人的情况下使某些人变得更好——这正是&lt;strong&gt;效率&lt;/strong&gt;的定义（即&lt;strong&gt;帕累托效率, Pareto Efficiency&lt;/strong&gt;）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;12. 为什么市场通常运作得如此之好&lt;/h2&gt;
&lt;p&gt;经济学家写下了浩繁的著作来解释为什么市场是组织经济的有效方式。归根结底，运转良好的市场效力于两大强大特征：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 两大支柱&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;产权 (Property Rights)&lt;/strong&gt;：有价值物品（资源或商品）的所有者有权按自己的意愿处置这些物品的权利&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;作为经济信号的价格 (Prices as Economic Signals)&lt;/strong&gt;：&lt;strong&gt;经济信号 (Economic Signal)&lt;/strong&gt; 是帮助人们做出更好经济决策的任何信息。价格是其中最关键的信号——它汇集了关于稀缺性、消费者偏好和生产成本的信息&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;13. 案例研究：器官应该有市场吗？(Should There Be a Market in Organs?)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] ECONOMICS IN ACTION&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h3&gt;背景故事&lt;/h3&gt;
&lt;p&gt;一位母亲的爱如何挽救了两条生命：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Ms. Stevens 的儿子需要肾脏移植&lt;/li&gt;
&lt;li&gt;母亲的肾脏与儿子不兼容&lt;/li&gt;
&lt;li&gt;她将自己的一个肾脏捐给了一位陌生人&lt;/li&gt;
&lt;li&gt;她的儿子因此被移到了肾脏等待名单的最顶端&lt;/li&gt;
&lt;/ul&gt;
&lt;h3&gt;道德困境&lt;/h3&gt;
&lt;p&gt;以下行为，哪些是可以接受的？&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;用一个肾脏换取一个肾脏？&lt;/li&gt;
&lt;li&gt;用一个肾脏换取昂贵的实验性癌症治疗？&lt;/li&gt;
&lt;li&gt;用一个肾脏换取儿子的免费学费？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;出售肾脏换取现金？&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;h3&gt;公共政策分析&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 现行政策与后果&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;现行政策：&lt;strong&gt;出售器官是非法的&lt;/strong&gt;——政府对器官市场施加了&lt;strong&gt;零价格上限 (Price Ceiling of Zero)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;后果：造成器官的严重&lt;strong&gt;短缺 (Shortage)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;事实：
&lt;ul&gt;
&lt;li&gt;人天生有两个肾脏，但通常只需要一个&lt;/li&gt;
&lt;li&gt;有些人两个肾脏都失去功能&lt;/li&gt;
&lt;li&gt;典型患者需要等待&lt;strong&gt;数年&lt;/strong&gt;才能获得肾脏移植&lt;/li&gt;
&lt;li&gt;每年有&lt;strong&gt;数千人&lt;/strong&gt;因找不到合适的肾脏而死亡&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;现行体系：公平吗？有效吗？平等吗？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;一些人拥有自己并不真正需要的额外肾脏，另一些人则垂死以求一个肾脏。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂讨论
允许器官自由市场有哪些好处？有哪些伦理和公平性的顾虑？效率与公平在这个问题上如何发生冲突？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;14. 章节总结 (Summary)&lt;/h2&gt;
&lt;h3&gt;消费者剩余 (Consumer Surplus)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 要点&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每位消费者的 &lt;strong&gt;购买意愿 (Willingness to Pay)&lt;/strong&gt; 决定了需求曲线&lt;/li&gt;
&lt;li&gt;当价格 ≤ WTP 时，潜在消费者购买商品&lt;/li&gt;
&lt;li&gt;WTP 与价格之间的差额就是消费者获得的净收益，即 &lt;strong&gt;个人消费者剩余 (Individual Consumer Surplus)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总消费者剩余&lt;/strong&gt; 是市场中所有个人消费者剩余之和，等于需求曲线下方、价格上方的面积&lt;/li&gt;
&lt;li&gt;商品价格上涨减少消费者剩余；价格下跌增加消费者剩余&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;生产者剩余 (Producer Surplus)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 要点&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每位潜在生产者的 &lt;strong&gt;成本 (Cost)&lt;/strong&gt;（愿意出售的最低价格）决定了供给曲线&lt;/li&gt;
&lt;li&gt;当价格高于生产者的成本时，销售产生净收益，即 &lt;strong&gt;个人生产者剩余 (Individual Producer Surplus)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;总生产者剩余&lt;/strong&gt; 是市场中所有个人生产者剩余之和，等于价格下方、供给曲线上方的面积&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;h3&gt;总剩余与市场效率 (Total Surplus and Market Efficiency)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 要点&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;总剩余 (Total Surplus)&lt;/strong&gt; 是消费者剩余与生产者剩余之和，代表社会从商品生产和消费中获得的总收益&lt;/li&gt;
&lt;li&gt;通常，市场是&lt;strong&gt;有效率&lt;/strong&gt;的，能实现最大总剩余&lt;/li&gt;
&lt;li&gt;任何重新分配消费或销售、或改变交易量的尝试，都会&lt;strong&gt;降低&lt;/strong&gt;总剩余&lt;/li&gt;
&lt;li&gt;然而，社会也关心&lt;strong&gt;公平 (fairness/equity)&lt;/strong&gt;。因此，政府以牺牲部分效率换取更大公平的干预可以是社会的有效选择&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;hr /&gt;
&lt;h2&gt;15. 关键术语 (Key Terms)&lt;/h2&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;th&gt;中文对照&lt;/th&gt;
&lt;th&gt;定义摘要&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Willingness to Pay&lt;/td&gt;
&lt;td&gt;购买意愿&lt;/td&gt;
&lt;td&gt;买家愿意支付的最高价格&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Individual Consumer Surplus&lt;/td&gt;
&lt;td&gt;个人消费者剩余&lt;/td&gt;
&lt;td&gt;WTP − 实际支付价格&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Consumer Surplus&lt;/td&gt;
&lt;td&gt;总消费者剩余&lt;/td&gt;
&lt;td&gt;所有个人消费者剩余之和&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Consumer Surplus&lt;/td&gt;
&lt;td&gt;消费者剩余&lt;/td&gt;
&lt;td&gt;需求曲线下方、价格上方的面积&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cost&lt;/td&gt;
&lt;td&gt;成本&lt;/td&gt;
&lt;td&gt;卖家愿意出售的最低价格&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Individual Producer Surplus&lt;/td&gt;
&lt;td&gt;个人生产者剩余&lt;/td&gt;
&lt;td&gt;实际价格 − 成本&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Producer Surplus&lt;/td&gt;
&lt;td&gt;总生产者剩余&lt;/td&gt;
&lt;td&gt;所有个人生产者剩余之和&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Producer Surplus&lt;/td&gt;
&lt;td&gt;生产者剩余&lt;/td&gt;
&lt;td&gt;价格下方、供给曲线上方的面积&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Surplus&lt;/td&gt;
&lt;td&gt;总剩余&lt;/td&gt;
&lt;td&gt;消费者剩余 + 生产者剩余&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Property Rights&lt;/td&gt;
&lt;td&gt;产权&lt;/td&gt;
&lt;td&gt;所有者按意愿处置物品的权利&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Economic Signal&lt;/td&gt;
&lt;td&gt;经济信号&lt;/td&gt;
&lt;td&gt;帮助做出更好经济决策的信息&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Inefficient&lt;/td&gt;
&lt;td&gt;无效率&lt;/td&gt;
&lt;td&gt;未能实现最大总剩余&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Market Failure&lt;/td&gt;
&lt;td&gt;市场失灵&lt;/td&gt;
&lt;td&gt;市场无法实现效率的情况&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr /&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 参考来源&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Krugman, P., &amp;amp; Wells, R. (2013). &lt;em&gt;Microeconomics&lt;/em&gt; (3rd ed.). Worth Publishers. Chapter 4: Consumer and Producer Surplus.&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
</content:encoded></item><item><title>ECO2011 C2：Supply and Demand（供给与需求）</title><link>https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c2-demand-and-supply/chapter-3---supply-and-demand/</link><guid isPermaLink="true">https://wuslee-yz.top/posts/%E7%AC%94%E8%AE%B0/%E5%AD%A6%E6%A0%A1%E4%B8%8A%E7%9A%84%E8%AF%BE/eco2011/c2-demand-and-supply/chapter-3---supply-and-demand/</guid><pubDate>Thu, 04 Jun 2026 00:00:00 GMT</pubDate><content:encoded>&lt;h1&gt;Chapter 3: Supply and Demand (供给与需求)&lt;/h1&gt;
&lt;h2&gt;本章学习目标 (What You Will Learn)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 本章核心目标&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;理解什么是竞争性市场 (Competitive Market) 以及 Supply and Demand Model 如何描述它&lt;/li&gt;
&lt;li&gt;掌握 Demand Curve 和 Supply Curve 的含义与形态&lt;/li&gt;
&lt;li&gt;区分 &lt;strong&gt;Movement Along a Curve（沿曲线移动）&lt;/strong&gt; 与 &lt;strong&gt;Shift of a Curve（曲线移动）&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;理解 Supply and Demand 如何决定 &lt;strong&gt;Equilibrium Price（均衡价格）&lt;/strong&gt; 与 &lt;strong&gt;Equilibrium Quantity（均衡数量）&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;掌握 Shortage（短缺）或 Surplus（过剩）如何推动价格回归均衡&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_3.png&quot; alt=&quot;slide 3&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;1. 竞争性市场与供需模型 (Competitive Market &amp;amp; Supply-Demand Model)&lt;/h2&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 竞争性市场 (Competitive Market)
一个 &lt;strong&gt;竞争性市场 (Competitive Market)&lt;/strong&gt; 具备以下特征：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Many buyers and sellers&lt;/strong&gt;（众多买者和卖者）——没有任何单个参与者可以影响市场价格&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Same good or service&lt;/strong&gt;（同质化的商品或服务）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;Supply and Demand Model&lt;/strong&gt; 是描述竞争性市场如何运作的核心模型。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;该模型包含五个关键要素：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;要素&lt;/th&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;需求曲线&lt;/td&gt;
&lt;td&gt;Demand Curve&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;供给曲线&lt;/td&gt;
&lt;td&gt;Supply Curve&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;需求与供给曲线的移动&lt;/td&gt;
&lt;td&gt;Demand and Supply Curve Shifts&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;市场均衡&lt;/td&gt;
&lt;td&gt;Market Equilibrium&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;市场均衡的变化&lt;/td&gt;
&lt;td&gt;Changes in Market Equilibrium&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_1.png&quot; alt=&quot;slide 1&quot; /&gt;
&lt;img src=&quot;Assets/slide_2.png&quot; alt=&quot;slide 2&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;2. 需求 (Demand)&lt;/h2&gt;
&lt;h3&gt;2.1 需求表 (Demand Schedule)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 需求表 (Demand Schedule)
&lt;strong&gt;Demand Schedule&lt;/strong&gt; 是一张表格，展示了消费者在不同价格水平下愿意购买的商品或服务的数量（Quantity Demanded）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;教授在课堂上建议通过询问学生自身的 &lt;strong&gt;购买意愿 (Willingness to Pay)&lt;/strong&gt; 来引出这一概念——例如 iPhone、iPod、电影票等学生熟悉的商品。不同学生对同一商品有不同的 Willingness to Pay，而且这个意愿会随价格变化而改变。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂练习 (Class Exercise)
选择你经常购买的一种商品或服务，建立你自己的 Demand Schedule，标明在不同价格下你愿意购买的数量。&lt;/p&gt;
&lt;p&gt;思考：当价格上涨时，你的 Quantity Demanded 会发生什么变化？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_4.png&quot; alt=&quot;slide 4&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.2 需求曲线 (Demand Curve) 与需求定律 (Law of Demand)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 需求曲线 (Demand Curve)
&lt;strong&gt;Demand Curve&lt;/strong&gt; 是 Demand Schedule 的图形化表示，显示了在任何给定价格下消费者想要购买的数量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 需求定律 (Law of Demand)
&lt;strong&gt;Law of Demand（需求定律）&lt;/strong&gt;：在其他条件不变 (Ceteris Paribus) 的情况下，&lt;strong&gt;价格上升 → 需求量下降，价格下降 → 需求量上升&lt;/strong&gt;。因此，Demand Curve 是 &lt;strong&gt;向下倾斜 (Downward Sloping)&lt;/strong&gt; 的。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这一规律反映的是价格 (Price) 与需求量 (Quantity Demanded) 之间的&lt;strong&gt;反向关系 (Inverse Relationship)&lt;/strong&gt;：一个上升，另一个就下降。&lt;/p&gt;
&lt;h4&gt;棉花需求数据示例 (Demand Schedule for Cotton)&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Price of Cotton (per pound)&lt;/th&gt;
&lt;th&gt;Quantity of Cotton Demanded (billions of pounds)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$2.00&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.75&lt;/td&gt;
&lt;td&gt;9&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.50&lt;/td&gt;
&lt;td&gt;11&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.25&lt;/td&gt;
&lt;td&gt;13&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.00&lt;/td&gt;
&lt;td&gt;15&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$0.75&lt;/td&gt;
&lt;td&gt;17&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$0.50&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_5.png&quot; alt=&quot;slide 5&quot; /&gt;&lt;/p&gt;
&lt;h4&gt;🌍 全球案例：付更多钱，加更少油&lt;/h4&gt;
&lt;p&gt;由于高税收，大多数欧洲国家的汽油和柴油价格是美国的两倍多。根据 Law of Demand，欧洲人应该比美国人消费更少的汽油——事实也确实如此：欧洲人的人均燃料消费量不到美国人的一半，主要是因为他们开更小、更省油的车。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_6.png&quot; alt=&quot;slide 6&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.3 需求的增加 (An Increase in Demand)&lt;/h3&gt;
&lt;p&gt;当人口增长等因素导致需求增加时，在&lt;strong&gt;任何给定价格下&lt;/strong&gt;需求量都上升了。这体现为两张不同的 Demand Schedule（例如 2007 年和 2010 年），以及对应的 Demand Curve 的右移。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 需求曲线的移动 (Shift of the Demand Curve)
&lt;strong&gt;Shift of the Demand Curve&lt;/strong&gt; 是指在任何给定价格下，需求量发生变化的整体平移——原 Demand Curve 移动到新位置，形成一条新的 Demand Curve。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;对比数据：Demand Schedules for Cotton (2007 vs. 2010)&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Price of Cotton (per pound)&lt;/th&gt;
&lt;th&gt;Quantity Demanded in 2007 (billions of lbs)&lt;/th&gt;
&lt;th&gt;Quantity Demanded in 2010 (billions of lbs)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$2.00&lt;/td&gt;
&lt;td&gt;7.1&lt;/td&gt;
&lt;td&gt;8.5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.75&lt;/td&gt;
&lt;td&gt;7.5&lt;/td&gt;
&lt;td&gt;9.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.50&lt;/td&gt;
&lt;td&gt;8.1&lt;/td&gt;
&lt;td&gt;9.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.25&lt;/td&gt;
&lt;td&gt;8.9&lt;/td&gt;
&lt;td&gt;10.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.00&lt;/td&gt;
&lt;td&gt;10.0&lt;/td&gt;
&lt;td&gt;12.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$0.75&lt;/td&gt;
&lt;td&gt;11.5&lt;/td&gt;
&lt;td&gt;13.8&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$0.50&lt;/td&gt;
&lt;td&gt;14.2&lt;/td&gt;
&lt;td&gt;17.0&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_7.png&quot; alt=&quot;slide 7&quot; /&gt;
&lt;img src=&quot;Assets/slide_8.png&quot; alt=&quot;slide 8&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.4 沿需求曲线的移动 vs. 需求曲线的移动 (Movement Along vs. Shift)&lt;/h3&gt;
&lt;p&gt;这是本章&lt;strong&gt;最关键的区分之一&lt;/strong&gt;。教授反复强调，学生必须能够区分 &quot;Shift&quot;（移动）与 &quot;Movement Along&quot;（沿曲线移动）。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 核心区分规则&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Movement Along the Demand Curve&lt;/strong&gt;：由商品&lt;strong&gt;自身价格变化&lt;/strong&gt;引起 → 沿同一条 Demand Curve 上下移动（例如从 A 点到 B 点）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Shift of the Demand Curve&lt;/strong&gt;：由&lt;strong&gt;外部因素 (Exogenous Variables)&lt;/strong&gt; 变化引起 → 整条曲线平移至新位置（例如从 A 点到 C 点）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;通俗法则：坐标轴上的变量变化 → Movement Along；外部冲击（Ceteris Paribus 中被假定不变的变量）变化 → Shift。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;在日常对话中，即使经济学家也经常混用 &quot;Demand&quot; 和 &quot;Quantity Demanded&quot;。但在经济分析中，必须严格区分：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Change in Quantity Demanded&lt;/strong&gt; → Movement Along the Demand Curve&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Change in Demand&lt;/strong&gt; → Shift of the Demand Curve&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂练习 (Class Exercise)&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;一罐可乐的价格从 $1 涨到 $3。这是 Movement Along 还是 Shift of the Demand Curve？为什么？&lt;/li&gt;
&lt;li&gt;一项新科学研究证明，经常喝可乐的人平均寿命延长 5 年。这会导致 Movement Along 还是 Shift of the Demand Curve？为什么？&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;em&gt;请用图形辅助说明，并互相批改答案。&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_9.png&quot; alt=&quot;slide 9&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.5 需求曲线的移动方向 (Shifts of the Demand Curve)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 需求增加与减少&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Increase in Demand（需求增加）&lt;/strong&gt; = Demand Curve 向右移动 (Rightward Shift, D₁ → D₂)：在任何给定价格下，消费者需求量更大&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Decrease in Demand（需求减少）&lt;/strong&gt; = Demand Curve 向左移动 (Leftward Shift, D₁ → D₃)：在任何给定价格下，消费者需求量更小&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_10.png&quot; alt=&quot;slide 10&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.6 导致需求曲线移动的五大因素&lt;/h3&gt;
&lt;h4&gt;(1) 相关商品价格的变化 (Changes in the Prices of Related Goods)&lt;/h4&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 替代品 (Substitutes)
两种商品是 &lt;strong&gt;Substitutes（替代品）&lt;/strong&gt;，如果一种商品价格下降会使消费者&lt;strong&gt;减少&lt;/strong&gt;对另一种商品的购买意愿。&lt;/p&gt;
&lt;p&gt;&lt;em&gt;例：茶和咖啡 (Tea &amp;amp; Coffee)、米饭和面条 (Rice &amp;amp; Noodles)、麦当劳和肯德基 (McDonald&apos;s &amp;amp; KFC)、松饼和甜甜圈 (Muffins &amp;amp; Donuts)&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 互补品 (Complements)
两种商品是 &lt;strong&gt;Complements（互补品）&lt;/strong&gt;，如果一种商品价格下降会使消费者&lt;strong&gt;增加&lt;/strong&gt;对另一种商品的购买意愿。&lt;/p&gt;
&lt;p&gt;&lt;em&gt;例：面包和果酱 (Bread &amp;amp; Jam)、汽车和汽油 (Cars &amp;amp; Petrol)、智能手机和移动网络服务 (Smartphones &amp;amp; Mobile Internet Service)&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂练习 (Class Exercise)&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;壁球 (Squash Balls) 价格急剧上涨会对壁球拍 (Squash Racquets) 的需求产生什么影响？为什么？&lt;/li&gt;
&lt;li&gt;百事可乐 (Pepsi) 价格急剧上涨会对可口可乐 (Coke) 的需求产生什么影响？为什么？&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;em&gt;有趣案例：马萨诸塞州关于建造赌场的辩论中，反对者认为建赌场会导致州彩票收入下降。这就是 Substitutes 的一个实例（尽管预计收入仅下降约 6%）。&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;(2) 收入的变化 (Changes in Income)&lt;/h4&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 正常品 (Normal Good)
当收入增加导致对某种商品的需求增加时，该商品称为 &lt;strong&gt;Normal Good（正常品）&lt;/strong&gt;——这是最常见的情况。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 劣质品 (Inferior Good)
当收入增加导致对某种商品的需求减少时，该商品称为 &lt;strong&gt;Inferior Good（劣质品）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;em&gt;例：方便面 (Instant Noodles)——当收入上升时，人们会减少购买&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;(3) 消费者数量的变化 (Changes in the Number of Consumers)&lt;/h4&gt;
&lt;p&gt;市场中消费者数量增加 → 需求增加 (Demand Curve 右移)。&lt;/p&gt;
&lt;h4&gt;(4) 预期的变化 (Changes in Expectations)&lt;/h4&gt;
&lt;p&gt;如果消费者预期未来价格上涨 → 当前需求增加；预期价格下跌 → 当前需求减少。&lt;/p&gt;
&lt;h4&gt;(5) 品味的变化 (Changes in Tastes)&lt;/h4&gt;
&lt;p&gt;社会潮流、时尚和偏好的变化会直接影响需求。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂练习 (Class Exercise)&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;随着 Talya 收入增加，她买的方便面变少了。方便面对 Talya 属于什么类型的商品？&lt;/li&gt;
&lt;li&gt;继 David Beckham 和 Sting 之后，越来越多男性开始追随穿裙子的时尚。这种品味变化对裙子的需求会有什么影响？&lt;/li&gt;
&lt;li&gt;科学家宣布 5 年内海洋中将不再有鱼类。这一声明对寿司 (Sushi) 的需求会有什么影响？&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_11.png&quot; alt=&quot;slide 11&quot; /&gt;
&lt;img src=&quot;Assets/slide_12.png&quot; alt=&quot;slide 12&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;2.7 个人需求曲线与市场需求曲线 (Individual Demand Curve &amp;amp; Market Demand Curve)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 市场需求曲线 (Market Demand Curve)
&lt;strong&gt;Market Demand Curve&lt;/strong&gt; 是市场中所有消费者的 Individual Demand Curves 的&lt;strong&gt;水平加总 (Horizontal Sum)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如，Darla 和 Dino 是牛仔裤市场中仅有的两个消费者。在任何给定价格下，市场的需求量是 Darla 和 Dino 各自需求量的总和：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Darla 在 $30/条时购买 3 条&lt;/li&gt;
&lt;li&gt;Dino 在 $30/条时购买 2 条&lt;/li&gt;
&lt;li&gt;市场总需求 = 3 + 2 = 5 条&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_13.png&quot; alt=&quot;slide 13&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;3. 经济学在行动：缓解交通拥堵 (ECONOMICS IN ACTION: Beating the Traffic)&lt;/h2&gt;
&lt;p&gt;交通拥堵不仅减慢通行速度、浪费时间，还加剧空气污染。城市如何减少交通拥堵？&lt;/p&gt;
&lt;p&gt;将&lt;strong&gt;开车进入市中心&lt;/strong&gt;视为一种人们消费的商品/服务（Good or Service），就可以用 Demand 经济学来分析反拥堵政策：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;降低替代品的价格&lt;/strong&gt;：许多大都市补贴公交和铁路服务，吸引通勤者转向其他交通方式&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;提高停车成本&lt;/strong&gt;：几个城市对停车征收高额税费、限制停车时长——既能增加收入，又能抑制开车需求&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;拥堵收费 (Congestion Pricing/Charging)&lt;/strong&gt;：新加坡、伦敦和斯德哥尔摩等城市直接对进入市中心的车辆收费
&lt;ul&gt;
&lt;li&gt;2003 年伦敦引入拥堵费后，市中心交通立即减少约 15%；2002-2006 年间总体交通量下降 21%&lt;/li&gt;
&lt;li&gt;替代品（公共交通、自行车、摩托车、拼车）的使用量显著增加&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 拥堵收费的政治争议
Congestion Pricing 在政治上具有争议性，因为它直接向驾驶者收费——但它确实有效减少了交通量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_14.png&quot; alt=&quot;slide 14&quot; /&gt;
&lt;img src=&quot;Assets/slide_15.png&quot; alt=&quot;slide 15&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;4. 供给 (Supply)&lt;/h2&gt;
&lt;h3&gt;4.1 供给表 (Supply Schedule)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 供给表 (Supply Schedule)
&lt;strong&gt;Supply Schedule&lt;/strong&gt; 是一张表格，展示了生产者在不同价格水平下愿意供应的商品或服务的数量（Quantity Supplied）。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h4&gt;Supply Schedule for Cotton&lt;/h4&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Price of Cotton (per pound)&lt;/th&gt;
&lt;th&gt;Quantity of Cotton Supplied (billions of pounds)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;$2.00&lt;/td&gt;
&lt;td&gt;11.6&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.75&lt;/td&gt;
&lt;td&gt;11.5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.50&lt;/td&gt;
&lt;td&gt;11.2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.25&lt;/td&gt;
&lt;td&gt;10.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$1.00&lt;/td&gt;
&lt;td&gt;10.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$0.75&lt;/td&gt;
&lt;td&gt;9.1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;$0.50&lt;/td&gt;
&lt;td&gt;8.0&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_16.png&quot; alt=&quot;slide 16&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;4.2 供给曲线 (Supply Curve)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 供给曲线 (Supply Curve)
&lt;strong&gt;Supply Curve&lt;/strong&gt; 是 Supply Schedule 的图形化表示，显示了在任何给定价格下生产者愿意出售的数量。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;与 Demand Curve 不同，Supply Curve 通常是 &lt;strong&gt;向上倾斜 (Upward Sloping)&lt;/strong&gt; 的：&lt;strong&gt;价格上升 → 供给量上升&lt;/strong&gt;。这是因为当价格上升时，生产者每卖出一单位商品能获得更多收益，因此愿意增加供给量。这反映了价格与供给量之间的&lt;strong&gt;正向关系 (Positive Relationship)&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_17.png&quot; alt=&quot;slide 17&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;4.3 供给的增加 (An Increase in Supply)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 供给曲线的移动 (Shift of the Supply Curve)
&lt;strong&gt;Shift of the Supply Curve&lt;/strong&gt; 是指在任何给定价格下，供给量发生变化的整体平移。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如，棉花种植业采用更好的技术 → 在任何给定价格下都有更多产量和更多生产者进入 → Supply Curve 向右移动。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_18.png&quot; alt=&quot;slide 18&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;4.4 沿供给曲线的移动 vs. 供给曲线的移动 (Movement Along vs. Shift)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 核心区分规则&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Movement Along the Supply Curve&lt;/strong&gt;：由商品&lt;strong&gt;自身价格变化&lt;/strong&gt;引起 → 沿同一条 Supply Curve 移动（A 到 B）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Shift of the Supply Curve&lt;/strong&gt;：由&lt;strong&gt;外部因素&lt;/strong&gt;引起 → 任何给定价格下供给量发生变化（A 到 C）&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_19.png&quot; alt=&quot;slide 19&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;4.5 供给曲线的移动方向 (Shifts of the Supply Curve)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 供给增加与减少&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Increase in Supply（供给增加）&lt;/strong&gt; = Supply Curve 向右移动 (Rightward Shift, S₁ → S₂)：在任何给定价格下，生产者供给量更大&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Decrease in Supply（供给减少）&lt;/strong&gt; = Supply Curve 向左移动 (Leftward Shift, S₁ → S₃)：在任何给定价格下，生产者供给量更小&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;经济学家所说的 &quot;Increase in Supply&quot;，指的是右移——在任何给定价格下生产者供给更多。同样，&quot;Decrease in Supply&quot; 指的是左移。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_20.png&quot; alt=&quot;slide 20&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;4.6 导致供给曲线移动的五大因素&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 投入品 (Input)
&lt;strong&gt;Input（投入品）&lt;/strong&gt; 是用于生产另一种商品的商品。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;因素&lt;/th&gt;
&lt;th&gt;英文&lt;/th&gt;
&lt;th&gt;说明&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;投入品价格变化&lt;/td&gt;
&lt;td&gt;Changes in Input Prices&lt;/td&gt;
&lt;td&gt;投入品价格上升 → 生产成本上升 → 供给减少（左移）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;相关商品和服务价格变化&lt;/td&gt;
&lt;td&gt;Changes in Prices of Related Goods/Services&lt;/td&gt;
&lt;td&gt;替代品在生产中的价格变化影响供给决策&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;技术变化&lt;/td&gt;
&lt;td&gt;Changes in Technology&lt;/td&gt;
&lt;td&gt;技术进步 → 生产成本降低 → 供给增加（右移）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;预期变化&lt;/td&gt;
&lt;td&gt;Changes in Expectations&lt;/td&gt;
&lt;td&gt;对未来价格的预期影响当前供给决策&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;生产者数量变化&lt;/td&gt;
&lt;td&gt;Changes in Number of Producers&lt;/td&gt;
&lt;td&gt;更多生产者进入市场 → 市场供给增加（右移）&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂练习 (Class Exercise)
互联网技术使大学能够提供越来越多在线经济学课程和资源。经济知识的供给会发生什么变化？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_21.png&quot; alt=&quot;slide 21&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;4.7 经济学在行动：农场兽医的减少 (Only Creatures Small and Pampered)&lt;/h3&gt;
&lt;p&gt;根据《纽约时报》报道，过去二十年美国农场兽医 (Farm Veterinarians) 数量严重下降。问题根源在于&lt;strong&gt;竞争&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;农场兽医服务&lt;/strong&gt; 和 &lt;strong&gt;宠物兽医服务&lt;/strong&gt; 是 &lt;strong&gt;Substitutes in Production（生产中的替代品）&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;美国不断增长的宠物数量 + 宠主日益愿意为宠物花钱 → &lt;strong&gt;宠物兽医服务价格上涨&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;兽医被吸引离开农场动物护理，转向利润更高的宠物护理&lt;/li&gt;
&lt;li&gt;结果：&lt;strong&gt;Farm Veterinary Services 的 Supply Curve 向左移动&lt;/strong&gt;——在任何给定价格下，提供农场服务的兽医减少了&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_22.png&quot; alt=&quot;slide 22&quot; /&gt;
&lt;img src=&quot;Assets/slide_23.png&quot; alt=&quot;slide 23&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;4.8 个人供给曲线与市场供给曲线 (Individual Supply Curve &amp;amp; Market Supply Curve)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 市场供给曲线 (Market Supply Curve)
&lt;strong&gt;Market Supply Curve&lt;/strong&gt; 是市场中所有生产者的 Individual Supply Curves 的&lt;strong&gt;水平加总 (Horizontal Sum)&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;例如，Mr. Silva 和 Mr. Liu 是棉花市场仅有的两个生产者：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;在 $2/磅时：Mr. Silva 供给 3,000 磅/年，Mr. Liu 供给 2,000 磅/年&lt;/li&gt;
&lt;li&gt;Market Supply = 3,000 + 2,000 = 5,000 磅/年&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;显然，生产者数量越多，在任何给定价格下的市场供给量越大 → 生产者数量的增加导致 Supply 增加、Supply Curve 右移。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_24.png&quot; alt=&quot;slide 24&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;5. 均衡 (Equilibrium)&lt;/h2&gt;
&lt;h3&gt;5.1 市场均衡 (Market Equilibrium)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 均衡 (Equilibrium)
在竞争性市场中，&lt;strong&gt;Equilibrium&lt;/strong&gt; 发生在 Quantity Demanded 等于 Quantity Supplied 时。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Price（均衡价格）/ Market-Clearing Price（市场出清价格）&lt;/strong&gt;：使需求量等于供给量的价格&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Quantity（均衡数量）&lt;/strong&gt;：在均衡价格下买卖的商品数量&lt;/li&gt;
&lt;li&gt;在均衡状态下：&lt;strong&gt;每一位买家都能找到卖家，每一位卖家都能找到买家&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 常见陷阱：买方价格 vs. 卖方价格 (Bought and Sold?)
在现实中，中间商 (Middleman) 从供应商处购买，加价后卖给消费者（例如咖啡商从种植者处购买咖啡豆再卖给消费者）。种植者收到的价格通常低于消费者支付的价格——这个差价就是中间商的生计来源。&lt;/p&gt;
&lt;p&gt;但在许多市场中，买卖价差很小。所以在本章分析中，我们近似假设买方支付的价格等于卖方收到的价格。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;为什么市场上所有的买卖都在同一价格下发生？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;假设一个卖家向潜在买家报出的价格明显高于买家所知其他人支付的价格——买家显然会离开找别人，除非卖家愿意降价。反之，卖家也不愿意以明显低于市场价的水平出售。因此，在任何成熟、持续运营的市场中，所有卖家收到和所有买家支付的价格大致相同——这就是我们所说的 &lt;strong&gt;Market Price（市场价格）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_25.png&quot; alt=&quot;slide 25&quot; /&gt;
&lt;img src=&quot;Assets/slide_26.png&quot; alt=&quot;slide 26&quot; /&gt;
&lt;img src=&quot;Assets/slide_27.png&quot; alt=&quot;slide 27&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;5.2 过剩 (Surplus)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 过剩 (Surplus)
当价格&lt;strong&gt;高于&lt;/strong&gt;均衡水平时，Quantity Supplied &amp;gt; Quantity Demanded，产生 &lt;strong&gt;Surplus（过剩）&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;以棉花市场为例：当市场价格为 $1.50/磅（高于均衡价 $1.00）时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;生产者愿意出售 &lt;strong&gt;11.2&lt;/strong&gt; 十亿磅&lt;/li&gt;
&lt;li&gt;消费者只想购买 &lt;strong&gt;8.1&lt;/strong&gt; 十亿磅&lt;/li&gt;
&lt;li&gt;过剩 = 11.2 − 8.1 = &lt;strong&gt;3.1&lt;/strong&gt; 十亿磅&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Surplus 将推动价格&lt;strong&gt;下降&lt;/strong&gt;，直到达到均衡价格。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_28.png&quot; alt=&quot;slide 28&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;5.3 短缺 (Shortage)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 短缺 (Shortage)
当价格&lt;strong&gt;低于&lt;/strong&gt;均衡水平时，Quantity Demanded &amp;gt; Quantity Supplied，产生 &lt;strong&gt;Shortage（短缺）&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;以棉花市场为例：当市场价格为 $0.75/磅（低于均衡价 $1.00）时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;消费者想要购买 &lt;strong&gt;11.5&lt;/strong&gt; 十亿磅&lt;/li&gt;
&lt;li&gt;生产者只愿意出售 &lt;strong&gt;9.1&lt;/strong&gt; 十亿磅&lt;/li&gt;
&lt;li&gt;短缺 = 11.5 − 9.1 = &lt;strong&gt;2.4&lt;/strong&gt; 十亿磅&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Shortage 将推动价格&lt;strong&gt;上升&lt;/strong&gt;，直到达到均衡价格。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 现实案例：iPhone 3G 的短缺
2008 年夏天，Apple 以之前型号一半的价格 ($199) 推出 iPhone 3G 时，在全美引起了（暂时的）短缺。长队和等候名单就是 Shortage 的明显标志。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_29.png&quot; alt=&quot;slide 29&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;5.4 需求曲线移动对均衡的影响&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 需求增加的影响
当 Demand 增加（Demand Curve 右移）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Price 上升&lt;/strong&gt; → 沿着 Supply Curve 向上移动&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Quantity 上升&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;规律：&lt;strong&gt;当 Demand 增加时，Equilibrium Price 和 Equilibrium Quantity 都上升。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;其他例子：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;波士顿红袜队 (Red Sox) 近期的成功导致门票需求增加&lt;/li&gt;
&lt;li&gt;10 年内，全球变暖可能增加对以前被认为 &quot;太冷&quot; 的地区的土地需求&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 课堂讨论
咖啡和茶是 Substitutes：如果茶的价格上涨，咖啡的需求会增加。但茶的价格如何影响咖啡市场呢？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_30.png&quot; alt=&quot;slide 30&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;5.5 供给曲线移动对均衡的影响&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 供给减少的影响
当 Supply 减少（Supply Curve 左移），例如因干旱导致棉花减产：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Price 上升&lt;/strong&gt; → 沿着 Demand Curve 向上移动&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Quantity 下降&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;规律：&lt;strong&gt;当 Supply 减少时，Equilibrium Price 上升，Equilibrium Quantity 下降。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 供给增加的影响（技术进步的案例）
当 Supply 增加（Supply Curve 右移），例如 1970 年代初工程师学会将微型电子元件置于硅芯片上的技术进步：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Price 下降&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Quantity 上升&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;规律：&lt;strong&gt;当 Supply 增加时，Equilibrium Price 下降，Equilibrium Quantity 上升。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 常见陷阱：辨别是哪个曲线在动 (Which Curve Is It Anyway?)
当某种商品价格变化时，通常意味着 Supply 或 Demand 中有一个发生了变化。判断线索：&lt;strong&gt;看 Quantity 的变化方向&lt;/strong&gt;。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;如果 Quantity 和 Price &lt;strong&gt;同方向&lt;/strong&gt;变化（如两者都上升）→ 很可能是 &lt;strong&gt;Demand Curve 移动了&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;如果 Quantity 和 Price &lt;strong&gt;反方向&lt;/strong&gt;变化（如价格上升但数量下降）→ 很可能是 &lt;strong&gt;Supply Curve 移动了&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_31.png&quot; alt=&quot;slide 31&quot; /&gt;
&lt;img src=&quot;Assets/slide_32.png&quot; alt=&quot;slide 32&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;6. 经济学在行动：案例研究&lt;/h2&gt;
&lt;h3&gt;6.1 墨西哥玉米饼危机 (The Great Tortilla Crisis)&lt;/h3&gt;
&lt;p&gt;2007 年，墨西哥政府对玉米饼 (Tortillas)——墨西哥穷人的主食——价格的急剧上涨感到恐慌。价格在 2007 年初几个月内从 25 美分/磅飙升到 35-45 美分/磅。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;原因&lt;/strong&gt;：这是 Supply 下降导致均衡价格变化的典型案例。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;玉米饼由玉米 (Corn) 制成&lt;/li&gt;
&lt;li&gt;墨西哥大部分玉米从美国进口，两国玉米价格基本由美国玉米市场决定&lt;/li&gt;
&lt;li&gt;美国玉米价格因 &lt;strong&gt;乙醇 (Ethanol)&lt;/strong&gt; 市场需求的激增而快速上涨&lt;/li&gt;
&lt;li&gt;这导致玉米（玉米饼的关键 Input）成本上升 → Tortillas 的 Supply 下降 → Equilibrium Price 上升&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_33.png&quot; alt=&quot;slide 33&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;6.2 毒品战争中的供需分析 (Supply, Demand, and Controlled Substances)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] &quot;War on Drugs&quot; 的供需分析
禁毒战争使毒品的 Supply Curve &lt;strong&gt;向左移动&lt;/strong&gt;（执法打击生产和贩运）。&lt;/p&gt;
&lt;p&gt;但比较原均衡 E₁ 和新均衡 E₂ 可以发现：&lt;strong&gt;毒品供给量的实际减少远小于供给曲线的移动幅度&lt;/strong&gt;。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;均衡价格从 P₁ 上升到 P₂&lt;/li&gt;
&lt;li&gt;高价格反而&lt;strong&gt;激励&lt;/strong&gt;供应商冒险继续提供毒品&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;原因在于：成瘾消费者对毒品的需求&lt;strong&gt;缺乏弹性 (Inelastic Demand)&lt;/strong&gt;——即使价格大幅上涨，他们仍然继续购买。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_34.png&quot; alt=&quot;slide 34&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;6.3 超模的供需练习 (Your Turn on the Runway: Supermodels)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!question] 思考题：非名人时尚模特的均衡价格如何变化？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;背景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;互联网传输照片的便利性 + 国际旅行成本降低 → 世界各地大量年轻女性涌入模特行业（&lt;strong&gt;Supply 增加，Supply Curve 右移&lt;/strong&gt;）&lt;/li&gt;
&lt;li&gt;雇主品味变化 → 他们现在更偏好名人 (Celebrities) 而非普通模特（&lt;strong&gt;Demand 减少，Demand Curve 左移&lt;/strong&gt;）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;分析&lt;/strong&gt;：Supply Curve 右移 + Demand Curve 左移 → &lt;strong&gt;Equilibrium Price 下降&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;也就是说，普通（非名人）时尚模特的薪酬下降了。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_38.png&quot; alt=&quot;slide 38&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;6.4 2008 年大米抢购潮 (The Rice Run of 2008)&lt;/h3&gt;
&lt;p&gt;2008 年 4 月，从泰国出口的大米价格（全球大米交易的基准价格）达到 $950/吨，而 2008 年初仅为 $360/吨。几小时内，全球主要大米交易所的价格接连创下历史新高。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;供需两方面的原因&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Demand 方面&lt;/strong&gt;：中国和印度（传统的大米消费大国）收入增长&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Supply 方面&lt;/strong&gt;：澳大利亚干旱 + 越南虫害&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;综合效应&lt;/strong&gt;：Supply 减少 + Demand 增加&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;但真正以惊人的速度推动价格上涨的是：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;农民的**囤积 (Hoarding)**行为&lt;/li&gt;
&lt;li&gt;消费者的&lt;strong&gt;恐慌购买 (Panic Buying)&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;印度（最大的大米出口国之一）实施&lt;strong&gt;出口禁令 (Export Ban)&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;在亚洲许多地区，政府是主要的稻米买家，农民以政府设定价格出售，再以补贴价卖给穷人。当全球价格上升时，农民（如今也能通过互联网查看全球大米报价）对政府定价不满，转而囤积大米，相信最终能获得更高价格。这种信念是&lt;strong&gt;自我实现 (Self-fulfilling)&lt;/strong&gt; 的——囤积行为使 Supply Curve 进一步左移，推动价格继续上涨。&lt;/p&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_39.png&quot; alt=&quot;slide 39&quot; /&gt;
&lt;img src=&quot;Assets/slide_40.png&quot; alt=&quot;slide 40&quot; /&gt;
&lt;img src=&quot;Assets/slide_41.png&quot; alt=&quot;slide 41&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;7. 供需同时移动 (Simultaneous Shifts of Supply and Demand)&lt;/h2&gt;
&lt;p&gt;现实中，Supply 和 Demand 往往同时发生变化。以下是系统性的分析。&lt;/p&gt;
&lt;h3&gt;7.1 两种可能的结果&lt;/h3&gt;
&lt;h4&gt;情况 (a)：需求增加占主导 (Demand Increase Dominates)&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;Demand 大幅右移 + Supply 小幅左移&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Price ↑&lt;/strong&gt;, &lt;strong&gt;Equilibrium Quantity ↑&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_35.png&quot; alt=&quot;slide 35&quot; /&gt;&lt;/p&gt;
&lt;h4&gt;情况 (b)：供给减少占主导 (Supply Decrease Dominates)&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;Demand 小幅右移 + Supply 大幅左移&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Equilibrium Price ↑&lt;/strong&gt;, &lt;strong&gt;Equilibrium Quantity ↓&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_36.png&quot; alt=&quot;slide 36&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;7.2 供需同时移动的预测总结&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Supply Increases&lt;/th&gt;
&lt;th&gt;Supply Decreases&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Demand Increases&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Price: &lt;strong&gt;Ambiguous&lt;/strong&gt;（不确定）&amp;lt;br&amp;gt;Quantity: &lt;strong&gt;Up&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Price: &lt;strong&gt;Up&lt;/strong&gt;&amp;lt;br&amp;gt;Quantity: &lt;strong&gt;Ambiguous&lt;/strong&gt;（不确定）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Demand Decreases&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Price: &lt;strong&gt;Down&lt;/strong&gt;&amp;lt;br&amp;gt;Quantity: &lt;strong&gt;Ambiguous&lt;/strong&gt;（不确定）&lt;/td&gt;
&lt;td&gt;Price: &lt;strong&gt;Ambiguous&lt;/strong&gt;（不确定）&amp;lt;br&amp;gt;Quantity: &lt;strong&gt;Down&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 核心规律&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;当 Supply 和 Demand 反方向移动时&lt;/strong&gt;：Equilibrium Price 的变化方向可以预测，但 Equilibrium Quantity 的变化不确定&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Demand ↑ + Supply ↓ → Price ↑, Quantity 不确定&lt;/li&gt;
&lt;li&gt;Demand ↓ + Supply ↑ → Price ↓, Quantity 不确定&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;当 Supply 和 Demand 同方向移动时&lt;/strong&gt;：Equilibrium Quantity 的变化方向可以预测，但 Equilibrium Price 的变化不确定&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Demand ↑ + Supply ↑ → Quantity ↑, Price 不确定&lt;/li&gt;
&lt;li&gt;Demand ↓ + Supply ↓ → Quantity ↓, Price 不确定&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;一般来说，移动幅度更大 (disproportionately greater) 的曲线对 Equilibrium Price 和 Quantity 的影响更大。&lt;/strong&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_37.png&quot; alt=&quot;slide 37&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;8. 本章关键术语 (Key Terms)&lt;/h2&gt;
&lt;p&gt;以下为 Chapter 3 的核心术语列表，按主题分组：&lt;/p&gt;
&lt;h3&gt;市场与模型 (Market &amp;amp; Model)&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;th&gt;中文翻译&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Competitive Market&lt;/td&gt;
&lt;td&gt;竞争性市场&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Supply and Demand Model&lt;/td&gt;
&lt;td&gt;供需模型&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;需求侧 (Demand Side)&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;th&gt;中文翻译&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Demand Schedule&lt;/td&gt;
&lt;td&gt;需求表&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Quantity Demanded&lt;/td&gt;
&lt;td&gt;需求量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Demand Curve&lt;/td&gt;
&lt;td&gt;需求曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Law of Demand&lt;/td&gt;
&lt;td&gt;需求定律&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Shift of the Demand Curve&lt;/td&gt;
&lt;td&gt;需求曲线的移动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Movement Along the Demand Curve&lt;/td&gt;
&lt;td&gt;沿需求曲线的移动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Substitutes&lt;/td&gt;
&lt;td&gt;替代品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Complements&lt;/td&gt;
&lt;td&gt;互补品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Normal Good&lt;/td&gt;
&lt;td&gt;正常品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Inferior Good&lt;/td&gt;
&lt;td&gt;劣质品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Individual Demand Curve&lt;/td&gt;
&lt;td&gt;个人需求曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;供给侧 (Supply Side)&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;th&gt;中文翻译&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Quantity Supplied&lt;/td&gt;
&lt;td&gt;供给量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Supply Schedule&lt;/td&gt;
&lt;td&gt;供给表&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Supply Curve&lt;/td&gt;
&lt;td&gt;供给曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Shift of the Supply Curve&lt;/td&gt;
&lt;td&gt;供给曲线的移动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Movement Along the Supply Curve&lt;/td&gt;
&lt;td&gt;沿供给曲线的移动&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Input&lt;/td&gt;
&lt;td&gt;投入品&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Individual Supply Curve&lt;/td&gt;
&lt;td&gt;个人供给曲线&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3&gt;均衡 (Equilibrium)&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;英文术语&lt;/th&gt;
&lt;th&gt;中文翻译&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Equilibrium Price&lt;/td&gt;
&lt;td&gt;均衡价格&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Equilibrium Quantity&lt;/td&gt;
&lt;td&gt;均衡数量&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Market-Clearing Price&lt;/td&gt;
&lt;td&gt;市场出清价格&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Surplus&lt;/td&gt;
&lt;td&gt;过剩&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Shortage&lt;/td&gt;
&lt;td&gt;短缺&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_51.png&quot; alt=&quot;slide 51&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;h2&gt;9. 本章总结 (Chapter Summary)&lt;/h2&gt;
&lt;h3&gt;9.1 需求 (Demand)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心要点&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Demand Schedule&lt;/strong&gt; 显示各价格下的 Quantity Demanded → 图形化为向下倾斜的 &lt;strong&gt;Demand Curve&lt;/strong&gt;（Law of Demand）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Movement Along&lt;/strong&gt; 由价格变化引起；&lt;strong&gt;Shift&lt;/strong&gt; 由外部因素（替代品/互补品价格、收入、品味、预期、消费者数量）引起&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Market Demand Curve&lt;/strong&gt; = 所有 Individual Demand Curves 的水平加总&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_42.png&quot; alt=&quot;slide 42&quot; /&gt;
&lt;img src=&quot;Assets/slide_43.png&quot; alt=&quot;slide 43&quot; /&gt;
&lt;img src=&quot;Assets/slide_44.png&quot; alt=&quot;slide 44&quot; /&gt;
&lt;img src=&quot;Assets/slide_45.png&quot; alt=&quot;slide 45&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;9.2 供给 (Supply)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心要点&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Supply Schedule&lt;/strong&gt; 显示各价格下的 Quantity Supplied → 图形化为向上倾斜的 &lt;strong&gt;Supply Curve&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;五大移动因素：Input Prices、相关商品价格、Technology、Expectations、Number of Producers&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Market Supply Curve&lt;/strong&gt; = 所有 Individual Supply Curves 的水平加总&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_46.png&quot; alt=&quot;slide 46&quot; /&gt;
&lt;img src=&quot;Assets/slide_47.png&quot; alt=&quot;slide 47&quot; /&gt;&lt;/p&gt;
&lt;h3&gt;9.3 均衡 (Equilibrium)&lt;/h3&gt;
&lt;blockquote&gt;
&lt;p&gt;[!info] 核心要点&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;市场趋向 &lt;strong&gt;Equilibrium Price / Market-Clearing Price&lt;/strong&gt;，此时 Quantity Demanded = Quantity Supplied&lt;/li&gt;
&lt;li&gt;Price &amp;gt; Equilibrium → &lt;strong&gt;Surplus&lt;/strong&gt; 推动价格下降&lt;/li&gt;
&lt;li&gt;Price &amp;lt; Equilibrium → &lt;strong&gt;Shortage&lt;/strong&gt; 推动价格上升&lt;/li&gt;
&lt;li&gt;Demand ↑ → Price ↑, Quantity ↑；Supply ↑ → Price ↓, Quantity ↑&lt;/li&gt;
&lt;li&gt;供需同时移动：反方向 → Price 确定/Quantity 不确定；同方向 → Quantity 确定/Price 不确定&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;img src=&quot;Assets/slide_48.png&quot; alt=&quot;slide 48&quot; /&gt;
&lt;img src=&quot;Assets/slide_49.png&quot; alt=&quot;slide 49&quot; /&gt;
&lt;img src=&quot;Assets/slide_50.png&quot; alt=&quot;slide 50&quot; /&gt;&lt;/p&gt;
&lt;hr /&gt;
&lt;blockquote&gt;
&lt;p&gt;[!warning] 关键学习建议
本章最重要的技能是能够：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;清晰区分 &lt;strong&gt;Movement Along&lt;/strong&gt;（价格变化 → 沿曲线移动）与 &lt;strong&gt;Shift&lt;/strong&gt;（外部因素 → 曲线整体平移）&lt;/li&gt;
&lt;li&gt;区分 &lt;strong&gt;&quot;Demand&quot;&lt;/strong&gt; 和 &lt;strong&gt;&quot;Quantity Demanded&quot;&lt;/strong&gt;，以及 &lt;strong&gt;&quot;Supply&quot;&lt;/strong&gt; 和 &lt;strong&gt;&quot;Quantity Supplied&quot;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;熟练运用 Supply-Demand 模型分析现实世界中的市场变化&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
</content:encoded></item></channel></rss>