分类
标签
action-value actor-critic advantage-function average-reward Bellman-equation Bellman-optimality-equation Chapter3 chapter6 circular-flow comparative-advantage consumer-surplus contraction-mapping convergence costs course-notes deep-q-learning deterministic-policy-gradient dynamic-programming ECO2011 economics elasticity environmental-economics epsilon-greedy externalities firm_theory function-approximation game-theory generalized-policy-iteration Government_Intervention imperfect-competition importance-sampling Krugman-Wells linear-function-approximation market-efficiency market-failure market-power MDP microeconomics Microeconomics model-free models monopolistic-competition monopoly monte-carlo notes off-policy oligopoly optimal-policy optimal-state-value perfect-competition policy policy-control policy-evaluation policy-gradient policy-iteration PPF Price_Controls price-discrimination producer-surplus product-differentiation production q-learning Quotas reinforce reinforcement-learning reward robbins-monro sarsa softmax-policy state-value stochastic-approximation stochastic-gradient-descent Supply_and_Demand supply-curve taxes td-learning temporal-difference trade value-iteration welfare-economics 圣地巡礼 日本 镰仓 青春猪头少年