正在加载视频...
视频加载失败
量化交易必懂:MDP 如何让 AI 学会动态决策? 昨天粉丝问我:有没有把马尔可夫决策过程(MDP)讲得既清晰又扎实的课程?最好是从确定性搜索过渡到不确定环境的完整推导。 我去找了斯坦福 Percy Liang 教授主讲的《Markov Decision Processes》。 他清晰地拆解了 MDP 的完整逻辑:从引入随机性与马尔可夫假设,到策略(Policy)、折扣因子、Q 值、策略评估,再到价值迭代求解最优策略。 核心内容包括: 1️⃣ 从 Search 到 MDP:动作结果从确定变为概率分布,经典 Flaky Tram 示例 2️⃣ 策略与折扣因子 γ:为什么解不再是一串固定动作路径 3️⃣ Q 值与 Bellman 方程:精确计算策略价值 4️⃣ 价值迭代(Value Iteration):通过迭代求解最优策略 π* 最终结论很明确:MDP 是所有强化学习算法(Q-Learning、PPO、DQN)的数学基础,也是理解市场交易、动态资产配置和期权行权等随机决策问题的核心框架。 对正在学强化学习或量化交易的朋友,这是非常扎实的理论基石。建议收藏。
20,741 次观看 • 12 天前 •via X (Twitter)
0 条评论
暂无评论
原始帖子的评论将显示在这里
