Video wird geladen...
Video konnte nicht geladen werden
量化交易必懂:MDP 如何让 AI 学会动态决策? 昨天粉丝问我:有没有把马尔可夫决策过程(MDP)讲得既清晰又扎实的课程?最好是从确定性搜索过渡到不确定环境的完整推导。 我去找了斯坦福 Percy Liang 教授主讲的《Markov Decision Processes》。 他清晰地拆解了 MDP 的完整逻辑:从引入随机性与马尔可夫假设,到策略(Policy)、折扣因子、Q 值、策略评估,再到价值迭代求解最优策略。 核心内容包括: 1️⃣ 从 Search 到 MDP:动作结果从确定变为概率分布,经典 Flaky Tram 示例 2️⃣ 策略与折扣因子 γ:为什么解不再是一串固定动作路径 3️⃣ Q 值与 Bellman 方程:精确计算策略价值 4️⃣ 价值迭代(Value Iteration):通过迭代求解最优策略 π* 最终结论很明确:MDP 是所有强化学习算法(Q-Learning、PPO、DQN)的数学基础,也是理解市场交易、动态资产配置和期权行权等随机决策问题的核心框架。 对正在学强化学习或量化交易的朋友,这是非常扎实的理论基石。建议收藏。
20,741 Aufrufe • vor 1 Monat •via X (Twitter)
0 Kommentare
Keine Kommentare verfügbar
Kommentare vom Original-Post werden hier angezeigt
