<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Rl on Lineance Lensit</title><link>https://lineance.github.io/tags/rl/</link><description>Recent content in Rl on Lineance Lensit</description><generator>Hugo</generator><language>en</language><lastBuildDate>Thu, 12 Mar 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://lineance.github.io/tags/rl/index.xml" rel="self" type="application/rss+xml"/><item><title>From REINFORCE to GiGPO : The Evolution of Policy Gradient Methods</title><link>https://lineance.github.io/posts/the-evolution-of-policy-gradient-methods/</link><pubDate>Thu, 12 Mar 2026 00:00:00 +0000</pubDate><guid>https://lineance.github.io/posts/the-evolution-of-policy-gradient-methods/</guid><description>&lt;blockquote&gt;
&lt;p&gt;The Bias-Variance Tradeoff and Architecture Simplification in LLM Training&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="1-historical-trajectory"&gt;1. Historical Trajectory&lt;/h2&gt;
&lt;p&gt;&lt;img alt="diagram" loading="lazy" src="https://lineance.github.io/posts/the-evolution-of-policy-gradient-methods/teopgm-diagram.webp"&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Core Tension&lt;/strong&gt;: Unbiased high-variance Monte Carlo → Biased low-variance bootstrapping → Critic-free relative estimation → Fine-grained credit decomposition&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="2-reinforce-the-monte-carlo-foundation"&gt;2. REINFORCE: The Monte Carlo Foundation&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Problem&lt;/strong&gt;: Direct policy gradient via likelihood ratio suffers from extreme variance.&lt;/p&gt;
&lt;p&gt;$$
\nabla_\theta J = \operatorname{E}&lt;em&gt;{\pi&lt;/em&gt;\theta}\left[\sum_{t} G_t \nabla_\theta \log \pi_\theta(a_t \mid s_t)\right]
$$&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Challenge&lt;/strong&gt;: $G_t = \sum_{k=t}^T \gamma^{k-t}r_k$ has variance $O(T)$. Unstable for long episodes.&lt;/p&gt;</description></item></channel></rss>