Variance reduction for policy gradient with action-dependent factorized baselines
Variance reduction for policy gradient with action-dependent factorized baselines. OpenAI News - artificial intelligence news.
π Read full article on OpenAI News β
Source: OpenAI News β Published β Category: Models