DEV Community

Cover image for 💫 Auteur sur arXiv - stat.ML : FERPO : Optimisation de politiques régularisée par l'entropie directe
Mathieu Ledru
Mathieu Ledru

Posted on

💫 Auteur sur arXiv - stat.ML : FERPO : Optimisation de politiques régularisée par l'entropie directe

FERPO présente une approche innovante d'entropie maximale « on-policy » pour l'apprentissage par renforcement. Cette méthode exploite les valeurs du critique pour améliorer la politique tout en évitant la différentiation directe par rapport aux actions. Il en résulte un mécanisme de mise à jour plus fiable, favorisant une exploration étendue dans les régions d'actions à forte valeur.

🚨 Contenu premium.
⬆️ Passez à un abonnement supérieur pour accéder à l'analyse complète.
👉 Abonnez-vous ici : https://www.bonzai.pro/matyo91/shop/48ov_2168/automation-avec-flow-en-php

Top comments (0)