<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Reinforcement Learning | Steve James</title><link>https://sdjames.me/tag/reinforcement-learning/</link><atom:link href="https://sdjames.me/tag/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><description>Reinforcement Learning</description><generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Tue, 01 Sep 2026 00:00:00 +0000</lastBuildDate><image><url>https://sdjames.me/media/icon_huf407e28faea15ab880cdbc1ef97b5c3b_31359_512x512_fill_lanczos_center_3.png</url><title>Reinforcement Learning</title><link>https://sdjames.me/tag/reinforcement-learning/</link></image><item><title>PyCRM: A Python library for reward machine-based reinforcement learning</title><link>https://sdjames.me/publication/bester-2026-pycrm/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/bester-2026-pycrm/</guid><description/></item><item><title>Drowning in Degrees of Freedom: One Agent for Every Task</title><link>https://sdjames.me/publication/james-2026-drowning/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/james-2026-drowning/</guid><description/></item><item><title>Redistribution-based Cost Inference Improves Sparse Safe Offline RL</title><link>https://sdjames.me/publication/gelo-2026-redistribution/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/gelo-2026-redistribution/</guid><description/></item><item><title>The Goal-Directed Frame for General Agents</title><link>https://sdjames.me/publication/nangue-2026-goal/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2026-goal/</guid><description/></item><item><title>An Unreasonably Simple Approach to Safe RL</title><link>https://sdjames.me/publication/nangue-2026-unreasonably/</link><pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2026-unreasonably/</guid><description/></item><item><title>Weighted Composition for Entropy-regularised Reinforcement Learning</title><link>https://sdjames.me/publication/nyabadza-2026-weighted/</link><pubDate>Wed, 01 Jul 2026 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nyabadza-2026-weighted/</guid><description/></item><item><title>MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents</title><link>https://sdjames.me/publication/rosen-2026-moralitygym/</link><pubDate>Mon, 25 May 2026 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/rosen-2026-moralitygym/</guid><description/></item><item><title>Skill-Driven Neurosymbolic State Abstractions</title><link>https://sdjames.me/publication/ahmetoglu-2025-skill/</link><pubDate>Thu, 04 Dec 2025 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/ahmetoglu-2025-skill/</guid><description/></item><item><title>Using NEAT to Learn Operators for Flexible Boolean Composition within Reinforcement Learning</title><link>https://sdjames.me/publication/esterhuysen-2025-using/</link><pubDate>Wed, 11 Jun 2025 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/esterhuysen-2025-using/</guid><description/></item><item><title>Composition and Zero-Shot Transfer with Lattice Structures in Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2025-composition/</link><pubDate>Thu, 17 Apr 2025 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2025-composition/</guid><description/></item><item><title>Compositional Instruction Following with Language Models and Reinforcement Learning</title><link>https://sdjames.me/publication/cohen-2024-compositional/</link><pubDate>Sun, 01 Dec 2024 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/cohen-2024-compositional/</guid><description/></item><item><title>Optimal Task Generalisation in Cooperative Multi-Agent Reinforcement Learning</title><link>https://sdjames.me/publication/rosen-2024-optimal/</link><pubDate>Fri, 09 Aug 2024 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/rosen-2024-optimal/</guid><description/></item><item><title>ROSARL: Reward-Only Safe Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2024-rosarl/</link><pubDate>Fri, 09 Aug 2024 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2024-rosarl/</guid><description/></item><item><title>Skill Machines: Temporal Logic Skill Composition in Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2024-skill/</link><pubDate>Tue, 07 May 2024 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2024-skill/</guid><description/></item><item><title>Counting Reward Automata: Sample Efficient Reinforcement Learning Through the Exploitation of Reward Function Structure</title><link>https://sdjames.me/publication/bester-2024-counting/</link><pubDate>Mon, 26 Feb 2024 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/bester-2024-counting/</guid><description/></item><item><title>Dynamics Generalisation in Reinforcement Learning via Adaptive Context-Aware Policies</title><link>https://sdjames.me/publication/beukman-2023-dynamics/</link><pubDate>Mon, 04 Dec 2023 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/beukman-2023-dynamics/</guid><description/></item><item><title>End-to-End Learning to Follow Language Instructions with Compositional Policies</title><link>https://sdjames.me/publication/cohen-2022-end/</link><pubDate>Wed, 14 Dec 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/cohen-2022-end/</guid><description/></item><item><title>Skill Machines: Temporal Logic Composition in Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2022-skill-b/</link><pubDate>Fri, 09 Dec 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2022-skill-b/</guid><description/></item><item><title>Facilitating Safe Sim-to-Real through Simulator Abstraction and Zero-shot Task Composition</title><link>https://sdjames.me/publication/love-2022-facilitating/</link><pubDate>Sun, 23 Oct 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/love-2022-facilitating/</guid><description/></item><item><title>Skill Machines: Temporal Logic Composition in Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2022-skill-a/</link><pubDate>Sun, 23 Oct 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2022-skill-a/</guid><description/></item><item><title>Combining Evolutionary Search with Behaviour Cloning for Procedurally Generated Content</title><link>https://sdjames.me/publication/muir-2022-combining/</link><pubDate>Mon, 18 Jul 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/muir-2022-combining/</guid><description/></item><item><title>World Value Functions: Knowledge Representation for Learning and Planning</title><link>https://sdjames.me/publication/nangue-2022-world-b/</link><pubDate>Mon, 13 Jun 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2022-world-b/</guid><description/></item><item><title>Accounting for the Sequential Nature of States to Learn Representations in Reinforcement Learning</title><link>https://sdjames.me/publication/michlo-2022-accounting/</link><pubDate>Wed, 08 Jun 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/michlo-2022-accounting/</guid><description/></item><item><title>Adaptive Online Value Function Approximation with Wavelets</title><link>https://sdjames.me/publication/beukman-2022-adaptive/</link><pubDate>Wed, 08 Jun 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/beukman-2022-adaptive/</guid><description/></item><item><title>Learning Abstract and Transferable Representations for Planning</title><link>https://sdjames.me/publication/james-2022-learning/</link><pubDate>Wed, 08 Jun 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/james-2022-learning/</guid><description/></item><item><title>World Value Functions: Knowledge Representation for Multitask Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2022-world-a/</link><pubDate>Wed, 08 Jun 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2022-world-a/</guid><description/></item><item><title>Autonomous Learning of Object-Centric Abstractions for High-Level Planning</title><link>https://sdjames.me/publication/james-2022-autonomous/</link><pubDate>Mon, 25 Apr 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/james-2022-autonomous/</guid><description/></item><item><title>Generalisation in Lifelong Reinforcement Learning through Logical Composition</title><link>https://sdjames.me/publication/nangue-2022-generalisation/</link><pubDate>Mon, 25 Apr 2022 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2022-generalisation/</guid><description/></item><item><title>Generalisation in Lifelong Reinforcement Learning through Logical Composition</title><link>https://sdjames.me/publication/nangue-2021-generalisation/</link><pubDate>Mon, 06 Dec 2021 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2021-generalisation/</guid><description/></item><item><title>Learning to Follow Language Instructions with Compositional Policies</title><link>https://sdjames.me/publication/cohen-2021-learning/</link><pubDate>Thu, 04 Nov 2021 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/cohen-2021-learning/</guid><description/></item><item><title>A Boolean Task Algebra for Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2020-boolean-a/</link><pubDate>Sun, 06 Dec 2020 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2020-boolean-a/</guid><description/></item><item><title>Logical Composition for Lifelong Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2020-logical/</link><pubDate>Mon, 13 Jul 2020 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2020-logical/</guid><description/></item><item><title>Learning Portable Representations for High-Level Planning</title><link>https://sdjames.me/publication/james-2020-learning-a/</link><pubDate>Sun, 12 Jul 2020 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/james-2020-learning-a/</guid><description/></item><item><title>Learning Object-Centric Representations for High-Level Planning in Minecraft</title><link>https://sdjames.me/publication/james-2020-learning-b/</link><pubDate>Sat, 11 Jul 2020 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/james-2020-learning-b/</guid><description/></item><item><title>A Boolean Task Algebra for Reinforcement Learning</title><link>https://sdjames.me/publication/nangue-2020-boolean-b/</link><pubDate>Sun, 26 Apr 2020 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/nangue-2020-boolean-b/</guid><description/></item><item><title>Learning Options from Demonstration using Skill Segmentation</title><link>https://sdjames.me/publication/cockcroft-2020-learning/</link><pubDate>Wed, 29 Jan 2020 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/cockcroft-2020-learning/</guid><description/></item><item><title>Composing Value Functions in Reinforcement Learning</title><link>https://sdjames.me/publication/van-2019-composing/</link><pubDate>Mon, 10 Jun 2019 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/van-2019-composing/</guid><description/></item><item><title>Multi-Pass Q-Networks for Deep Reinforcement Learning with Parameterised Action Spaces</title><link>https://sdjames.me/publication/bester-2019-multi/</link><pubDate>Fri, 10 May 2019 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/bester-2019-multi/</guid><description/></item><item><title>Learning to Plan with Portable Symbols</title><link>https://sdjames.me/publication/james-2018-learning/</link><pubDate>Sat, 14 Jul 2018 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/james-2018-learning/</guid><description/></item><item><title>Will it Blend? Composing Value Functions in Reinforcement Learning</title><link>https://sdjames.me/publication/van-2018-will/</link><pubDate>Sat, 14 Jul 2018 00:00:00 +0000</pubDate><guid>https://sdjames.me/publication/van-2018-will/</guid><description/></item></channel></rss>