[
    {
        "id": "osp-17237",
        "type": "article-journal",
        "title": "Arithmetic Actor Heads and Training Stabilization for Out-of-Distribution Reinforcement Learning",
        "author": [
            {
                "family": "Zhang",
                "given": "Yifan"
            },
            {
                "family": "Zheng",
                "given": "Liang"
            }
        ],
        "URL": "https://omanscience.com/ar/articles/arithmetic-actor-heads-and-training-stabilization-for-out-of-distribution-reinforcement-learning",
        "language": "en",
        "issued": {
            "date-parts": [
                [
                    2026
                ]
            ]
        },
        "abstract": "Reinforcement learning (RL) policies can deteriorate under out-of-distribution (OOD) magnitude shifts. Starting from soft actor-critic (SAC) and its Bayesian Amnesic Piecewise-Robust (BAPR) predecessor, we study the causal-symbolic BAPR (CS-BAPR) family. The practical method combines six training-stabilization settings with alternative actor heads: a Neural Addition Unit (NAU) with a Neural Multiplication Unit (NMU)-inspired quadratic correction, a Kolmogorov-Arnold Network (KAN), or a multilayer perceptron (MLP) with rectified linear unit (ReLU) or hyperbolic-tangent activations."
    }
]