[
    {
        "id": "osp-15019",
        "type": "article-journal",
        "title": "MetaOPD: ترجيح الرموز المتعلم بالتعلم الفوقي للتقطير على السياسة",
        "author": [
            {
                "family": "Wang",
                "given": "Zipeng"
            },
            {
                "family": "Dong",
                "given": "Xinpeng"
            },
            {
                "family": "Wang",
                "given": "Yuefan"
            },
            {
                "family": "Lu",
                "given": "Pingchen"
            },
            {
                "family": "Wei",
                "given": "Xian"
            },
            {
                "family": "Kuang",
                "given": "Kun"
            },
            {
                "family": "Wu",
                "given": "Fei"
            },
            {
                "family": "Dai",
                "given": "Zhongxiang"
            },
            {
                "family": "Zhang",
                "given": "Min"
            }
        ],
        "URL": "https://omanscience.com/ar/articles/metaopd-meta-learned-token-weighting-for-on-policy-distillation",
        "language": "en",
        "issued": {
            "date-parts": [
                [
                    2026
                ]
            ]
        }
    }
]