{"_canonicalization":{"envelope_id":"axm_ + sha256(envelope minus {signature, axiom_id, anchors})","envelope_signature":"ed25519(envelope minus {signature, axiom_id})","json":"sort_keys=True, separators=(',',':'), ensure_ascii=False, allow_nan=False, utf-8","leaf_hash":"sha256(0x00 || canonical_json(envelope_full))","seal_signature":"ed25519(seal minus {signature, sig_algorithm})"},"axiom_id":"axm_6ceda46e57348d634a50c8c93bb415b45d4ba926995f19b090e9449aad6da24e","bitcoin_anchor":{"bitcoin_attestations":[],"calendar_attestations":[],"ots_url":"","stamped_at":"","status":"pending_next_stamp"},"envelope":{"anchors":[{"chain":"crovia.axiom_graph","height":0,"merkle_proof":"spider_vendor_press_v1","root_at_anchor":"spider_vendor_press_v1"}],"axiom_id":"axm_6ceda46e57348d634a50c8c93bb415b45d4ba926995f19b090e9449aad6da24e","axiom_type":"AX.OBS","body":{"axiom_subtype":"news.vendor_press.v1","category":"news","fingerprint":"3bf52a0ee80b437ae2c88b7528092b6abd2d033fafa73b6064c533cf34dcee2f","published":"Sat, 06 Jun 2026 00:00:00 -0400","receipt_hash":"3bf52a0ee80b437ae2c88b7528092b6abd2d033fafa73b6064c533cf34dcee2f","schema":"spider.news.vendor_press.v1","spider":"vendor_press","spider_record":{"axiom_subtype":"news.vendor_press.v1","category":"news","decision_hint":"POSITIVE","envelope_target":"AX.OBS","fingerprint":"3bf52a0ee80b437ae2c88b7528092b6abd2d033fafa73b6064c533cf34dcee2f","observed_at":"2026-06-06T04:43:19.193968Z","parent_run_hash":"550d5b02674822f43975c282be668ca76a4d9c7c957eb1601ba8b07dcb67715e","published":"Sat, 06 Jun 2026 00:00:00 -0400","runtime_version":"0.1.0","schema":"spider.news.vendor_press.v1","source_status":200,"source_url":"https://export.arxiv.org/rss/cs.AI","spider":"vendor_press","summary_excerpt":"arXiv:2601.09236v3 Announce Type: replace-cross \nAbstract: Reward design remains a significant bottleneck in applying reinforcement learning (RL) to real-world problems. A popular alternative is reward learning, where reward functions are inferred from human feedback rather than manually specified. Recent work has proposed learning reward functions from human ratings rather than traditional binary preferences, enabling richer and potentially less cognitively demanding supervision. Building on this paradigm, we introduce a new rating-based RL method, Ranked Return Regression for RL (R4). At its core, R4 uses a novel ranking mean squared error loss that learns from a dataset of trajectory-rating pairs, treating the human-provided discrete ratings (e.g., bad, neutral, good) as ordinal targets. Unlike prior rating-based approaches, R4 offers formal guarantees: its solution set is provably minimal and complete under mild assumptions. Empirically, using both human-provided and simulated rati","title":"Reward Learning through Ranking Mean Squared Error","url":"https://arxiv.org/abs/2601.09236","vendor":"arxiv_cs_ai"},"summary":"arXiv:2601.09236v3 Announce Type: replace-cross \nAbstract: Reward design remains a significant bottleneck in applying reinforcement learning (RL) to real-world problems. A popular alternative is reward learning, where reward functions are inferred from human feedback rather than manually specified. Recent work has proposed learning reward functions from human ratings rather than traditional binary preferences, enabling richer and potentially less cognitively demanding supervision. Building on this paradigm, we introduce a new rating-based RL method, Ranked Return Regression for RL (R4). At its core, R4 uses a novel ranking mean squared error loss that learns from a dataset of trajectory-rating pairs, treating the human-provided discrete ratings (e.g., bad, neutral, good) as ordinal targets. Unlike prior rating-based approaches, R4 offers formal guarantees: its solution set is provably minimal and complete under mild assumptions. Empirically, using both human-provided and simulated rati","title":"Reward Learning through Ranking Mean Squared Error","vendor":"arxiv_cs_ai"},"confidence":{"method":"deterministic"},"decision":"POSITIVE","issued_at":"2026-06-06T04:43:19Z","notes":"Spider vendor_press (news) news.vendor_press.v1","object":{"captured_by":"crovia.spider.vendor_press","primary_source_url":"https://arxiv.org/abs/2601.09236"},"predecessors":[],"schema":"crovia.axiom.v1","signature":"ed25519:5bbbc08d2b93159184c83ca3eb069fe53e701882e2d3cca8e1996ac52b5ef7e273a1b8ff9ab6e7c862afcbb8c7de3f02868bd0e923ed6302d51c4b1fd9b83200","signer":"crovia.substrate","subject":{"observed_at":"2026-06-06T04:43:19Z","source_collector":"spider:vendor_press","target_id":"https://arxiv.org/abs/2601.09236"},"tsa":{"authority":"crovia.substrate.bootstrap","rfc3161_token":"{\"kind\":\"crovia.bootstrap.tsa\",\"source_jsonl\":\"/opt/crovia/spider/data/news/vendor_press_v1.jsonl\",\"source_seal_merkle_root\":\"spider_vendor_press_v1\",\"upgrade_path\":\"Sessione H \\u2014 OpenTimestamps weekly anchor\"}"},"zk_mode":"clear","zk_proof":null},"ledger":{"leaf_hash":"129d29d92970fcbe858b8b73b8602537c7810c65391dc05724fedb7e56cc9675","leaf_index":219486,"ledger_path":"/opt/crovia/substrate/axiom_ledger.jsonl"},"merkle_proof":{"hash_alg":"sha256","leaf_prefix":"0x00","node_prefix":"0x01","odd_leaf_rule":"duplicate_last","path":[{"sibling":"79831c36ddc5f2850830c41a71fb925af326ef6d19eeb3f5efa3f67def3ea262","side":"right"},{"sibling":"86a1d76bfcdd257c456277d32f569f4659ea363a13fe165f769d8c9fef2259a9","side":"left"},{"sibling":"824f72697a6cfa46924169eef504455fae7a44da30da6f4c7390739e1ed847f7","side":"left"},{"sibling":"bc9cbf5c1d354e170f87d6984ed7204a72d651613022d9679525eaf809200d8a","side":"left"},{"sibling":"a86ef67b9672a4f91af4f7eea997b4e933b0169d68790a1e0290f95678a19d49","side":"left"},{"sibling":"b3daa9fa5549ad881513723d1851e8d3603d0f99656eb2e027f06943c4ae50dd","side":"right"},{"sibling":"9f3e417d5254daa81ba94603b763ed50015b2369f85267c197e02739c64ecaa2","side":"left"},{"sibling":"242ec7690d5995e1b5c2e94f2a8cedd5416b170d2db6fb44c95d0f9fb134a235","side":"right"},{"sibling":"42875175baa73c49869c927a23711e8bef732331ce49af85fa7e86d0903b1066","side":"left"},{"sibling":"84d2509eab51047589142ed6da8c496305d2fbcbe148e0e6755163db2c7a4bc4","side":"right"},{"sibling":"9e3ea17e834fab022f2eabcfedb8ea0ac95c1f9fb57edc5004dded68522d3c9e","side":"right"},{"sibling":"41d58fea95a95071715ee23ef8bcd15f5867a3639da28e62a0641bc95eb83094","side":"left"},{"sibling":"27ad9d6a9ab792d708709017242a61b9ca519da4e035f87a342811aae221d000","side":"left"},{"sibling":"5f303e2a7840c60038ff2d035b1cd911feefb0fba880de2d737c6671ace594d4","side":"right"},{"sibling":"b2590791b920ca2a4ed39de126d2c0b1a10d9e7e62f572f12425f214e767b6e1","side":"left"},{"sibling":"1a61eadbf0217d063ab78291ccafdc0c92907f7d6ccdc3357534ef89f07d78ae","side":"right"},{"sibling":"c300cf0154c136afc09b1702a0be98f4ba5b6dc5cf57e8cc714ec1eaf4196eff","side":"left"},{"sibling":"d841ad93efda0869e5eb97678f348f03f5caab4353e05ff4bf18f47fb945b822","side":"left"}]},"schema":"crovia.axiom_proof.v1","seal":{"first_collector_run_id":"","first_receipt_hash":"","jsonl_path":"/opt/crovia/substrate/axiom_ledger.jsonl","key_id":"430895f101d38164","last_collector_run_id":"","last_receipt_hash":"","leaf_count":219672,"merkle_root":"d3e32d3a61ca02ce6b1f0b2db86721107770b250e8a5bf762a2c225d2f03c870","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","run_id":"hourly_json_retrofit_20260606T053701Z","schema":"crovia.seal.v1","seal_family_version":"crovia-seal-family/1","seal_kind":"substrate_batch","sealed_at":"2026-06-06T05:38:35Z","sig_algorithm":"ed25519","signature":"dab214c2d4d857f01383c8e93a521a774b1aba60eaee5677d4e43e4074f0342b2c6a9b9bfcff0eba74f7ac81fcb490dd0e43727979c1a7e8979c7e11547fb101","signer_version":"1.1.0"},"trust_root":{"key_id":"430895f101d38164","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","signature_algorithm":"ed25519","url":"/registry/canon/TRUST_ROOT.md"},"verifier":{"spec":"/registry/canon/AXIOM_RECEIPT_v1.md","url":"/v/axm_6ceda46e57348d634a50c8c93bb415b45d4ba926995f19b090e9449aad6da24e"}}