{"_canonicalization":{"envelope_id":"axm_ + sha256(envelope minus {signature, axiom_id, anchors})","envelope_signature":"ed25519(envelope minus {signature, axiom_id})","json":"sort_keys=True, separators=(',',':'), ensure_ascii=False, allow_nan=False, utf-8","leaf_hash":"sha256(0x00 || canonical_json(envelope_full))","seal_signature":"ed25519(seal minus {signature, sig_algorithm})"},"axiom_id":"axm_dc2752d6dd5e21ff797f849c6a69f873dc7101e7cb0b749c8706c3d047f5d001","bitcoin_anchor":{"bitcoin_attestations":[],"calendar_attestations":[],"ots_url":"","stamped_at":"","status":"pending_next_stamp"},"envelope":{"anchors":[{"chain":"crovia.axiom_graph","height":0,"merkle_proof":"spider_vendor_press_v1","root_at_anchor":"spider_vendor_press_v1"}],"axiom_id":"axm_dc2752d6dd5e21ff797f849c6a69f873dc7101e7cb0b749c8706c3d047f5d001","axiom_type":"AX.OBS","body":{"axiom_subtype":"news.vendor_press.v1","category":"news","fingerprint":"161809145c2cbe2b3a4bec21c73b49a106a3246a561185cc84ace8c29e4295dc","published":"Fri, 29 May 2026 00:00:00 -0400","receipt_hash":"161809145c2cbe2b3a4bec21c73b49a106a3246a561185cc84ace8c29e4295dc","schema":"spider.news.vendor_press.v1","spider":"vendor_press","spider_record":{"axiom_subtype":"news.vendor_press.v1","category":"news","decision_hint":"POSITIVE","envelope_target":"AX.OBS","fingerprint":"161809145c2cbe2b3a4bec21c73b49a106a3246a561185cc84ace8c29e4295dc","observed_at":"2026-05-29T04:43:58.478092Z","parent_run_hash":"0fcd87efcfe67ccb9952f747541debc16793919a4d20fd71ca0ad5516a0a13ee","published":"Fri, 29 May 2026 00:00:00 -0400","runtime_version":"0.1.0","schema":"spider.news.vendor_press.v1","source_status":200,"source_url":"https://export.arxiv.org/rss/cs.AI","spider":"vendor_press","summary_excerpt":"arXiv:2605.29009v1 Announce Type: cross \nAbstract: Post-training large language models with reinforcement learning is bottlenecked by the reward signal. Existing approaches require either ground-truth verifiable rewards, restricting training to domains with automatic correctness checks (e.g., mathematics, code execution), or human preference labels, which are expensive to collect and prone to reward hacking. Recent label-free methods replace ground-truth verifiers with self-referential signals like majority voting or token entropy over a model's own outputs, but risk reinforcing a model's own errors. In this work we propose Cross-Model Entropy (CME), the mean log-likelihood of a generator's response under a separate verifier model, as a label-free reward signal for RL post-training. CME is continuous, training-free, and grounded in the principle that responses a verifier finds unsurprising are likely correct or high quality. Because the verifier is independent of the generator, the sig","title":"Label-Free Reinforcement Learning via Cross-Model Entropy","url":"https://arxiv.org/abs/2605.29009","vendor":"arxiv_cs_ai"},"summary":"arXiv:2605.29009v1 Announce Type: cross \nAbstract: Post-training large language models with reinforcement learning is bottlenecked by the reward signal. Existing approaches require either ground-truth verifiable rewards, restricting training to domains with automatic correctness checks (e.g., mathematics, code execution), or human preference labels, which are expensive to collect and prone to reward hacking. Recent label-free methods replace ground-truth verifiers with self-referential signals like majority voting or token entropy over a model's own outputs, but risk reinforcing a model's own errors. In this work we propose Cross-Model Entropy (CME), the mean log-likelihood of a generator's response under a separate verifier model, as a label-free reward signal for RL post-training. CME is continuous, training-free, and grounded in the principle that responses a verifier finds unsurprising are likely correct or high quality. Because the verifier is independent of the generator, the sig","title":"Label-Free Reinforcement Learning via Cross-Model Entropy","vendor":"arxiv_cs_ai"},"confidence":{"method":"deterministic"},"decision":"POSITIVE","issued_at":"2026-05-29T04:43:58Z","notes":"Spider vendor_press (news) news.vendor_press.v1","object":{"captured_by":"crovia.spider.vendor_press","primary_source_url":"https://arxiv.org/abs/2605.29009"},"predecessors":[],"schema":"crovia.axiom.v1","signature":"ed25519:ea42fdc6ee7b44ddb9f1030b09a2b527e43f583d4c1214e5e07b6deae6a9fb0e6d838df279519064ea2e716436f8c202b5ca9b9d66cd66c16842c764987d5806","signer":"crovia.substrate","subject":{"observed_at":"2026-05-29T04:43:58Z","source_collector":"spider:vendor_press","target_id":"https://arxiv.org/abs/2605.29009"},"tsa":{"authority":"crovia.substrate.bootstrap","rfc3161_token":"{\"kind\":\"crovia.bootstrap.tsa\",\"source_jsonl\":\"/opt/crovia/spider/data/news/vendor_press_v1.jsonl\",\"source_seal_merkle_root\":\"spider_vendor_press_v1\",\"upgrade_path\":\"Sessione H \\u2014 OpenTimestamps weekly anchor\"}"},"zk_mode":"clear","zk_proof":null},"ledger":{"leaf_hash":"d12a7ffc0929b1a65942ff41f50c529037916e40b2311f131f61058c03db5fad","leaf_index":157822,"ledger_path":"/opt/crovia/substrate/axiom_ledger.jsonl"},"merkle_proof":{"hash_alg":"sha256","leaf_prefix":"0x00","node_prefix":"0x01","odd_leaf_rule":"duplicate_last","path":[{"sibling":"805bec409df130a6aee94aef179215e9c0c884f021950a9e1f2b93464f8f4cbd","side":"right"},{"sibling":"39ea70993e60d9cf0f7549c95dcdf570ed45b7180d7290b11d41113e792d69d4","side":"left"},{"sibling":"07d90d699dbf5136f3de1b79e51fec6063ee658d186afbe3ed744098aac022ef","side":"left"},{"sibling":"2aa509ef4653f4ad84555571b5c9d8c2352d64508cc59120749c6090052309b0","side":"left"},{"sibling":"eaa1a215c41f25dcef77080027d87dcdb2ca546b4a0303acc29c2b24d23fb96b","side":"left"},{"sibling":"559f7685d77b293505b30c7767f415ead790eb3de9a4d0bb4308456be00703ff","side":"left"},{"sibling":"8a2f71675e192857299c484b4c2ecd6b3fe6098871f8b781ac9f3ed3449ef468","side":"left"},{"sibling":"85dd98b6b813fff84d9d7c892cf52e58d31740ddc1a693741a96ae274811f1ea","side":"right"},{"sibling":"291a37d6414d385e45486ef4725ce7087043d900d04f90b309d04bd876c338e5","side":"right"},{"sibling":"1dcc44e23fbb0218b13591e4b584eca3600dcf365769cb741e0ecd33b25b8c56","side":"right"},{"sibling":"fcf16a6f44025801f5b83e928acce764352ddbc06ae3043d8cde9a409933e6d8","side":"right"},{"sibling":"78982294dee68f9db9288c64d7e507c7865fda96e1b6f7ccff5c8bb152e93c49","side":"left"},{"sibling":"995b421824624a8282c7f44e64c64ee35344800f477ae1845b41be14d3fab94c","side":"right"},{"sibling":"66331bac84ca0f8983eb09fac7eaf95af234f1b82680b793eabff4ee25caac40","side":"left"},{"sibling":"35ca36cee447f0ef7064a25d55f59357c66901e31427729c4c1d8b14aa8adb6c","side":"left"},{"sibling":"eef0e8906a749d3470f89beeedc723f37a5737010bbb0dcc7cf91515338e5a3e","side":"right"},{"sibling":"1a07e481a9407d71aad078ce854cdeee362163c887fe10f889b0ecf0b5e749ad","side":"right"},{"sibling":"d841ad93efda0869e5eb97678f348f03f5caab4353e05ff4bf18f47fb945b822","side":"left"}]},"schema":"crovia.axiom_proof.v1","seal":{"first_collector_run_id":"","first_receipt_hash":"","jsonl_path":"/opt/crovia/substrate/axiom_ledger.jsonl","key_id":"430895f101d38164","last_collector_run_id":"","last_receipt_hash":"","leaf_count":158251,"merkle_root":"485e6b31fe60c8beba5b394808c7e4c32448b2ff65c2482c480ca0e2a2eda718","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","run_id":"hourly_json_retrofit_20260529T053701Z","schema":"crovia.seal.v1","seal_family_version":"crovia-seal-family/1","seal_kind":"substrate_batch","sealed_at":"2026-05-29T05:37:37Z","sig_algorithm":"ed25519","signature":"bbf9f005201182fce4f9d94c7a9d01a508b56daf7d9611bd73514f5f616bc059d0e5e1f2edfc95716e6fe08ef5fae38b558cbf7f2fd8f9d5dfe4c34a54c83005","signer_version":"1.1.0"},"trust_root":{"key_id":"430895f101d38164","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","signature_algorithm":"ed25519","url":"/registry/canon/TRUST_ROOT.md"},"verifier":{"spec":"/registry/canon/AXIOM_RECEIPT_v1.md","url":"/v/axm_dc2752d6dd5e21ff797f849c6a69f873dc7101e7cb0b749c8706c3d047f5d001"}}