{"_canonicalization":{"envelope_id":"axm_ + sha256(envelope minus {signature, axiom_id, anchors})","envelope_signature":"ed25519(envelope minus {signature, axiom_id})","json":"sort_keys=True, separators=(',',':'), ensure_ascii=False, allow_nan=False, utf-8","leaf_hash":"sha256(0x00 || canonical_json(envelope_full))","seal_signature":"ed25519(seal minus {signature, sig_algorithm})"},"axiom_id":"axm_f2772046182fdfefe91eeaf1a21109ae5afe14e22eeaaafa9eb980f057d70399","bitcoin_anchor":{"bitcoin_attestations":["bitcoin_block_949451"],"calendar_attestations":["https://finney.calendar.eternitywall.com","https://btc.calendar.catallaxy.com","https://alice.btc.calendar.opentimestamps.org","https://bob.btc.calendar.opentimestamps.org"],"ots_url":"/registry/data/substrate/anchors/77fc9c28fae777b81da5b495b3115474df6592dfac590333213d3bdf8b94a9b3.ots","stamped_at":"2026-05-15T03:00:03Z","status":"bitcoin"},"envelope":{"anchors":[{"chain":"crovia.axiom_graph","height":0,"merkle_proof":"spider_vendor_press_v1","root_at_anchor":"spider_vendor_press_v1"}],"axiom_id":"axm_f2772046182fdfefe91eeaf1a21109ae5afe14e22eeaaafa9eb980f057d70399","axiom_type":"AX.OBS","body":{"axiom_subtype":"news.vendor_press.v1","category":"news","fingerprint":"de2299fb1d5c911b54c321aaf1cbb5f80fd75e5f496248a9766fe55542b32796","published":"Tue, 12 May 2026 00:00:00 -0400","receipt_hash":"de2299fb1d5c911b54c321aaf1cbb5f80fd75e5f496248a9766fe55542b32796","schema":"spider.news.vendor_press.v1","spider":"vendor_press","spider_record":{"axiom_subtype":"news.vendor_press.v1","category":"news","decision_hint":"POSITIVE","envelope_target":"AX.OBS","fingerprint":"de2299fb1d5c911b54c321aaf1cbb5f80fd75e5f496248a9766fe55542b32796","observed_at":"2026-05-12T04:43:42.564879Z","parent_run_hash":"4cc5aca0c1b8116c9ab92405e0260204f01cf7ce2e49dea9d7e123236f5dc13b","published":"Tue, 12 May 2026 00:00:00 -0400","runtime_version":"0.1.0","schema":"spider.news.vendor_press.v1","source_status":200,"source_url":"https://export.arxiv.org/rss/cs.AI","spider":"vendor_press","summary_excerpt":"arXiv:2605.08472v1 Announce Type: new \nAbstract: The effectiveness of Reinforcement Learning (RL) in Large Language Models (LLMs) depends on the nature and diversity of the data used before and during RL. In particular, reasoning problems can often be approached in multiple ways that rely on different forms of reasoning, and exposure to only a limited range of such approaches in the training data may limit the effectiveness of RL. Motivated by this, we investigate using diverse self-generated data during mid-training as an intermediate step before RL training. Specifically, we adopt a bootstrapped data-generation framework guided by George Polya's problem-solving approaches for generating multiple variants of correct answers for each question in the training data, and then perform fine-tuning. We first provide a theoretical perspective on how mid-training on such data improves RL and explain how policy-gradient updates can incentivize combining multiple approaches. We then empirically ","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","url":"https://arxiv.org/abs/2605.08472","vendor":"arxiv_cs_ai"},"summary":"arXiv:2605.08472v1 Announce Type: new \nAbstract: The effectiveness of Reinforcement Learning (RL) in Large Language Models (LLMs) depends on the nature and diversity of the data used before and during RL. In particular, reasoning problems can often be approached in multiple ways that rely on different forms of reasoning, and exposure to only a limited range of such approaches in the training data may limit the effectiveness of RL. Motivated by this, we investigate using diverse self-generated data during mid-training as an intermediate step before RL training. Specifically, we adopt a bootstrapped data-generation framework guided by George Polya's problem-solving approaches for generating multiple variants of correct answers for each question in the training data, and then perform fine-tuning. We first provide a theoretical perspective on how mid-training on such data improves RL and explain how policy-gradient updates can incentivize combining multiple approaches. We then empirically ","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","vendor":"arxiv_cs_ai"},"confidence":{"method":"deterministic"},"decision":"POSITIVE","issued_at":"2026-05-12T04:43:42Z","notes":"Spider vendor_press (news) news.vendor_press.v1","object":{"captured_by":"crovia.spider.vendor_press","primary_source_url":"https://arxiv.org/abs/2605.08472"},"predecessors":[],"schema":"crovia.axiom.v1","signature":"ed25519:f3e190d610ee2a6508bad7fcd6d11ce6fd9ff2b97ba4741eb127018f11f592028b37ea6d21e71e1c3cfed773d3db54b3722620d5f3872b9e059da8e7e508a604","signer":"crovia.substrate","subject":{"observed_at":"2026-05-12T04:43:42Z","source_collector":"spider:vendor_press","target_id":"https://arxiv.org/abs/2605.08472"},"tsa":{"authority":"crovia.substrate.bootstrap","rfc3161_token":"{\"kind\":\"crovia.bootstrap.tsa\",\"source_jsonl\":\"/opt/crovia/spider/data/news/vendor_press_v1.jsonl\",\"source_seal_merkle_root\":\"spider_vendor_press_v1\",\"upgrade_path\":\"Sessione H \\u2014 OpenTimestamps weekly anchor\"}"},"zk_mode":"clear","zk_proof":null},"ledger":{"leaf_hash":"1f872ad48ebd6297c900511a7502f151c8380380e857860d7e485c4d0f035f59","leaf_index":128242,"ledger_path":"/opt/crovia/substrate/axiom_ledger.jsonl"},"merkle_proof":{"hash_alg":"sha256","leaf_prefix":"0x00","node_prefix":"0x01","odd_leaf_rule":"duplicate_last","path":[{"sibling":"07b6e7a7c7f1555636448200a68312c65e04a7b63a57950a14c775d7085577dd","side":"right"},{"sibling":"a91a3e63fc74a40318c9de97fb3c45259526850959f238ae1a7a52ec80472650","side":"left"},{"sibling":"f4e61c085443f04265772256505d81b825bbb29d8ca2dd1b423a35c58826359c","side":"right"},{"sibling":"d69bda079f6df2a7b661a9d74b268478d1c7b87437ef7ee63eff7791ba86709b","side":"right"},{"sibling":"6b381cb2a3c8834a952eff43cbf3df42e2282329f60924ade717cafb32d13544","side":"left"},{"sibling":"61ab00acd0475fb6cc41ab2867bb1ccfce54d02d9797a12220f28abefe579e53","side":"left"},{"sibling":"bec646946f214a143c9e93486ba236d585a2f0b43a53baac977c9f2944559842","side":"left"},{"sibling":"0dd5042df5f6760dec082d5c0a4f27a8abafc39ffbdb96ab323bd9dc341376bb","side":"left"},{"sibling":"42655d56270deb2082e77e49993b93afa49d6105df9975a9c20cc7a048dd54e7","side":"right"},{"sibling":"077005bbaed7b42537914de0b512ed52d33243215eab288181aba807d37bf04e","side":"right"},{"sibling":"c6eaf7a4fcab2db96e9e9423acb6922c80f64882d0f3f50d09e53a4807d23084","side":"left"},{"sibling":"df12eaabc0a370aff5d0488478f48d2b3f90d025c903643f98ea804b017688ec","side":"right"},{"sibling":"ffc4d51379293bc3e1910c7d612f409dc610fd9acf8241793fb89f82e1bad4ef","side":"left"},{"sibling":"62ac6554017807bd83187f5a3e5f4f72d6c482616429c2780e9fff1f4845fa04","side":"left"},{"sibling":"3a5e69cf0803f4c91f3895ed7c9a95748fef240bec4422e167c05300f79f06c0","side":"left"},{"sibling":"f2817ab288b5324fe49770372c7a10f33f7cd11005f8d4c0a730316f5229dc98","side":"left"},{"sibling":"725fac972e772ca0dc598810ea1abc70df472f72d2d6ab8a0baee2b80e5d2f4c","side":"left"},{"sibling":"98fc57dfef8873b512edc8340f7181df57302bb96777625e072235c62d7c5895","side":"right"}]},"schema":"crovia.axiom_proof.v1","seal":{"first_collector_run_id":"","first_receipt_hash":"","jsonl_path":"/opt/crovia/substrate/axiom_ledger.jsonl","key_id":"430895f101d38164","last_collector_run_id":"","last_receipt_hash":"","leaf_count":134292,"merkle_root":"77fc9c28fae777b81da5b495b3115474df6592dfac590333213d3bdf8b94a9b3","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","run_id":"hourly_json_retrofit_20260515T023701Z","schema":"crovia.seal.v1","seal_family_version":"crovia-seal-family/1","seal_kind":"substrate_batch","sealed_at":"2026-05-15T02:37:25Z","sig_algorithm":"ed25519","signature":"68107a834b00b24f5d4501e5ec727445311f132a486567ecc4c72a4e6dff24c8c21f2de3105293353ba5fdbe370d032819af6aa70f694e2e39b6af6737507009","signer_version":"1.1.0"},"trust_root":{"key_id":"430895f101d38164","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","signature_algorithm":"ed25519","url":"/registry/canon/TRUST_ROOT.md"},"verifier":{"spec":"/registry/canon/AXIOM_RECEIPT_v1.md","url":"/v/axm_f2772046182fdfefe91eeaf1a21109ae5afe14e22eeaaafa9eb980f057d70399"}}