{"_canonicalization":{"envelope_id":"axm_ + sha256(envelope minus {signature, axiom_id, anchors})","envelope_signature":"ed25519(envelope minus {signature, axiom_id})","json":"sort_keys=True, separators=(',',':'), ensure_ascii=False, allow_nan=False, utf-8","leaf_hash":"sha256(0x00 || canonical_json(envelope_full))","seal_signature":"ed25519(seal minus {signature, sig_algorithm})"},"axiom_id":"axm_f9dbf3553c4052f4b7099ec6989313bfce967ce08f901a30a1298d65627c770a","bitcoin_anchor":{"bitcoin_attestations":[],"calendar_attestations":[],"ots_url":"","stamped_at":"","status":"pending_next_stamp"},"envelope":{"anchors":[{"chain":"crovia.axiom_graph","height":0,"merkle_proof":"spider_vendor_press_v1","root_at_anchor":"spider_vendor_press_v1"}],"axiom_id":"axm_f9dbf3553c4052f4b7099ec6989313bfce967ce08f901a30a1298d65627c770a","axiom_type":"AX.OBS","body":{"axiom_subtype":"news.vendor_press.v1","category":"news","fingerprint":"180d887ab120d82c8991dbe314cc8e557e5e59305113fdcb5de854478619d321","published":"Thu, 18 Jun 2026 00:00:00 -0400","receipt_hash":"180d887ab120d82c8991dbe314cc8e557e5e59305113fdcb5de854478619d321","schema":"spider.news.vendor_press.v1","spider":"vendor_press","spider_record":{"axiom_subtype":"news.vendor_press.v1","category":"news","decision_hint":"POSITIVE","envelope_target":"AX.OBS","fingerprint":"180d887ab120d82c8991dbe314cc8e557e5e59305113fdcb5de854478619d321","observed_at":"2026-06-18T04:43:37.219665Z","parent_run_hash":"de79a40f7b3537d88842f7ac355e799c5df2adcb4fc32a4e28096d4bbdf01739","published":"Thu, 18 Jun 2026 00:00:00 -0400","runtime_version":"0.1.0","schema":"spider.news.vendor_press.v1","source_status":200,"source_url":"https://export.arxiv.org/rss/cs.AI","spider":"vendor_press","summary_excerpt":"arXiv:2606.18831v1 Announce Type: cross \nAbstract: Long-context reasoning is an essential capability for large language models, particularly when they are deployed as autonomous agents that must reason over lengthy trajectories. Reinforcement learning (RL) has recently emerged as a dominant paradigm for improving this ability, yet existing work largely focuses on reward engineering while diverse training data remains scarce. We revisit this problem from a data-centric perspective and show that a simple yet effective data recipe alone, paired with a minimal outcome-based GRPO setup, suffices to substantially improve long-context reasoning. Our recipe targets three complementary task families -- retrieval, multi-evidence synthesis, and reasoning -- for which we construct and curate eight datasets totaling ~14K examples. Experiments on three models (Qwen3-4B/8B/30B-A3B) yield average gains of +7.2/+3.2/+6.4 points across seven long-context benchmarks, surpassing prior RL training sets. We","title":"Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning","url":"https://arxiv.org/abs/2606.18831","vendor":"arxiv_cs_ai"},"summary":"arXiv:2606.18831v1 Announce Type: cross \nAbstract: Long-context reasoning is an essential capability for large language models, particularly when they are deployed as autonomous agents that must reason over lengthy trajectories. Reinforcement learning (RL) has recently emerged as a dominant paradigm for improving this ability, yet existing work largely focuses on reward engineering while diverse training data remains scarce. We revisit this problem from a data-centric perspective and show that a simple yet effective data recipe alone, paired with a minimal outcome-based GRPO setup, suffices to substantially improve long-context reasoning. Our recipe targets three complementary task families -- retrieval, multi-evidence synthesis, and reasoning -- for which we construct and curate eight datasets totaling ~14K examples. Experiments on three models (Qwen3-4B/8B/30B-A3B) yield average gains of +7.2/+3.2/+6.4 points across seven long-context benchmarks, surpassing prior RL training sets. We","title":"Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning","vendor":"arxiv_cs_ai"},"confidence":{"method":"deterministic"},"decision":"POSITIVE","issued_at":"2026-06-18T04:43:37Z","notes":"Spider vendor_press (news) news.vendor_press.v1","object":{"captured_by":"crovia.spider.vendor_press","primary_source_url":"https://arxiv.org/abs/2606.18831"},"predecessors":[],"schema":"crovia.axiom.v1","signature":"ed25519:c368c3e976ff3748cf6ea1e12d16c3611df5e217fadd55009499d2250d51fa92cc53209b8e00ac3bec3197e7cafb3f8ee662eeda43b7c0ecd903a65cd8d92008","signer":"crovia.substrate","subject":{"observed_at":"2026-06-18T04:43:37Z","source_collector":"spider:vendor_press","target_id":"https://arxiv.org/abs/2606.18831"},"tsa":{"authority":"crovia.substrate.bootstrap","rfc3161_token":"{\"kind\":\"crovia.bootstrap.tsa\",\"source_jsonl\":\"/opt/crovia/spider/data/news/vendor_press_v1.jsonl\",\"source_seal_merkle_root\":\"spider_vendor_press_v1\",\"upgrade_path\":\"Sessione H \\u2014 OpenTimestamps weekly anchor\"}"},"zk_mode":"clear","zk_proof":null},"ledger":{"leaf_hash":"cbee0f130f70606bb3ef62d010634510e8026cc90999a8ace8f7252b1700bdb2","leaf_index":233379,"ledger_path":"/opt/crovia/substrate/axiom_ledger.jsonl"},"merkle_proof":{"hash_alg":"sha256","leaf_prefix":"0x00","node_prefix":"0x01","odd_leaf_rule":"duplicate_last","path":[{"sibling":"4ca4009118fbe8c8c8c690c60b44e2756d033c0fba0d1e70d62707826fdc4101","side":"left"},{"sibling":"4557900ff715bbac995e5de92d0d39b2ad8f0abd04606ad9aa1a1edcdfac6e31","side":"left"},{"sibling":"6d80649fe1db393a4e8dac5f98d740fa27385a92f13155c4ce01a1c444bd4e4a","side":"right"},{"sibling":"f2fba8f8a0f459143d04f20cd8c50a40b4b64c67f4bd45c7710c0578b0d3ff94","side":"right"},{"sibling":"bef530fc364483d39be70621d6bc4ded9e5a2391348646f87c8ed07974037ca7","side":"right"},{"sibling":"be5a4317ba9d0ec5e9c75c717e0ee14102f5eca738960ce1468000034c65b908","side":"left"},{"sibling":"b3421717a3204821688656ab8d5c36686e7f6c789fdda23381e8f3515d1ce8da","side":"right"},{"sibling":"b4c26795680b2096400acbdc34159290b2a0589778819fc7e052c7a60bb5c873","side":"left"},{"sibling":"429c2a92a65e6eeaa2eda0a35fdb9e541472a1eace4c69a4d01a618a659a110f","side":"left"},{"sibling":"d97d1ebe04af6ea572f9d4334004d01026acffa3da5be2883c7566513c76e2c0","side":"left"},{"sibling":"571eb56e7ce00fe1f38d0ac4fc56828d01b2cfc1ab9089cde245c0656bee0514","side":"left"},{"sibling":"7ac50038a8ced3aeaf1194a2407a4a09346b0e4399da36ecde4390675a0c4bf1","side":"left"},{"sibling":"8c5e2b48dc31ef0edcd35c3db048235aa78cc48443aa2a8da3aa6e9b5524d2c4","side":"right"},{"sibling":"e616c34dbaf9456d5a6d3e2da82cde8621293c9f6d8a4cf9e441d7fd9cc81579","side":"right"},{"sibling":"94c0c932e61657f5e37fdba43f6ca9eddea8359425a7c1558dabe566911d5304","side":"right"},{"sibling":"a04392fb9f2a3a620840e3b3fecd93d12e6d224e481c162389d8ae64e7194599","side":"left"},{"sibling":"c300cf0154c136afc09b1702a0be98f4ba5b6dc5cf57e8cc714ec1eaf4196eff","side":"left"},{"sibling":"d841ad93efda0869e5eb97678f348f03f5caab4353e05ff4bf18f47fb945b822","side":"left"}]},"schema":"crovia.axiom_proof.v1","seal":{"first_collector_run_id":"","first_receipt_hash":"","jsonl_path":"/opt/crovia/substrate/axiom_ledger.jsonl","key_id":"430895f101d38164","last_collector_run_id":"","last_receipt_hash":"","leaf_count":234491,"merkle_root":"02576a6980e38bab47864ae2c57b5a5ff21e554e9bdf8f64bdf28155ff1aabec","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","run_id":"hourly_json_retrofit_20260618T143732Z","schema":"crovia.seal.v1","seal_family_version":"crovia-seal-family/1","seal_kind":"substrate_batch","sealed_at":"2026-06-18T18:33:39Z","sig_algorithm":"ed25519","signature":"b6c708778fc38b7789a2b91156cfe87252a7cd3a1d29121cba11a0c78f8cf104ca3019fc50a962fa5a216bcc4922fc8f3f69c04d1f8332c6dc0d931e1012e502","signer_version":"1.1.0"},"trust_root":{"key_id":"430895f101d38164","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","signature_algorithm":"ed25519","url":"/registry/canon/TRUST_ROOT.md"},"verifier":{"spec":"/registry/canon/AXIOM_RECEIPT_v1.md","url":"/v/axm_f9dbf3553c4052f4b7099ec6989313bfce967ce08f901a30a1298d65627c770a"}}