{"_canonicalization":{"envelope_id":"axm_ + sha256(envelope minus {signature, axiom_id, anchors})","envelope_signature":"ed25519(envelope minus {signature, axiom_id})","json":"sort_keys=True, separators=(',',':'), ensure_ascii=False, allow_nan=False, utf-8","leaf_hash":"sha256(0x00 || canonical_json(envelope_full))","seal_signature":"ed25519(seal minus {signature, sig_algorithm})"},"axiom_id":"axm_bbe5bdd5a2abb813689ecb4689e842695cc7dc2511921932d53c7244132d8b17","bitcoin_anchor":{"bitcoin_attestations":[],"calendar_attestations":[],"ots_url":"","stamped_at":"","status":"pending_next_stamp"},"envelope":{"anchors":[{"chain":"crovia.axiom_graph","height":0,"merkle_proof":"spider_vendor_press_v1","root_at_anchor":"spider_vendor_press_v1"}],"axiom_id":"axm_bbe5bdd5a2abb813689ecb4689e842695cc7dc2511921932d53c7244132d8b17","axiom_type":"AX.OBS","body":{"axiom_subtype":"news.vendor_press.v1","category":"news","fingerprint":"c2157e40ce62a7c2ef63db5ed44d7c32f91d00b0a200f45c37fc285f18591e74","published":"Tue, 02 Jun 2026 00:00:00 -0400","receipt_hash":"c2157e40ce62a7c2ef63db5ed44d7c32f91d00b0a200f45c37fc285f18591e74","schema":"spider.news.vendor_press.v1","spider":"vendor_press","spider_record":{"axiom_subtype":"news.vendor_press.v1","category":"news","decision_hint":"POSITIVE","envelope_target":"AX.OBS","fingerprint":"c2157e40ce62a7c2ef63db5ed44d7c32f91d00b0a200f45c37fc285f18591e74","observed_at":"2026-06-02T04:43:38.825628Z","parent_run_hash":"c2a9665c814770d56765bb764e6a6c7e4fa7d4e9708e157ca0f7440c89927d54","published":"Tue, 02 Jun 2026 00:00:00 -0400","runtime_version":"0.1.0","schema":"spider.news.vendor_press.v1","source_status":200,"source_url":"https://export.arxiv.org/rss/cs.AI","spider":"vendor_press","summary_excerpt":"arXiv:2510.01167v2 Announce Type: replace-cross \nAbstract: Aligning large language models to human preferences is inherently multidimensional, yet most pipelines collapse heterogeneous signals into a single objective. We seek to answer what it would take to simultaneously align a model across various domains spanning those with: verifiable rewards, non-verifiable subjective preferences, and complex interactive scenarios. Such multi-objective alignment setups are often plagued by individual objectives being at odds with each other, resulting in inefficient training and limited user control during inference. To address these issues, we propose $\\textbf{M}$ulti-$\\textbf{A}$ction-$\\textbf{H}$ead $\\textbf{AL}$ignment with PRM-guided Dec$\\textbf{O}$ding ($\\textbf{MAHALO}$), a unified framework that standardizes PRM training across verifiable and non-verifiable settings for step-level supervision, performs vectorized multi-objective alignment with Multi-Action-Head DPO, and enables controllab","title":"Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards","url":"https://arxiv.org/abs/2510.01167","vendor":"arxiv_cs_ai"},"summary":"arXiv:2510.01167v2 Announce Type: replace-cross \nAbstract: Aligning large language models to human preferences is inherently multidimensional, yet most pipelines collapse heterogeneous signals into a single objective. We seek to answer what it would take to simultaneously align a model across various domains spanning those with: verifiable rewards, non-verifiable subjective preferences, and complex interactive scenarios. Such multi-objective alignment setups are often plagued by individual objectives being at odds with each other, resulting in inefficient training and limited user control during inference. To address these issues, we propose $\\textbf{M}$ulti-$\\textbf{A}$ction-$\\textbf{H}$ead $\\textbf{AL}$ignment with PRM-guided Dec$\\textbf{O}$ding ($\\textbf{MAHALO}$), a unified framework that standardizes PRM training across verifiable and non-verifiable settings for step-level supervision, performs vectorized multi-objective alignment with Multi-Action-Head DPO, and enables controllab","title":"Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards","vendor":"arxiv_cs_ai"},"confidence":{"method":"deterministic"},"decision":"POSITIVE","issued_at":"2026-06-02T04:43:38Z","notes":"Spider vendor_press (news) news.vendor_press.v1","object":{"captured_by":"crovia.spider.vendor_press","primary_source_url":"https://arxiv.org/abs/2510.01167"},"predecessors":[],"schema":"crovia.axiom.v1","signature":"ed25519:2e6beae90f759a3cc05f7300fd3c7ca0c77b032782caadad8c7fcc97a63c0c87d2d179578514c66b4c56d3f83236ff7408b7d5209cf2f484b7e6d1fefe686f0e","signer":"crovia.substrate","subject":{"observed_at":"2026-06-02T04:43:38Z","source_collector":"spider:vendor_press","target_id":"https://arxiv.org/abs/2510.01167"},"tsa":{"authority":"crovia.substrate.bootstrap","rfc3161_token":"{\"kind\":\"crovia.bootstrap.tsa\",\"source_jsonl\":\"/opt/crovia/spider/data/news/vendor_press_v1.jsonl\",\"source_seal_merkle_root\":\"spider_vendor_press_v1\",\"upgrade_path\":\"Sessione H \\u2014 OpenTimestamps weekly anchor\"}"},"zk_mode":"clear","zk_proof":null},"ledger":{"leaf_hash":"1965c42ae01ff0464a0c1a824ba013f52c9a341a2b54220dca74e9dde0d7c40d","leaf_index":205881,"ledger_path":"/opt/crovia/substrate/axiom_ledger.jsonl"},"merkle_proof":{"hash_alg":"sha256","leaf_prefix":"0x00","node_prefix":"0x01","odd_leaf_rule":"duplicate_last","path":[{"sibling":"13f76b13437153e9aa77a0d60a50125890a84c139d57bf327342133e5b79c8a1","side":"left"},{"sibling":"b01bb9c959767ed40438ca053defcfd0a976f8d1be30115177c7a3c6526c3df4","side":"right"},{"sibling":"d01a79d0654e5058745dfb179c00382b5e7658a5e4c06413acbf7487bcb7f4c0","side":"right"},{"sibling":"2686f86ebb199d0f51b788c1f9df228395c03905dbd11566f7bc622571acfee8","side":"left"},{"sibling":"3355ecacc0a456e52c93bd558647ae15817f0949b78c296593da85f4e467b62c","side":"left"},{"sibling":"4f16de82ab0db0ac5454af010b59885c3266df92e72c858a67542f343f45793c","side":"left"},{"sibling":"c67e085a85c0f23aa2cb50fd322074122571e52743812cc3860e76bbffd3a91b","side":"right"},{"sibling":"a5c0411da65d36a27f4e797deeace23f77314552708425e4e91c3ebf671bc23b","side":"right"},{"sibling":"6ac554ede1f78dc3a28ebe5e1155c2b9c258b71805fdd7ad2ec992697f3ccd0c","side":"right"},{"sibling":"5e1949edfad76bc6a73d008dc8be8a0c6fe4a7fb64c8beaf70e5023ca11d35e0","side":"right"},{"sibling":"e4bd1aaaf3f336d9b072b4d1fc234246fc3cf2874ca873b7741c03eaf97911f2","side":"left"},{"sibling":"e6adead8216db4cae92f0a036d53baebf30eed95a99c0d10758aa75bb7780f2f","side":"right"},{"sibling":"1acc2b7ff453ffd8c97b80ae4db5358780f0c6796874fd75403791dbe99f8cd7","side":"right"},{"sibling":"24d1bb4b13e0e46131b27b70a48e65fcf4e2e14b95e3bb83ade821e9df530f6b","side":"left"},{"sibling":"5f86f58c28b1a86ae06dfff4666bb9fba8866021a81fd4f1d200aa9af4722dfb","side":"right"},{"sibling":"f6cc6f94f6944ae21390afc65ac9e91dc31f84ee6e060681bba5ae08058294bd","side":"right"},{"sibling":"c300cf0154c136afc09b1702a0be98f4ba5b6dc5cf57e8cc714ec1eaf4196eff","side":"left"},{"sibling":"d841ad93efda0869e5eb97678f348f03f5caab4353e05ff4bf18f47fb945b822","side":"left"}]},"schema":"crovia.axiom_proof.v1","seal":{"first_collector_run_id":"","first_receipt_hash":"","jsonl_path":"/opt/crovia/substrate/axiom_ledger.jsonl","key_id":"430895f101d38164","last_collector_run_id":"","last_receipt_hash":"","leaf_count":206226,"merkle_root":"d2a6d32b13cbf343fb143b21a756d0533864ae6577a376ee84ba867b949207ec","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","run_id":"hourly_json_retrofit_20260602T053701Z","schema":"crovia.seal.v1","seal_family_version":"crovia-seal-family/1","seal_kind":"substrate_batch","sealed_at":"2026-06-02T05:37:46Z","sig_algorithm":"ed25519","signature":"abd9956cfb19dd1fb8142c46a220bac2514848c6abb0e79b8b0940206cc3ebb00894d4daaf9f786427f82a7cc12482e7fda79054ebb06bceaa9b4b97e23fb30e","signer_version":"1.1.0"},"trust_root":{"key_id":"430895f101d38164","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","signature_algorithm":"ed25519","url":"/registry/canon/TRUST_ROOT.md"},"verifier":{"spec":"/registry/canon/AXIOM_RECEIPT_v1.md","url":"/v/axm_bbe5bdd5a2abb813689ecb4689e842695cc7dc2511921932d53c7244132d8b17"}}