{"_canonicalization":{"envelope_id":"axm_ + sha256(envelope minus {signature, axiom_id, anchors})","envelope_signature":"ed25519(envelope minus {signature, axiom_id})","json":"sort_keys=True, separators=(',',':'), ensure_ascii=False, allow_nan=False, utf-8","leaf_hash":"sha256(0x00 || canonical_json(envelope_full))","seal_signature":"ed25519(seal minus {signature, sig_algorithm})"},"axiom_id":"axm_4ffbd208fa80a3b1022d19b89a6c5c73be3a6371894b58689bdc71068ca75233","bitcoin_anchor":{"bitcoin_attestations":[],"calendar_attestations":[],"ots_url":"","stamped_at":"","status":"pending_next_stamp"},"envelope":{"anchors":[{"chain":"crovia.axiom_graph","height":0,"merkle_proof":"spider_arxiv_retraction_v1","root_at_anchor":"spider_arxiv_retraction_v1"}],"axiom_id":"axm_4ffbd208fa80a3b1022d19b89a6c5c73be3a6371894b58689bdc71068ca75233","axiom_type":"AX.OBS","body":{"axiom_subtype":"research.arxiv_retraction.v1","category":"research","fingerprint":"399b0e8db16a505c864e4c75f98b75cbaee7c759b4c98d8e1e5aabcd23808ca7","published":"2026-05-25T15:57:11Z","receipt_hash":"399b0e8db16a505c864e4c75f98b75cbaee7c759b4c98d8e1e5aabcd23808ca7","schema":"spider.research.arxiv_retraction.v1","spider":"arxiv_retraction","spider_record":{"axiom_subtype":"research.arxiv_retraction.v1","category":"research","decision_hint":"POSITIVE","envelope_target":"AX.OBS","fingerprint":"399b0e8db16a505c864e4c75f98b75cbaee7c759b4c98d8e1e5aabcd23808ca7","observed_at":"2026-05-26T05:55:27.301455Z","parent_run_hash":"774723ff6e8502ea8d7743dbaebaaa57ad29068d115e9c3a61c8bccb56d23059","published":"2026-05-25T15:57:11Z","runtime_version":"0.1.0","schema":"spider.research.arxiv_retraction.v1","source_status":200,"source_url":"http://export.arxiv.org/api/query?search_query=cat:cs.CL+AND+%28abs:withdrawn+OR+abs:retracted%29&max_results=20&sortBy=submittedDate&sortOrder=descending","spider":"arxiv_retraction","summary_excerpt":"We document an empirical phenomenon in chain-of-thought and ReAct agents driven by ten large language models from seven architecture families: meaning-bearing perturbations (e.g., paraphrase, synonym) alter final answers more often than presentation perturbations (e.g., formatting, reordering) of comparable severity. Across 68 cells spanning GSM8K, MATH, and HotpotQA (1,530 originals and $\\sim$11,150 variants), the inconsistency gap averages +19.69 pp after severity matching (paired $t=9.58$, $p<0.0001$), with 64/68 cells positive. The gap survives four severity-proxy audits and remains significant when excluding qwen models (+11.10 pp, $p<0.0001$). Several stress tests fail honestly: cluster-bootstrap significance disappears under stricter assumptions, tractability contrasts do not replicate, cross-architecture generator swaps break per-cell rankings, and a second LLM judge yields only moderate agreement ($κ=0.50$).\n  We then validate the headline effect on a fully held-out 11th model","title":"When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation","url":"https://arxiv.org/pdf/2605.25981v1","vendor":"arxiv"},"summary":"We document an empirical phenomenon in chain-of-thought and ReAct agents driven by ten large language models from seven architecture families: meaning-bearing perturbations (e.g., paraphrase, synonym) alter final answers more often than presentation perturbations (e.g., formatting, reordering) of comparable severity. Across 68 cells spanning GSM8K, MATH, and HotpotQA (1,530 originals and $\\sim$11,150 variants), the inconsistency gap averages +19.69 pp after severity matching (paired $t=9.58$, $p<0.0001$), with 64/68 cells positive. The gap survives four severity-proxy audits and remains significant when excluding qwen models (+11.10 pp, $p<0.0001$). Several stress tests fail honestly: cluster-bootstrap significance disappears under stricter assumptions, tractability contrasts do not replicate, cross-architecture generator swaps break per-cell rankings, and a second LLM judge yields only moderate agreement ($κ=0.50$).\n  We then validate the headline effect on a fully held-out 11th model","title":"When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation","vendor":"arxiv"},"confidence":{"method":"deterministic"},"decision":"POSITIVE","issued_at":"2026-05-26T05:55:27Z","notes":"Spider arxiv_retraction (research) research.arxiv_retraction.v1","object":{"captured_by":"crovia.spider.arxiv_retraction","primary_source_url":"https://arxiv.org/pdf/2605.25981v1"},"predecessors":[],"schema":"crovia.axiom.v1","signature":"ed25519:220c142afbea20cf8ec24d31d3cd4f22240904381ba7f7ddb9e630c60cd3f22088da5c1637c07e8caf1dc85e3ff83bb9c49875c5614699103d9965b2342b8c04","signer":"crovia.substrate","subject":{"observed_at":"2026-05-26T05:55:27Z","source_collector":"spider:arxiv_retraction","target_id":"https://arxiv.org/pdf/2605.25981v1"},"tsa":{"authority":"crovia.substrate.bootstrap","rfc3161_token":"{\"kind\":\"crovia.bootstrap.tsa\",\"source_jsonl\":\"/opt/crovia/spider/data/research/arxiv_retraction_v1.jsonl\",\"source_seal_merkle_root\":\"spider_arxiv_retraction_v1\",\"upgrade_path\":\"Sessione H \\u2014 OpenTimestamps weekly anchor\"}"},"zk_mode":"clear","zk_proof":null},"ledger":{"leaf_hash":"2c12986c33d2f84eb08ff225c3b50dd7d2572484345688d6977a0d7ba43b7bac","leaf_index":152171,"ledger_path":"/opt/crovia/substrate/axiom_ledger.jsonl"},"merkle_proof":{"hash_alg":"sha256","leaf_prefix":"0x00","node_prefix":"0x01","odd_leaf_rule":"duplicate_last","path":[{"sibling":"524e117a4b5912e3fb6f31b14821040b6c174bc52057939d8b2f86aa6ee7e348","side":"left"},{"sibling":"239c3701fb800f7b301ad78ce7db667fba2a5949097733bedeca09a80ac35c89","side":"left"},{"sibling":"2b2828093008204d984561b09b6238d10eebfca9a0f7bd129f637f0fcb85cccf","side":"right"},{"sibling":"490a812fbc6c7c23fa00230cf3dcbc6b68fccdb3fe3b54fd145c0336e61de427","side":"left"},{"sibling":"4fba41d61c8d8708761616eefb6376e84a448e1fbf8bacfcfc35ca6981fcc8f3","side":"right"},{"sibling":"3ae67ee0b5ba19cab796fd334284d0a49f4e432b7e0e52c0db9540f2588e6063","side":"left"},{"sibling":"eb11c92e4a4f17a7ab4b5797b61bf680cfc32c34792ecc0c7a69f99d79556bc2","side":"left"},{"sibling":"1346514916fbffe9f59ff1fe4908bf4967525163a3b3a01da61a372e73a5b621","side":"right"},{"sibling":"8815b63dbf4702a48433626b44049125a4bfaa115fa17b31d4a90c08b9be003f","side":"right"},{"sibling":"1435608e9e331cae4942482d72391108a00c6a28651ab968464469512d4513b0","side":"left"},{"sibling":"b13528196373c5361f48ef4a2f8285bedd841f6283aa3c5f5e1b6b6c81156879","side":"right"},{"sibling":"72076d7a0ace30e6d34f1e7bc21854aabbbda51254d29d1b6c2e212e7539f9ca","side":"right"},{"sibling":"d415e6939aee710631f5062799379b547d2c3e3d9a68f263bbb5a693285ab2ca","side":"left"},{"sibling":"776ebef570c2a2ae0a8bad1b89043b8cd707ad1abd94577a22f2b39420961354","side":"right"},{"sibling":"35ca36cee447f0ef7064a25d55f59357c66901e31427729c4c1d8b14aa8adb6c","side":"left"},{"sibling":"24e5804c2040f9ba4fd9aac368479a52fd26f18623ae36e4d20c048d35143b74","side":"right"},{"sibling":"01c5cae5fa5cb6f437c160114f4b77c3fbed5775543742d252752bcfdfee3cb0","side":"right"},{"sibling":"d841ad93efda0869e5eb97678f348f03f5caab4353e05ff4bf18f47fb945b822","side":"left"}]},"schema":"crovia.axiom_proof.v1","seal":{"first_collector_run_id":"","first_receipt_hash":"","jsonl_path":"/opt/crovia/substrate/axiom_ledger.jsonl","key_id":"430895f101d38164","last_collector_run_id":"","last_receipt_hash":"","leaf_count":152223,"merkle_root":"18c3ae2a48d1f7f3d4357e0225ed003c2ece02f53fb2243fa958bdc68602d5c9","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","run_id":"hourly_json_retrofit_20260526T063701Z","schema":"crovia.seal.v1","seal_family_version":"crovia-seal-family/1","seal_kind":"substrate_batch","sealed_at":"2026-05-26T06:37:34Z","sig_algorithm":"ed25519","signature":"0360ff0e49161bad01efa5b6ce484ad6f5c35131d61076912961411da8c94b3aa3fb80a10ede29ff09bf6fcbc5712fee9d175d2336e99fdaa3d1fa99e938880e","signer_version":"1.1.0"},"trust_root":{"key_id":"430895f101d38164","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","signature_algorithm":"ed25519","url":"/registry/canon/TRUST_ROOT.md"},"verifier":{"spec":"/registry/canon/AXIOM_RECEIPT_v1.md","url":"/v/axm_4ffbd208fa80a3b1022d19b89a6c5c73be3a6371894b58689bdc71068ca75233"}}