{"_canonicalization":{"envelope_id":"axm_ + sha256(envelope minus {signature, axiom_id, anchors})","envelope_signature":"ed25519(envelope minus {signature, axiom_id})","json":"sort_keys=True, separators=(',',':'), ensure_ascii=False, allow_nan=False, utf-8","leaf_hash":"sha256(0x00 || canonical_json(envelope_full))","seal_signature":"ed25519(seal minus {signature, sig_algorithm})"},"axiom_id":"axm_c74a3734dbee14644c486295e10345f6b775263523397ed4c95fb1703a3d80b8","bitcoin_anchor":{"bitcoin_attestations":[],"calendar_attestations":[],"ots_url":"","stamped_at":"","status":"pending_next_stamp"},"envelope":{"anchors":[{"chain":"crovia.axiom_graph","height":0,"merkle_proof":"spider_vendor_press_v1","root_at_anchor":"spider_vendor_press_v1"}],"axiom_id":"axm_c74a3734dbee14644c486295e10345f6b775263523397ed4c95fb1703a3d80b8","axiom_type":"AX.OBS","body":{"axiom_subtype":"news.vendor_press.v1","category":"news","fingerprint":"ffc1aff80a0a256068d98b4af5d7535c0e96f02f7e2486b8956e88f3e9c3af83","published":"Wed, 15 Jul 2026 00:00:00 -0400","receipt_hash":"ffc1aff80a0a256068d98b4af5d7535c0e96f02f7e2486b8956e88f3e9c3af83","schema":"spider.news.vendor_press.v1","spider":"vendor_press","spider_record":{"axiom_subtype":"news.vendor_press.v1","category":"news","decision_hint":"POSITIVE","envelope_target":"AX.OBS","fingerprint":"ffc1aff80a0a256068d98b4af5d7535c0e96f02f7e2486b8956e88f3e9c3af83","observed_at":"2026-07-15T04:44:03.592429Z","parent_run_hash":"d49a6cf532e74153266f377b7760fc948d950d80ed41fc3e3eb82b58f5597ead","published":"Wed, 15 Jul 2026 00:00:00 -0400","runtime_version":"0.1.0","schema":"spider.news.vendor_press.v1","source_status":200,"source_url":"https://export.arxiv.org/rss/cs.AI","spider":"vendor_press","summary_excerpt":"arXiv:2602.06486v4 Announce Type: replace \nAbstract: Evaluating agentic AI on open-ended professional tasks faces a fundamental dilemma between rigor and flexibility. Static rubrics provide rigorous, reproducible assessment but fail to accommodate diverse valid response strategies, while LLM-as-a-judge approaches adapt to individual responses yet suffer from instability and bias. Human experts address this dilemma by combining domain-grounded principles with dynamic, claim-level assessment. Inspired by this process, we propose JADE, a two-layer evaluation framework. Layer 1 encodes expert knowledge as a predefined set of evaluation skills, providing stable evaluation criteria. Layer 2 performs report-specific, claim-level evaluation to flexibly assess diverse reasoning strategies, with evidence-dependency gating to invalidate conclusions built on refuted claims. Experiments on BizBench show that JADE improves evaluation stability and reveals critical agent failure modes missed by holis","title":"JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks","url":"https://arxiv.org/abs/2602.06486","vendor":"arxiv_cs_ai"},"summary":"arXiv:2602.06486v4 Announce Type: replace \nAbstract: Evaluating agentic AI on open-ended professional tasks faces a fundamental dilemma between rigor and flexibility. Static rubrics provide rigorous, reproducible assessment but fail to accommodate diverse valid response strategies, while LLM-as-a-judge approaches adapt to individual responses yet suffer from instability and bias. Human experts address this dilemma by combining domain-grounded principles with dynamic, claim-level assessment. Inspired by this process, we propose JADE, a two-layer evaluation framework. Layer 1 encodes expert knowledge as a predefined set of evaluation skills, providing stable evaluation criteria. Layer 2 performs report-specific, claim-level evaluation to flexibly assess diverse reasoning strategies, with evidence-dependency gating to invalidate conclusions built on refuted claims. Experiments on BizBench show that JADE improves evaluation stability and reveals critical agent failure modes missed by holis","title":"JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks","vendor":"arxiv_cs_ai"},"confidence":{"method":"deterministic"},"decision":"POSITIVE","issued_at":"2026-07-15T04:44:03Z","notes":"Spider vendor_press (news) news.vendor_press.v1","object":{"captured_by":"crovia.spider.vendor_press","primary_source_url":"https://arxiv.org/abs/2602.06486"},"predecessors":[],"schema":"crovia.axiom.v1","signature":"ed25519:4b0765ef0773a2b233492984c45eec5084281e9ac1ed1a5bb48bece4e94ccb9d32732d27eb942121d3645877fece351b703389945f5b5860120f25e25160ad07","signer":"crovia.substrate","subject":{"observed_at":"2026-07-15T04:44:03Z","source_collector":"spider:vendor_press","target_id":"https://arxiv.org/abs/2602.06486"},"tsa":{"authority":"crovia.substrate.bootstrap","rfc3161_token":"{\"kind\":\"crovia.bootstrap.tsa\",\"source_jsonl\":\"/opt/crovia/spider/data/news/vendor_press_v1.jsonl\",\"source_seal_merkle_root\":\"spider_vendor_press_v1\",\"upgrade_path\":\"Sessione H \\u2014 OpenTimestamps weekly anchor\"}"},"zk_mode":"clear","zk_proof":null},"ledger":{"leaf_hash":"c2b94f729336cc4aeaaecbac71f9f87fd20626b3806deaebc8db9b29d5203010","leaf_index":316517,"ledger_path":"/opt/crovia/substrate/axiom_ledger.jsonl"},"merkle_proof":{"hash_alg":"sha256","leaf_prefix":"0x00","node_prefix":"0x01","odd_leaf_rule":"duplicate_last","path":[{"sibling":"a6d69e78bf8371f47fea061ac9176c42f5454572d095c4ee54da80009f006045","side":"left"},{"sibling":"4f2b40e78eb42e0ce29c547e932cf232175514b6566e00e5659036bbac788534","side":"right"},{"sibling":"bc157e95ba3443da906035d51b2edd1fddff6b97f9e8321b2db8e7aac548dc2e","side":"left"},{"sibling":"679d12cc33a7a1bfd8da3aea14b8d869b87db5f72a9affc2274651a37a258b54","side":"right"},{"sibling":"680cc4cfc7cb6e11983b6ea8a38ab6a2207595b10f77851c7cca741135cf70bd","side":"right"},{"sibling":"a55e053ed0f853dbd5bda892ebdc865a7e473ec1d21282c74b66d4b687bdcd81","side":"left"},{"sibling":"5436dbbae79dbce31676274ba50aef18052108604eec1fa3a36023d740b2cf09","side":"left"},{"sibling":"c07de1952926cdb34af34c5c0baaf9021a0ab704be6665431e37a7c145fca4d5","side":"right"},{"sibling":"1c7f1bf97993e3a126824f8350788b168c4c13264fb03a73b3ede312035d3527","side":"right"},{"sibling":"84a7590e6b24dd07ed46597f19deb75d9ad247b4227b17f30857ec7cc0fc5c21","side":"right"},{"sibling":"c8d3d8cb0183b912107f9781ad2a1b6c0c9424906c5907c09deeb5bea9d7b571","side":"left"},{"sibling":"0cb62c0ada57a2406a6bcb100889d3e8b29a15efeed07adaff5bb90a5e80612a","side":"right"},{"sibling":"0b69289b25462ddd6166f6f49004cfc8ada0ab4f10adafe188347817bdd46e37","side":"left"},{"sibling":"1418b281cd985b5ed411ef25f2017a1826cc14919b6fad3934e6ceeec693699b","side":"right"},{"sibling":"f302542c38ba7c3aab7c9280dd60259ecec777dca6e6f71b6f0729b0b8791b72","side":"left"},{"sibling":"d8b9143917b539c543cf4448cec00131f8b807bd8004979c54ebe09798748c66","side":"left"},{"sibling":"abe4a8c706e530484d1e96a8988cb09eab85928b2050985500ab289753fe3eec","side":"right"},{"sibling":"f436dccf82aa2c1eb7bfa3eb84316e116aaf64dc55cd9592597118f6cb0648f6","side":"right"},{"sibling":"1cecb7f447febd025aac272837c80de218aecc6485d2395a509b2a1f1b9c746e","side":"left"}]},"schema":"crovia.axiom_proof.v1","seal":{"first_collector_run_id":"","first_receipt_hash":"","jsonl_path":"/opt/crovia/substrate/axiom_ledger.jsonl","key_id":"430895f101d38164","last_collector_run_id":"","last_receipt_hash":"","leaf_count":316730,"merkle_root":"a8e6e5be81ea6f5b5f2227422459bf39455fe9f0b6602b4d1ce6977dbfd78bc7","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","run_id":"hourly_json_retrofit_20260715T053701Z","schema":"crovia.seal.v1","seal_family_version":"crovia-seal-family/1","seal_kind":"substrate_batch","sealed_at":"2026-07-15T05:38:24Z","sig_algorithm":"ed25519","signature":"df1678d268b5a07413e2ca6e748c3f40b6cfedea930a18d843489a4ab513da791bf0a886caab1b918d0989f8ebaaf3d0035ca2aa777913b1ad29979f1deb9a0c","signer_version":"1.1.0"},"trust_root":{"key_id":"430895f101d38164","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","signature_algorithm":"ed25519","url":"/registry/canon/TRUST_ROOT.md"},"verifier":{"spec":"/registry/canon/AXIOM_RECEIPT_v1.md","url":"/v/axm_c74a3734dbee14644c486295e10345f6b775263523397ed4c95fb1703a3d80b8"}}