{"_canonicalization":{"envelope_id":"axm_ + sha256(envelope minus {signature, axiom_id, anchors})","envelope_signature":"ed25519(envelope minus {signature, axiom_id})","json":"sort_keys=True, separators=(',',':'), ensure_ascii=False, allow_nan=False, utf-8","leaf_hash":"sha256(0x00 || canonical_json(envelope_full))","seal_signature":"ed25519(seal minus {signature, sig_algorithm})"},"axiom_id":"axm_379760b04beedbca77fbc629e0c034810097d74509460cd092d07d069aa5fafd","bitcoin_anchor":{"bitcoin_attestations":[],"calendar_attestations":[],"ots_url":"","stamped_at":"","status":"pending_next_stamp"},"envelope":{"anchors":[{"chain":"crovia.axiom_graph","height":0,"merkle_proof":"spider_vendor_press_v1","root_at_anchor":"spider_vendor_press_v1"}],"axiom_id":"axm_379760b04beedbca77fbc629e0c034810097d74509460cd092d07d069aa5fafd","axiom_type":"AX.OBS","body":{"axiom_subtype":"news.vendor_press.v1","category":"news","fingerprint":"2a9731c1ea7eaec46bfc84490718fb14f976142d1331055c665f2ae0155957be","published":"Tue, 26 May 2026 00:00:00 -0400","receipt_hash":"2a9731c1ea7eaec46bfc84490718fb14f976142d1331055c665f2ae0155957be","schema":"spider.news.vendor_press.v1","spider":"vendor_press","spider_record":{"axiom_subtype":"news.vendor_press.v1","category":"news","decision_hint":"POSITIVE","envelope_target":"AX.OBS","fingerprint":"2a9731c1ea7eaec46bfc84490718fb14f976142d1331055c665f2ae0155957be","observed_at":"2026-05-26T04:43:39.018238Z","parent_run_hash":"dca8dedd754ad6a1772113d6b97ee4f4ab9a0afbdeb44aaace5ff2d2446b164b","published":"Tue, 26 May 2026 00:00:00 -0400","runtime_version":"0.1.0","schema":"spider.news.vendor_press.v1","source_status":200,"source_url":"https://export.arxiv.org/rss/cs.AI","spider":"vendor_press","summary_excerpt":"arXiv:2605.23909v1 Announce Type: new \nAbstract: We investigate the calibration of large language models' (LLMs') confidence across diverse tasks. The results of our preregistered study show that the current crop of LLMs are, like people, too sure they are right: confidence exceeds accuracy, on average. Importantly, however, this tendency is moderated by a powerful hard-easy effect, wherein overconfidence is greatest on difficult tests; by contrast, easy tests actually show substantial underconfidence. We develop LifeEval, a test for evaluating model calibration across levels of difficulty.","title":"Confidence Calibration in Large Language Models","url":"https://arxiv.org/abs/2605.23909","vendor":"arxiv_cs_ai"},"summary":"arXiv:2605.23909v1 Announce Type: new \nAbstract: We investigate the calibration of large language models' (LLMs') confidence across diverse tasks. The results of our preregistered study show that the current crop of LLMs are, like people, too sure they are right: confidence exceeds accuracy, on average. Importantly, however, this tendency is moderated by a powerful hard-easy effect, wherein overconfidence is greatest on difficult tests; by contrast, easy tests actually show substantial underconfidence. We develop LifeEval, a test for evaluating model calibration across levels of difficulty.","title":"Confidence Calibration in Large Language Models","vendor":"arxiv_cs_ai"},"confidence":{"method":"deterministic"},"decision":"POSITIVE","issued_at":"2026-05-26T04:43:39Z","notes":"Spider vendor_press (news) news.vendor_press.v1","object":{"captured_by":"crovia.spider.vendor_press","primary_source_url":"https://arxiv.org/abs/2605.23909"},"predecessors":[],"schema":"crovia.axiom.v1","signature":"ed25519:8cb66609952ab32d864c9a2da9d5038908cdcb7dee37369eff3b2a7274cab0974b0a4017a69004bb30e9c4c859388ee7a257e3335098652aa4b539d30d87fa05","signer":"crovia.substrate","subject":{"observed_at":"2026-05-26T04:43:39Z","source_collector":"spider:vendor_press","target_id":"https://arxiv.org/abs/2605.23909"},"tsa":{"authority":"crovia.substrate.bootstrap","rfc3161_token":"{\"kind\":\"crovia.bootstrap.tsa\",\"source_jsonl\":\"/opt/crovia/spider/data/news/vendor_press_v1.jsonl\",\"source_seal_merkle_root\":\"spider_vendor_press_v1\",\"upgrade_path\":\"Sessione H \\u2014 OpenTimestamps weekly anchor\"}"},"zk_mode":"clear","zk_proof":null},"ledger":{"leaf_hash":"cb2176e268e1fa4786094caafdb3b1ec0e41989368a20834aca7d02fcbac7b15","leaf_index":151290,"ledger_path":"/opt/crovia/substrate/axiom_ledger.jsonl"},"merkle_proof":{"hash_alg":"sha256","leaf_prefix":"0x00","node_prefix":"0x01","odd_leaf_rule":"duplicate_last","path":[{"sibling":"fc4815afdfd973d521370f8988f0219e6b30eb4bc3b17edbe9c20be31c0dd88b","side":"right"},{"sibling":"4cfaa408a719890dbb1af89994ab689794a25d2f6e46b8d4a3e2330d184c5e76","side":"left"},{"sibling":"666cb6d23fd2b66c5689304b69cf7a21a62787a117b50db6a22fda0a579d73e9","side":"right"},{"sibling":"185cb3a75711bb435c82f81194136a698cba8857f8428b6d475de7787214cee9","side":"left"},{"sibling":"019da77640be925cb3adb4b6eb10b0f4ea39d30d78cb9947090b961383bae814","side":"left"},{"sibling":"3d47683e6d53d9691b5179f29ea6856c700b53d9cbfff85056f3caa551fbf578","side":"left"},{"sibling":"945e43a2372299c14fa9cb1e53ca097ea8884e9a7418a4c1a69ca85bc588b496","side":"left"},{"sibling":"545b6ad638a550e03c57dba5b3074ab1fa9d867d9833a42687c640578a909ad0","side":"left"},{"sibling":"a514c5f8e1b0cd1bdcfba1e9de7e64d35c095b9fc78839b02df66762b3ba8e89","side":"right"},{"sibling":"fdd22ebd87e5ba37d1153e47753a63818abb25df8fe45dbf735ba5c512c3355b","side":"left"},{"sibling":"cf593c482d17d202b94914915d0c65fb8713053548db64771d0ec5dbb404a07f","side":"left"},{"sibling":"134949308b15cffd6792ee2cf678119af34d69a64764d7c89cd47573c94e1cda","side":"left"},{"sibling":"e20a7391fed5b5f3b675af68344a3f5b050d6701e127b7db010af3941e59dfdb","side":"right"},{"sibling":"e5893793e3591ed7f5e58ca94ffcfba46bb30f69fb1c25d5ba8ef49eb99f9126","side":"right"},{"sibling":"35ca36cee447f0ef7064a25d55f59357c66901e31427729c4c1d8b14aa8adb6c","side":"left"},{"sibling":"e3eecaf996dbe7229a7bb1d234c97aea97a252c5f7c89f8547b6d091db0f0e40","side":"right"},{"sibling":"55bcbd4da3e20d93931f7e58673f10232e81a5b1514d7396cb4b71e8f95788d0","side":"right"},{"sibling":"d841ad93efda0869e5eb97678f348f03f5caab4353e05ff4bf18f47fb945b822","side":"left"}]},"schema":"crovia.axiom_proof.v1","seal":{"first_collector_run_id":"","first_receipt_hash":"","jsonl_path":"/opt/crovia/substrate/axiom_ledger.jsonl","key_id":"430895f101d38164","last_collector_run_id":"","last_receipt_hash":"","leaf_count":152106,"merkle_root":"ac5182c6f3dd09931f2a689df5f4be36df7b55e55bcf106e195671f5ed55fd8f","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","run_id":"hourly_json_retrofit_20260526T053701Z","schema":"crovia.seal.v1","seal_family_version":"crovia-seal-family/1","seal_kind":"substrate_batch","sealed_at":"2026-05-26T05:37:34Z","sig_algorithm":"ed25519","signature":"a401243fbd2c077d29a623c6ef616c78fbd5c8ce1930afa7af7165b2386e5a8cf15d5094983a1c962e71b27b911a3f3ce09c8cfab9393be2ce5ce8ee6513da06","signer_version":"1.1.0"},"trust_root":{"key_id":"430895f101d38164","public_key_hex":"cf742e26f75669dc673cb5c0786a1ae23ae8ca19c347317192ce40c28a7ff25c","signature_algorithm":"ed25519","url":"/registry/canon/TRUST_ROOT.md"},"verifier":{"spec":"/registry/canon/AXIOM_RECEIPT_v1.md","url":"/v/axm_379760b04beedbca77fbc629e0c034810097d74509460cd092d07d069aa5fafd"}}