{"as_of":"2026-07-23T02:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13eab4f746f5056b76d578c8cfbf9c1b469b332545cf70debb9c308e5f188d14","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:43:50.317854Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-20T06:30:07.809122+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.10325/citation-record","integrity":"/paper/2605.10325/integrity","json":"/paper/2605.10325/citation-record.json","paper":"/paper/2605.10325"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-07-06T16:30:00.114521Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":"2310.05915","doi":"10.48550/arxiv.2310.05915","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Fireact: Toward language agent fine-tuning","venue":null,"work_id":"382904a8-a33f-42d0-ae77-b61c9f0cb7cb","year":2023},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:8ce9563707ba38dfb7541345e50f1dc8663df3648f2652ae86dd4929f2772d60","observation_id":"972a20b1-7617-496f-a8cf-7bf7c87c0396","resolution":{"observed_at":"2026-06-30T22:45:07.256818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:e9b7eddd4abe6bda33d8931486cc126ae6da64df5c3a824dc2b81f9e78822732","observation_id":"28d68363-e075-400d-88e4-1dd15db9bf91","resolution":{"observed_at":"2026-06-30T22:45:07.246790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.124626Z","title":"CRITIC: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":"2c804d3a-2e8c-4dfb-af2f-f0197c374a88","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:f5fc4536cce82c8b9e4c7c62c24cb2f86833223128ec9614050c48883b8b1ba0","observation_id":"e546cefc-06e5-4d26-b60f-afbd517f66e2","resolution":{"observed_at":"2026-07-07T13:03:52.127328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:0758755d86329231e1ab6bd03f8bcc0171d4461068743ee176706b240408b4f9","observation_id":"0578d6c8-30b5-4333-be70-fa8f205b23bd","resolution":{"observed_at":"2026-06-30T22:45:07.269804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.112890Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":"8c99894c-4dbe-4127-904b-303eed98fa8a","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:200be91cdbab2f928ce943311f8469454081c9beeee85a5550574e154a69e311","observation_id":"9bd9ee2b-67bb-489d-99bc-25fa4d7eb2de","resolution":{"observed_at":"2026-07-07T13:03:52.115481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:2386fa073173eaf2f655a3499b7d5965b539a338389fef9b4c9e72cb0d46f982","observation_id":"f3b3a2cc-5b4c-4840-a644-0bbb4c94a836","resolution":{"observed_at":"2026-06-30T22:45:07.243977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.116692Z","title":"SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations","venue":null,"work_id":"347e996a-7396-4a6f-910b-b87cfa000ff4","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:652528ae8abbbad11f7850870128c77a6d62d3375c16d012c7217ba623c010bd","observation_id":"ad3f1f7f-e76b-48ac-a87e-108d179f4c3e","resolution":{"observed_at":"2026-07-07T13:03:52.119571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:10.255025Z","title":"Littman, and Anthony R","venue":null,"work_id":"f1f432ca-2afb-4700-8f7a-7b0846a4cb14","year":1998},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:a9006b95c99c484c11101419b2ed288e274b6ac48327db373897ef80e8c75c7a","observation_id":"c9c4ef3c-4e1f-4886-abe7-33530a1846b1","resolution":{"observed_at":"2026-07-07T13:03:52.219129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.105611Z","title":"VinePPO: Refining credit assignment in RL training of LLMs","venue":null,"work_id":"12b08b6c-03ca-47c8-a3a8-e99bc918313a","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:03d8c5d2ed190ac856da5b47c4f4333c7676d9a9d92d757ed098041baace52e1","observation_id":"1ac6339c-a008-457a-a54f-8270183a8e05","resolution":{"observed_at":"2026-07-07T13:03:52.108491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:f644a91ce4bb8ca6e0ddefff6a65061b9fa9011b79cb871f30d97e445d084d2f","observation_id":"1f334c22-9fa2-49d4-8436-06d1cf87f6b3","resolution":{"observed_at":"2026-06-30T22:45:07.263078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.100869Z","title":"Bandit based monte-carlo planning","venue":null,"work_id":"70dfd0c2-0a01-43b1-b473-012242d0bd9d","year":2006},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:09facd4d1b19b402021509ee4de18e7418e309983cb095522b5833df6328670d","observation_id":"48607731-3857-44a2-aad5-3f6dc362677d","resolution":{"observed_at":"2026-07-07T13:03:52.104264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.262844Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"ba38df18-25de-4771-8903-3ff55d99b09f","year":2023},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:b8e8a1940e3e98921cbd9ed7c15f63c12bc648edad9b808252820e9a2ea733e7","observation_id":"7499655f-d83c-445a-80a0-b00424c110d9","resolution":{"observed_at":"2026-07-07T13:03:52.137430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09453","last_updated":"2020-09-26T11:49:05Z","snapshot_observed_at":"2026-07-06T08:16:42.834645Z","submitted_at":"2019-08-26T03:31:35Z","title":"OpenSpiel: A Framework for Reinforcement Learning in Games","version":6},"cited_work":{"arxiv_id":"1908.09453","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.09453","snapshot_observed_at":"2026-07-10T00:26:39.228894Z","title":"Openspiel: A frame- work for reinforcement learning in games.arXiv preprint arXiv:1908.09453","venue":"cs.LG","work_id":"7e3695db-6fc9-47fc-9203-6c5fa3753bbc","year":2019},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/1908.09453","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:a7f883de67beaeb5cffe17a357700ef702b9792516445252a199548763a13fca","observation_id":"37361511-ef60-42b5-9dc2-65234ef55cdc","resolution":{"observed_at":"2026-06-30T22:45:07.249837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.143513Z","title":"Coderl: Mastering code generation through pretrained models and deep reinforcement learning","venue":null,"work_id":"11068114-1ecb-4aba-a024-e68e50c1606a","year":2022},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:a498cba39561237b11905bfafbef26c0e95d3d6ae21912e97b956585c91dfbd5","observation_id":"1b23542e-f6f7-4d4d-a8a2-95aa2dc6d2dc","resolution":{"observed_at":"2026-07-07T13:03:52.145041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.159615Z","title":"Let’s verify step by step","venue":null,"work_id":"a397ef24-d69f-49d7-b1c2-fbc2c8580c7f","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:e2ae4ad10513261b9c0b299c963bd381acddded6587fbecc930631cecc43ad8e","observation_id":"99e1009a-9757-4cf1-8b13-537693c5b201","resolution":{"observed_at":"2026-07-07T13:03:52.161180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.175386Z","title":"Agentbench: Evaluating LLMs as agents","venue":null,"work_id":"cc59b69d-72d6-45b8-9dbb-7379dbedf823","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:80761f866a721b22514ace4a97cd1e6fb65f929f7b140f9ae1c581b233ab97e4","observation_id":"ce3f39f1-ec20-45d7-adb8-d4d2b9e11748","resolution":{"observed_at":"2026-07-07T13:03:52.176836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01051","doi":"10.48550/arxiv.2510.01051","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Gem: A gym for agentic llms.arXiv preprint arXiv:2510.01051","venue":null,"work_id":"e12ecb7e-2fe1-475c-8f0a-5fd442b7e2ca","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:4eb272d6da822b6781dfed4d44b9d815b26aaa301183ff7835b67faadae33f67","observation_id":"ff74810b-a1f4-406c-9f32-d6be32d99f45","resolution":{"observed_at":"2026-06-30T22:45:07.253248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.569068Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"b38e9744-98cb-4abf-96a7-ae72898291e9","year":2022},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:c2fd3771b8527700313b686d15ec40f8478c7d7b8dd7834b15efe30105b9e2e5","observation_id":"c2c685dc-5c88-407c-ab7e-6141e561e43f","resolution":{"observed_at":"2026-07-07T13:03:52.179603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.141198Z","title":"Logic-LM: Empowering large language models with symbolic solvers for faithful logical reasoning","venue":null,"work_id":"0a7b766d-56b6-4db2-a99d-f8044f0ec4c3","year":2023},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:7793191d6fb50cca93a29199eeb0f5dcf8b19799e697a3339bea456b9679fa91","observation_id":"cc81527e-5ff7-467d-b742-b7951f43d538","resolution":{"observed_at":"2026-07-07T13:03:52.142765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-07-11T03:17:52.238641Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:faeeff4f5ac1d57c4e829b1857b34e4775156dc5fbec6c9f61e492efc5123b59","observation_id":"b6cea56b-7668-4f1c-aa77-e1fe8d99785a","resolution":{"observed_at":"2026-06-30T22:45:07.259553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:07d453d397bc350cc10bcdc241523cfa64f1a0f1edb6aa298876066f49c4653a","observation_id":"860a9b7f-1d3e-44d1-b925-b0d02227742c","resolution":{"observed_at":"2026-06-30T22:45:07.273054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.170733Z","title":"Reflex- ion: language agents with verbal reinforcement learning","venue":null,"work_id":"abdd3134-4817-49a8-a1c1-e7f37b8bdbce","year":2023},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:a4cb8b6a16f2e223ae3f19a2cd08a1bbbed7f22c7194f66ac3b931fd1ae7936f","observation_id":"27722fbe-39b1-419d-ab33-6360a2d6b010","resolution":{"observed_at":"2026-07-07T13:03:52.172414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-10T16:37:23.051852Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:7d31fc744a6b0c56365c93fdc3cd840dcad930151f98e61621394f55b5ca3c08","observation_id":"a1c5e64e-bf48-4087-b923-ba3600206eae","resolution":{"observed_at":"2026-06-30T22:45:07.236895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":"2010.03768","doi":"10.1109/cvpr.2001.990517","metadata_source":"pith","pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","venue":"cs.CL","work_id":"fa436f46-ec0a-4d2e-a0ff-e697def4a7be","year":2020},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:277d5b1b9f2e1534f4483bc659f2d40ff9470ba86cc5868b223dd33c4dabba6c","observation_id":"d696dc85-9849-4a0f-8910-d0fdaa5a94d7","resolution":{"observed_at":"2026-06-30T22:45:07.234587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.168395Z","title":"EvalScope: Evaluation framework for large models","venue":null,"work_id":"8b14a6c2-fd45-4dcb-a3d6-c66367b9255c","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:f4140dcbc28b967f0df3deb4298bfd653c777b54aae897b577a7b071bfe2a9a0","observation_id":"12e2a025-5abc-47cf-963b-0a10cc109017","resolution":{"observed_at":"2026-07-07T13:03:52.170042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-07-06T14:23:08.001823Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:6bf35f429370ef442ca3f602aeacdea13aa8a4d92c14f03e1c984a1137a27bfb","observation_id":"de50c423-a368-4788-aa9d-68ae1ffd5e88","resolution":{"observed_at":"2026-06-30T22:45:07.239253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:33.958459Z","title":"A survey on large language model based autonomous agents.Frontiers of Computer Science, 18(6):186345","venue":null,"work_id":"22d0f278-0f8d-4a9a-941a-1a0feef5523b","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:da985ea678e72a7cd7dc8d3c81d95ec5a71f157e3e610b3bf461ac80a681b846","observation_id":"c6b170ee-9ce5-4b2e-b329-20517261f681","resolution":{"observed_at":"2026-07-07T13:03:52.174679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.180492Z","title":"Math-shepherd: Verify and reinforce LLMs step-by-step without human annotations","venue":null,"work_id":"7eb1f480-c83d-4c3a-b30d-43cc2a521ba3","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:affdc4692cc769d58c99920ea4cb4501996720d277b4171f82b8668b66bf2650","observation_id":"bc9d67fa-b83c-4b52-8db2-ef3edbb56927","resolution":{"observed_at":"2026-07-07T13:03:52.182578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-07-06T21:37:56.477028Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:1e65edf1d103ba8e31602632448a624926ac4312a61560bbb8a7ce796c78da9a","observation_id":"b1f48d73-be66-4a87-b2f0-3d1e3bde7565","resolution":{"observed_at":"2026-06-30T22:45:07.266701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.186423Z","title":"what it can create, it may not understand","venue":null,"work_id":"8068c7f0-c1f7-474a-a90b-74895a7a8ac0","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:e27bfc427c1f21051af5cfdbac0769841e411a41b781a0db68b6f9ee217b3241","observation_id":"a978a41f-9ca9-4c56-a665-4e8af130be24","resolution":{"observed_at":"2026-07-07T13:03:52.188796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.192813Z","title":"The rise and potential of large language model based agents: A survey.Science China Information Sciences, 68(2):121101","venue":null,"work_id":"0475ea4e-1714-4dfc-9f63-eaaaf62716bf","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:32d15aacfc012ec536074bae2924046bc40f66c9a867154e11d16c688571f4af","observation_id":"d88c47ad-f4b6-4297-b7b0-52748047c7c9","resolution":{"observed_at":"2026-07-07T13:03:52.194378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.190108Z","title":"Vs-bench: Evaluating vlms for strategic reasoning and decision-making in multi- agent environments.coming soon","venue":null,"work_id":"a67a9b04-4967-4326-a9a5-d9f79b5f092b","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:82895ce35ac13fd54e06728e9176af94f3819ed9d49ca6f924555774a7d898a4","observation_id":"c9137a1d-e760-4b91-9f1e-fb266d219856","resolution":{"observed_at":"2026-07-07T13:03:52.192083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:89dc8088da216b47c3115ce94ce9132d2017ffba84ca1c9c692c3cb6778faa9e","observation_id":"76c406f7-fe8a-4efc-9a48-8fb3507f2d5b","resolution":{"observed_at":"2026-06-30T22:45:07.241651Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:36:22.367173Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents.Advances in Neural Information Processing Systems, 35:20744–20757","venue":null,"work_id":"084dea0a-7e9a-4848-922f-a5d43deed0a9","year":2022},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:2889218f87be5258b4aee0b79cfbcf5f7517588901f2aa46e610c0f19020a4cb","observation_id":"1f33ab50-0732-4a5f-a6af-3709d3937001","resolution":{"observed_at":"2026-07-07T13:03:52.158958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.161938Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"6e92da07-6133-43b2-8f56-2843fea58ee3","year":2023},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:71ae69b8f8c74f368a988c2daab6b658213eb0eaa4dc21991d1f9a5eae0095b2","observation_id":"65915e37-c966-4622-8875-90ebd5734ff7","resolution":{"observed_at":"2026-07-07T13:03:52.163459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:44:55.604657Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"a1666e19-dcbf-4fde-9fa5-616fe1568897","year":2023},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:f8f973c9c4549a4fe297a8f141272ef0695a748e289aed4439dece22390c25c7","observation_id":"13a0a50e-9b59-44bd-aa7a-8a8ec5a38efd","resolution":{"observed_at":"2026-07-07T13:03:52.165600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.152209Z","title":"OVM, outcome-supervised value models for planning in mathematical reasoning","venue":null,"work_id":"9c4f7f7a-6ee4-4bf3-8369-ffe0b5f30a51","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:afcc1a88993351a0cedfce1986dee759dd640c8ba7f84001c9dd8d86aaac759c","observation_id":"eb0901ef-55b0-4aec-b12f-e206e6b4f29a","resolution":{"observed_at":"2026-07-07T13:03:52.153866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.120782Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"cf32d6bf-97a7-4f37-9dcd-169d1fd3a087","year":2023},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:5f64c4634f7575fd2fc570fc5d4b3e59fc5f2eaef378e71b29cc4e8c032d8d40","observation_id":"c78e3567-40b2-4521-ba82-8d3e82868f0c","resolution":{"observed_at":"2026-07-07T13:03:52.123499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.138583Z","title":"Language agent tree search unifies reasoning, acting, and planning in language models","venue":null,"work_id":"42257aa9-ed50-4514-9da2-fb884186b7dd","year":2024},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:114b03bca1fc1ca781b0bb5c9f9da610b140e2c46ede8385acbff2338e65f2c7","observation_id":"2ae4d594-3b51-4d7f-9555-2932e38cecf3","resolution":{"observed_at":"2026-07-07T13:03:52.140444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.150010Z","title":"The grid is 0 - indexed , where (0 ,0) is the top - left corner and (2 ,2) is the bottom - right corner","venue":null,"work_id":"5747678a-8cc2-465d-8331-3be3e4117429","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:b1c27de91d3123164ef804004ff80708a639cb3da0bfe7a549c4bbe2557e12fe","observation_id":"f46590e2-3719-4ea3-b2a0-b07c4cf6a2f9","resolution":{"observed_at":"2026-07-07T13:03:52.151547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.128382Z","title":null,"venue":null,"work_id":"961cdfc6-61f8-4720-9192-79ce1db05da9","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:c33eb971b95b3394c381b79c9518713dae65fbf967a071c6a9deba0d24bca0cd","observation_id":"0ce9e46a-032d-4770-a71c-d20f812bb9df","resolution":{"observed_at":"2026-07-07T13:03:52.130514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.109697Z","title":null,"venue":null,"work_id":"2d45d7df-35e9-491e-b695-6543c2fa3aa7","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:9c71d210a70f75efe7e6934fea6f28c56a7b3a4268790840fe88b36bb344613c","observation_id":"91b1d822-857e-4bb8-a757-1fe97e4ac311","resolution":{"observed_at":"2026-07-07T13:03:52.111778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.154656Z","title":"PLAYER I N F O R M A T I O N","venue":null,"work_id":"b2ca7fc4-adb0-4298-8f61-8d1788722967","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:e73100c6365d04c22a01248e7fb4d2e6ae597eacdd6ac5a0bed70e5864fd5d5e","observation_id":"299c8de3-d4dd-48d9-87ac-adabb2f8f2bb","resolution":{"observed_at":"2026-07-07T13:03:52.156290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.221384Z","title":"You are c om pe ti ng with another player c o n t r o l l i n g the mark O","venue":null,"work_id":"1974d6f8-2d4e-452d-83fc-30c000a7cd7a","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:fb47c9aebaa400e446e4e585c10241282d2af60bdc040413fb94ca5b30c7e178","observation_id":"22705732-7545-4157-8efe-22b2bd4a6bd1","resolution":{"observed_at":"2026-07-07T13:03:52.222635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.145788Z","title":"The game state d e m o n s t r a t e s the current board with a three - line text grid , where ’X ’ and ’O ’ are the marks of the two players , and ’","venue":null,"work_id":"01521cb5-cdfc-4c27-8cea-b4fb63d04077","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:a4e4990bf520e57b428ea20d9cce77a80938068ecbbf43b0a6cc5980f25221de","observation_id":"87153c57-244c-423a-9fa0-19b30cbc9c60","resolution":{"observed_at":"2026-07-07T13:03:52.147396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.131592Z","title":"Rows and columns are 1 - indexed (1 to 9)","venue":null,"work_id":"669cd8e8-7062-443d-8f6e-b88eff20b19c","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:094462269655de1ba949f87787906e7ce1057a6fad48ce03c97666b2077f3477","observation_id":"6bc4715f-fc38-4962-9f11-ce678fc76882","resolution":{"observed_at":"2026-07-07T13:03:52.133760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.148086Z","title":null,"venue":null,"work_id":"11ed8b2e-43ac-4162-aac8-1a13421a475c","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:4803db176dafdfb9334624272a4da2b4e313396c72c6ca75b77ddda02ccfc9fb","observation_id":"ffec39ca-ed84-4bff-b097-bd16002841e5","resolution":{"observed_at":"2026-07-07T13:03:52.149370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.166356Z","title":null,"venue":null,"work_id":"58ada4eb-79c2-45fc-b17a-ba0a6b5972ef","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:f2169dc908e98087282771c4a790453aa4fe02e5f60974b86fd5be5329fcf83e","observation_id":"671aafb7-5934-460d-bf5b-b6ce5a2b3f90","resolution":{"observed_at":"2026-07-07T13:03:52.167691Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.183529Z","title":null,"venue":null,"work_id":"2fd570cc-251a-43c7-bfa0-f40ec863eac4","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:98688657e88ae680ce68899165858b1650370bab330e3d6c960abe6a85e00fb4","observation_id":"0cd13fc0-f01c-4fea-bf97-38f37693580c","resolution":{"observed_at":"2026-07-07T13:03:52.185373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.215092Z","title":null,"venue":null,"work_id":"d502e7c4-ce2e-4e5a-a9b0-5b2987a88272","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:c661b3bc434ae58fa0c697422ceac42b719fa526ec81e79f1d19df9a9cded30f","observation_id":"5b8359b3-3656-473a-81e2-26cb0d330c6a","resolution":{"observed_at":"2026-07-07T13:03:52.216936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.219690Z","title":"PLAYER I N F O R M A T I O N","venue":null,"work_id":"dcd07693-6968-44d3-b382-2e4aea07961a","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:4971b36f6fbc7f2081dd81cee463691be5593006bdcdf831429e456e5837735e","observation_id":"a25f6b78-159d-4aeb-b3fc-496acc6eb1c2","resolution":{"observed_at":"2026-07-07T13:03:52.220818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.223208Z","title":null,"venue":null,"work_id":"f09591f2-8e26-4f12-b332-d58d5c258549","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:f24ae0212c50a15dcbdb80ddcef4814190c3a636fcd7e86bd09e61b2109bc64e","observation_id":"9c06e445-60bd-4d07-b323-40762c49d60b","resolution":{"observed_at":"2026-07-07T13:03:52.224549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.206401Z","title":null,"venue":null,"work_id":"6a994fbd-c25f-469d-ab66-3d2db4bc7f90","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:5e55617768bee93d3477d2aa3ebab52b638297fd687377a8c83ba119d4935faf","observation_id":"46264534-104e-4cd0-9246-5be36e95240f","resolution":{"observed_at":"2026-07-07T13:03:52.207797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.204492Z","title":null,"venue":null,"work_id":"f5a8037d-0d7d-454b-b02a-54776be484a6","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:02522be055fe7e71fd3efe169b9f2d0dd483c72390f6c0daf6ee098a94db6446","observation_id":"506bcb24-3c28-4919-9495-b2670963201c","resolution":{"observed_at":"2026-07-07T13:03:52.205754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.208457Z","title":"The grid contains exactly 5 hidden mines","venue":null,"work_id":"cededd78-6ea5-4409-b368-403d66f6a7d6","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:8748990295e06207292130a0c3ef53ff344d60a05087e5aa7f08448ce5008813","observation_id":"deca4e3b-fde5-4b4f-b026-2dac68379439","resolution":{"observed_at":"2026-07-07T13:03:52.209812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.210462Z","title":null,"venue":null,"work_id":"ec1faf52-7a7a-41be-a0ff-3e97a16cf5a0","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:cde855ecb50c6327e6d6cd0c079358da469d052d2fb29ceae988663a1b1cc76f","observation_id":"33fa1e48-eb83-4eeb-ae84-c404ca20dc7c","resolution":{"observed_at":"2026-07-07T13:03:52.211987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.202642Z","title":null,"venue":null,"work_id":"174dad84-27e0-4da8-8327-31e25d130948","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:c739c04338deaf0700a259bb768604da67767616c51d8cec5188ff029bbf4c5f","observation_id":"1f36f8ef-83d9-429a-a01c-ddceb9e8be29","resolution":{"observed_at":"2026-07-07T13:03:52.203883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.197001Z","title":null,"venue":null,"work_id":"418f526c-cbbd-458f-9540-415f7e500d45","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:9a39351bd8146f33f7e46b2193f2904fc19e2b396e3bd870aaeb8d1941f980f0","observation_id":"62122df2-ee61-45eb-beb4-c7c71ea240ca","resolution":{"observed_at":"2026-07-07T13:03:52.198227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.195043Z","title":"PLAYER I N F O R M A T I O N","venue":null,"work_id":"a37de194-a508-430e-9457-fda773af2ce4","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:fe2db46e8998054a6bf297328d91bacac6f1e6f88fe1ce82e9e4608ea5d61c40","observation_id":"090c2d4e-10bd-4110-b158-f7634604edd6","resolution":{"observed_at":"2026-07-07T13:03:52.196374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.198856Z","title":"’ r e p r e s e n t s an u n r e v e a l e d cell","venue":null,"work_id":"a819b0db-9ad9-4a37-ba62-01529c6e7cb9","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:b2102a5ca1c8cc500daeb1a65f7dea34ef51a21b4968219f62705e4f0cb98f09","observation_id":"c4f69ac0-3796-4f9a-af88-970be55f2783","resolution":{"observed_at":"2026-07-07T13:03:52.200141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.200792Z","title":null,"venue":null,"work_id":"625bed31-c7dc-40ad-a165-6776745158e1","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:7bc1ae698a96fbf534404673d114d3b00f3d1a3240f48cc2874505e048b08ad4","observation_id":"d636f102-1bb3-4f90-b4dd-ee92339b4063","resolution":{"observed_at":"2026-07-07T13:03:52.202028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.212682Z","title":"The ’ flag ’ command acts as a toggle : play it on an un fl agg ed cell to place a flag , or on a flagged cell to remove it","venue":null,"work_id":"8232be40-20f2-487a-9b4e-20cc399e9095","year":null},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:f288cdf30053359e7130f64db33d62cc7fba811ec4f894afb5b1429327c9d77f","observation_id":"7cc632f8-63b5-47e0-9d54-efa62b7f0c06","resolution":{"observed_at":"2026-07-07T13:03:52.214159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-20T06:30:07.809122+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":14,"verified_fuzzy":35},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-20T06:30:07.809122+00:00","source":"crossref"},{"observed_at":"2026-07-20T06:30:01.33724+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2605.10325."}