DavidZWZ
Awesome-Deep-Research

[ACL 2026 KnowFM] Awesome Agentic Deep Research Resources

Last updated Aug 8, 2026
838
Stars
71
Forks
5
Issues
+5
Stars/day
Attention Score
90
Language breakdown
No language data available.
โ–ธ Files click to expand
README

๐Ÿค– Awesome Agentic Deep Research Resources

Awesome [arXiv]() [Maintenance]() [Contribution Welcome]() Code

Oryx Video-ChatGPT

Welcome to Awesome-Deep-Research! ๐Ÿš€ This repository serves as your comprehensive guide to the cutting-edge world of Agentic Deep Research. We've meticulously curated a collection of resources for you.

DeepResearch Framework

Whether you're a researcher, developer, or enthusiast, this repository is your gateway to exploring the fascinating intersection of artificial intelligence and autonomous agents. For a detailed analysis of the changing paradigm in information search, check out our position paper: From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents ๐Ÿ“„, which outlines existing domain trends and future directions. For researchers interested in the broader intersection of RAG and Reasoning, we also recommend exploring our comprehensive collection at Awesome-RAG-Reasoning ๐Ÿ”ฅ๐Ÿ”ฅ๐Ÿ”ฅ.

Table of Contents

Industry-Leading Products

  • Gemini Deep Research: Google's advanced research assistant for deep analysis (December 11, 2024)
  • Deep Research: OpenAI's deep research platform [[API Guide]](https://cookbook.openai.com/examples/deepresearchapi/introductiontodeepresearchapi) (February 2, 2025)
  • Perplexity Deep Research: Perplexity's product for in-depth research and analysis (February 14, 2025)
  • Grok Agents: xAI's autonomous DeepSearch agents powered by Grok-3 (February 19, 2025)
  • Copilot Researcher: Researcher and Analyst in Microsoft 365 Copilot (March 25, 2025)
  • Research: Anthropic's research platform to find and reason with information (April 15, 2025)
  • Manus: Advanced research and analysis platform (March 6, 2025)
  • ๐ŸฆŒ DeerFlow: ByteDance's research and analysis solution (May 9, 2025)
  • Deep Research: Alibaba's Qwen-powered research assistant (May 14, 2025)
  • Kimi-Researcher: Moonshot's research assistant powered by Kimi (June 20, 2025)
  • Not Human Search: Search engine for AI agents. Available as MCP server for tool discovery.
  • SearchHive: API platform for web scraping, search, and AI-powered deep research.

Open-Source Implementations

Latest Research Papers

๐Ÿ”ฅ๐Ÿ”ฅ๐Ÿ”ฅ This section showcases the most recent and impactful research papers in the field of Agentic Deep Research. Each paper represents a significant advancement in the development of autonomous research agents, search capabilities, and reasoning frameworks. The papers are organized chronologically, with the most recent publications at the top. Key areas covered include:

  • ๐Ÿค– Agentic frameworks for deep research
  • ๐Ÿ” Search-enhanced reasoning models
  • ๐ŸŒ Web agents for deep research
  • ๐Ÿ”„ Reasoning and retrieval-augmented generation
  • ๐Ÿ“Š Multimodal deep research
๐Ÿš€๐Ÿš€๐Ÿš€ Stay tuned for the hottest breakthroughs in the field!

| Title | Date & Code | Base model | Optimization | Search Engine | Agent Architecture | Training Dataset | Evaluation Dataset | | --- | :---: | --- | --- | --- | --- | --- | --- | | STAMP: Provenance-Guided Credit Assignment for Deep Search Agents | [2026/07/13]() | Qwen3-30B-A3B-Thinking-2507 | SFT, GRPO | Web Search | Single-Agent | Synthesized bilingual Wikipedia QA (3K SFT, 2.6K RL) | BrowseComp, BrowseComp-ZH, xbench-DS | | WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search | 2026/07/09 GitHub stars | GLM-4.5, Qwen3-32B, Qwen3.5-35B, Kimi-K2-Thinking | Prompting | Web Search, Local Retrieval | Multi-Agent | โ€“ | BrowseComp-Plus, WideSearch, DeepWideSearch, GISA | | DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment | 2026/07/08 | Qwen3.5-9B-Instruct | SFT (self-distillation), GRPO | Web Search, Local Retrieval | Single-Agent | DeepSearch-World (420K multi-hop Wikipedia QA) | BrowseComp, BrowseComp-ZH, HLE, GAIA, xbench, HotpotQA, SearchQA, DeepSearch-Val | | VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning | 2026/07/03 GitHub stars | Qwen3-VL-8B-Instruct | SFT, BiSPO | Web Search | Single-Agent | FVQA, DeepEyes, DeepEyesV2 | VideoSearch-QA, VideoDR, MMSearch, HR-MMSearch, FVQA, InfoSeek, SimpleVQA, LiveVQA, MMVU, TempCompass, VideoMMMU, VideoMathQA | | Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent | 2026/06/29 GitHub stars | Qwen3.5-35B-A3B | SFT, GRPO, On-Policy Distillation | Web Search | Single-Agent | MLE-Dojo, Kaggle, Nemotron | SEAL-0, IFBench, BrowseComp, GAIA, SciCode, MLE-Bench-Lite, HLE, HiPhO, FrontierScience-Olympiad, LongBench V2, IFEval, ฯ„ยฒ-Bench, VitaBench, MatTools, MolBench-Bind | | Rยฒ-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search | 2026/06/26 GitHub stars | Qwen2.5-3B-Base, Qwen2.5-7B, Qwen3-4B | SFT, RL (RยฒPO) | Local Retrieval | Single-Agent | HotpotQA, NQ | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle | | ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep Research | [2026/06/18]() | Qwen3-32B, DeepSeek-V3.2 | Prompting | Web Search | Multi-Agent | โ€“ | DeepResearch Bench, DeepResearch Gym | | DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents | 2026/06/15 | Qwen3-8B | SFT, GRPO | Web Search, Local Retrieval | Single-Agent | DeepRubric (9K query-rubric pairs), Wikipedia, OpenScholar | AstaBench-ScholarQA-CS2, ResearchQA, DeepResearch Bench | | S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research Agents | [2026/06/13]() | Qwen3-32B | SFT | Web Search | Single-Agent | S1-DeepResearch-15K | GAIA, BrowseComp, xBench-DeepSearch, HLE, DeepResearch Bench, DeepResearch Bench II, ComplexBench, GTA | | Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals | [2026/06/09]() | Qwen2.5-7B-Instruct, Qwen3-8B | PPO, GRPO, SFT, LoRA | Local Retrieval | Multi-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle | | Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training | 2026/06/09 GitHub stars | Qwen3-1.7B, Qwen3-4B | SFT, GRPO, DAPO | Local Retrieval | Single-Agent | Synthetic queries (DeepResearchGym/ClueWeb22) | 2WikiMultiHopQA, Bamboogle, HotpotQA, MuSiQue, Natural Questions, PopQA, TriviaQA, GAIA, HLE, WebWalkerQA | | SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research | 2026/06/08 GitHub stars | Tongyi DeepResearch-30B-A3B, Qwen3-30B-A3B-Thinking-2507 | SFT | Web Search | Multi-Agent | โ€“ | BrowseComp, BrowseComp-ZH, GAIA, xbench-DeepSearch-2505 | | SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating | 2026/06/05 GitHub stars | Tongyi-DeepResearch-30B, Qwen3-30B-A3B-Instruct-2507 | SFT, GRPO | Web Search | Single-Agent | ASearcher, TaskCraft, WebWalker, WebVoyager, WebShaper, REDSearcher, WebDancer, MegaScience | GAIA, BrowseComp, xbench-DeepSearch, HLE | | Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking | [2026/06/05]() | GPT-5, GPT-4.1, GPT-4o, Gemini-2.5-Pro, Gemini-2.5-Flash | Prompting (training-free) | Web Search | Single-Agent | โ€“ | MM-BrowseComp, HLE-VL, BrowseComp-VL | | Self-Evolving Deep Research via Joint Generation and Evaluation | [2026/06/03]() | Qwen2.5-7B-Instruct, Qwen2.5-72B-Instruct, Llama-3.1-8B-Instruct | GRPO, REINFORCE | Local Retrieval, Web Search | Single-Agent | Reddit-derived query set | DeepResearch Bench, DeepResearchEval | | Deep Research as Rubric for Reinforcement Learning | 2026/05/31 GitHub stars | Qwen3-8B, Qwen3-14B, Qwen3-30B-A3B | SFT, GRPO | Local Retrieval | Single-Agent | ResearchQA, RaR-Science, HealthBench, RaR-Medicine | ResearchQA, DeepResearchBench, LocalSearchBench, GPQA, MMLU-Pro, MMLU | | SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search | 2026/05/28 GitHub stars | Qwen2.5-3B-Instruct, Qwen2.5-7B-Instruct, Qwen3-4B-Instruct | GRPO | Local Retrieval | Single-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle | | VeriTrace: Evolving Mental Models for Deep Research Agents | [2026/05/25]() | Qwen3.5-27B, DeepSeek | Prompting | โ€“ | โ€“ | โ€“ | DeepResearch Bench, DeepConsult | | QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks | 2026/05/22 GitHub stars | Qwen3.5-35B-A3B, Qwen3-30B-A3B | Mid-training, SFT, RL | Web Search | Single-Agent | Synthetic tasks (rubric trees) | BrowseComp, Mind2Web 2, HLE, BrowseComp-Plus, WideSearch, GAIA, DeepResearch Bench, LiveResearchBench | | Argus: Evidence Assembly for Scalable Deep Research Agents | [2026/05/15]() | Qwen3.5-35B-A3B | SFT, GRPO | Web Search | Multi-Agent | โ€“ | BrowseComp, BrowseComp-ZH, GAIA, SEAL-0, xbench-DeepSearch-2510, HLE, FrontierScience-Olympiad, FrontierScience-Research | | GRASP: Graph Agentic Search over Propositions for Multi-hop Question Answering | [2026/05/15]() | Gemini-3-Flash-Preview | Prompting | Local Retrieval | Multi-Agent | โ€“ | MuSiQue, 2WikiMultihopQA, HotpotQA, LongBench | | CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG | 2026/05/12 GitHub stars | Qwen2.5-3B, Qwen2.5-7B, Llama-3.2-3B-Base | GRPO | Local Retrieval, Web Search | Single-Agent | โ€“ | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle | | Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient? | 2026/05/11 GitHub stars | gpt-5.5 | Prompting | Local Retrieval | Single-Agent | โ€“ | BrowseComp-Plus | | LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG | [2026/05/07]() | Qwen2.5-3B, Qwen2.5-7B | SFT | Local Retrieval | Single-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle | | LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents | 2026/05/06 GitHub stars | Qwen3-30B-A3B | SFT | Web Search | Single-Agent | OpenSeeker | BrowseComp, BrowseComp-ZH, xbench-2505, GAIA-text | | OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories | 2026/05/05 GitHub stars | Qwen3-30B-A3B-Thinking-2507 | SFT | โ€“ | Single-Agent | โ€“ | BrowseComp, BrowseComp-ZH, HLE, xbench-DeepSearch | | SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning | [2026/05/02]() | Qwen3-8B | SFT, GRPO | Web Search | Multi-Agent | SciResearcherQA, TRQA, SciBench | HLE-Bio/Chem-Gold, SuperGPQA-Hard-Biology, TRQA-Literature | | DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data | 2026/04/21 GitHub stars | Qwen3-4B-Thinking-2507 | SFT, RL (IGPO) | Web Search | Single-Agent | REDSearcher | BrowseComp, BrowseComp-ZH, GAIA, xbench-DeepSearch, DeepSearchQA | | LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent | 2026/04/20 GitHub stars | Qwen3-4B-Thinking-2507 | SFT, GRPO | Local Retrieval | Single-Agent | MiroRL, ASearcher, TaskCraft | GAIA, BrowseComp, HLE, Frames, WebWalker, Seal-0, Xbench-DeepSearch | | CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search | 2026/04/19 GitHub stars | Qwen2.5-7B-Instruct, Qwen2.5-3B-Instruct | GRPO | Local Retrieval | Single-Agent | Search-R1 training set | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle | | Mind DeepResearch Technical Report | [2026/04/16]() | Qwen3-32B, Qwen3-30B-A3B | SFT, GRPO, GSPO, DAPO, DPO | Web Search, Local Retrieval | Multi-Agent | โ€“ | BrowseComp, BrowseComp-ZH, xbench-DS, GAIA-DS, WideSearch, DeepResearch Bench, MindDR Bench | | Towards Long-horizon Agentic Multimodal Search | 2026/04/14 GitHub stars | Qwen3-VL-Thinking-30A3B, MiroThinker-1.7-mini | SFT, Model Merging | Web Search | Single-Agent | FVQA, LiveVQA, REDSearcher-MM, REDSearcher-Text | MM-BrowseComp, MMSearch-Plus, VisBrowse, MMSearch | | EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools | 2026/04/09 GitHub stars | GPT-4.1-mini, GPT-4.1, GPT-5.1, Minimax M2.5 | Prompting | Web Search | Multi-Agent | โ€“ | SimpleQA-Verified, FRAMES, WebWalkerQA, XBench DeepSearch | | Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents | 2026/04/06 GitHub stars | Qwen3-0.6B, Qwen3-1.7B, Qwen3-4B, Qwen3-8B, Llama-3.2-1B, Llama-3.2-3B, Qwen3-32B (teacher) | SFT, Distillation, On-Policy Distillation, Rejection Fine-Tuning | Local Retrieval | Single-Agent | HotpotQA | HotpotQA, 2WikiMultihopQA, Bamboogle, MuSiQue, BrowseComp-Plus, Frames, LongSeAL | | OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search | [2026/04/04]() | Qwen2.5-7B-Instruct, Qwen2.5-14B-Instruct, Qwen2.5-32B-Instruct | PPO, RLVR | Local Retrieval | Single-Agent | HotpotQA, 2WikiMultihopQA | NQ, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle | | InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking | 2026/04/03 GitHub stars | GPT-5.1, GPT-5-mini | Prompting | Web Search | Multi-Agent | โ€“ | WideSearch, BrowseComp-ZH | | CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery | 2026/04/02 GitHub stars | Claude (agent backbone) | Evolutionary Search (heartbeat-guided) | โ€“ | Multi-Agent | โ€“ | 10 math/algorithmic/systems benchmarks (incl. Anthropic kernel-engineering) | | Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design | 2026/03/30 GitHub stars | Qwen3-8B | SFT, GRPO | Web Search | Single-Agent | 2WikiMultihopQA, BeerQA, ASearcher, DeepDive, synthesized QA (12K) | BrowseComp, BrowseComp-ZH, GAIA, xBench-DeepSearch, WebWalkerQA, DeepSearchQA | | Gen-Searcher: Reinforcing Agentic Search for Image Generation | 2026/03/30 GitHub stars | Qwen-Image | SFT, GRPO | Web Search | Single-Agent | Gen-Searcher-SFT-10k, Gen-Searcher-RL-6k | KnowGen, WISE | | OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis | 2026/03/17 GitHub stars | NVIDIA-Nemotron-3-Nano-30B-A3B-Base, GPT-OSS-120B (teacher) | SFT | Local Retrieval | Single-Agent | MiroVerse-v0.1 (97K synthesized trajectories) | BrowseComp-Plus, BrowseComp, GAIA, xbench-DeepSearch | | OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data | 2026/03/16 GitHub stars | Qwen3-30B-A3B-Thinking-2507 | SFT | โ€“ | Single-Agent | OpenSeeker-v1-Data | BrowseComp, BrowseComp-ZH, xbench-DeepSearch, WideSearch | | Meta-Reinforcement Learning with Self-Reflection for Agentic Search | 2026/03/11 GitHub stars | Qwen2.5-3B-Base, Qwen2.5-7B-Base | Meta-RL, RLOO | Local Retrieval | Single-Agent | NQ, HotpotQA, ASearcher | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, ASearcher | | UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking | 2026/03/09 | PanGu-38B, Qwen3-32B | SFT, RFT | Web Search | Multi-Agent | โ€“ | UIS-QA, GAIA, BrowseComp-zh, FinSearchComp | | SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans | 2026/03/09 GitHub stars | Qwen3-8B, Qwen3-4B, Qwen3-32B | SFT, GRPO | Web Search | Single-Agent | HotpotQA, 2WikiMultihopQA, MuSiQue, MultiHop-RAG, SuperGPQA, WebWalker-Silver | HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle, GPQA, WebWalkerQA, GAIA | | AgentIR: Reasoning-Aware Retrieval for Deep Research Agents | 2026/03/04 | Qwen3-Embedding-4B, Tongyi-DeepResearch, gpt-oss-120B, GLM-4.7 | Contrastive Learning, LoRA | Local Retrieval | Single-Agent | DR-Synth, WebShaper | BrowseComp-Plus | | MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline | 2026/03/01 GitHub stars | Qwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, Qwen3-VL-32B-Instruct | SFT, GRPO | Web Search, Local Retrieval | Single-Agent | Hyper-Search-3K, DR-TTS-10K, InfoSeek, FVQA | SimpleVQA, MMSearch, LiveVQA, FVQA, InfoSeek, BrowseComp-VL | | DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent | 2026/03/01 GitHub stars | Qwen2.5-3B, Llama3.2-3B | SFT, PPO, GRPO | Web Search, Local Retrieval | Single-Agent | DeepResearch-9K | DeepResearch-9K, BrowseComp-Plus | | ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory Distillation | [2026/02/27]() | Qwen3-30B-A3B-Thinking-2507 | SFT | Web Search, Local Retrieval | Multi-Agent | ProductResearch synthetic trajectories (e-commerce user logs) | ProductResearch held-out test set | | Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization | 2026/02/26 GitHub stars | Qwen3-30B-A3B-Instruct-2507 | SFT, RL (RLOO) | Web Search | Single-Agent | SMTL-Dataset, TaskCraft | BrowseComp, GAIA, xbench-DeepSearch, WebWalkerQA, FRAMES, SEAL-0, DeepResearch Bench | | MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks | 2026/02/26 GitHub stars | GPT-5, Claude 3.7 Sonnet, MiroThinker v1.0-72B | Prompting | Web Search | Multi-Agent | โ€“ | GAIA, BrowseComp-EN, BrowseComp-ZH, HLE, xBench-DeepSearch, FutureX | | How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1 | [2026/02/23]() | Qwen2.5-7B, Qwen2.5-3B | REINFORCE, PPO, GRPO | Local Retrieval | Single-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle | | W&D:Scaling Parallel Tool Calling for Efficient Deep Research Agents | 2026/02/07 | GPT-5, Gemini 3.0 Pro, Claude 4.5 Sonnet, DeepSeek-V3.2, Qwen3-235B | Prompting | Web Search | Single-Agent | โ€“ | BrowseComp, HLE, GAIA | | AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research | 2026/02/06 GitHub stars | MiniCPM4.1-8B | SFT, RL | Local Retrieval | Single-Agent | โ€“ | DeepResearch Bench, DeepConsult, DeepResearch Gym | | RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents | 2026/02/02 GitHub stars | Qwen3-4B-Instruct, Tongyi-DeepResearch-30B-A3B, GLM-4.7, GPT-5, o3, Claude-4.5-Sonnet, DeepSeek-V3.2 | Prompting, SFT | Web Search | Single-Agent | โ€“ | BrowseComp, BrowseComp-ZH, GAIA, XBench, HLE | | Yunque DeepResearch Technical Report | 2026/01/27 GitHub stars | Gemini-3-Pro, DeepSeek-V3.2, Kimi K2 Thinking | Prompting | Web Search | Multi-Agent | โ€“ | GAIA, BrowseComp, BrowseComp-ZH, HLE | | OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents | 2026/01/26 GitHub stars | OffSeeker-8B | SFT, DPO | Web Search | Single-Agent | DeepForge synthetic data (66k QA pairs, 33k SFT trajectories, 21k DPO pairs) | GAIA, BrowseComp-en, BrowseComp-zh, HLE, XBench-DeepSearch, WebWalkerQA | | Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification | 2026/01/22 GitHub stars | Claude-3.7-Sonnet, Claude-3.5-Sonnet, GPT-4.1, Qwen3-8B | SFT, Test-Time Verification | Web Search | Multi-Agent | DeepVerifier-4K, WebAggregatorQA | GAIA, XBench-DeepSearch, BrowseComp | | Agentic-R: Learning to Retrieve for Agentic Search | 2026/01/17 GitHub stars | Qwen2.5-7B-Base, E5-base-v2, Qwen2.5-72B-Instruct | PPO, Contrastive Learning | Local Retrieval | Single-Agent | HotpotQA, TriviaQA | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle | | ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents | [2026/01/17]() | Qwen2.5-7B-Instruct, Qwen2.5-32B-Instruct, Qwen3-14B, Qwen3-32B, DeepSeek-v3.2, GPT-OSS-120B | Prompting, SFT | Web Search | Single-Agent | โ€“ | HotpotQA, GAIA, xbench-DeepSearch, BrowseComp, BrowseComp-ZH | | Dr. Zero: Self-Evolving Search Agents without Training Data | 2026/01/11 GitHub stars | Qwen2.5-3B-Instruct, Qwen2.5-7B-Instruct | HRPO | Web Search | Multi-Agent | โ€“ | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA (2WikiMQA), MuSiQue, Bamboogle | | Over-Searching in Search-Augmented Large Language Models | 2026/01/09 GitHub stars | Frontier + Open-source LLMs | Prompting (Evaluation & Mitigation) | Web Search, Local Retrieval | Single-Agent | โ€“ | OverSearchQA | | LEAPS: An LLM-Empowered Adaptive Plugin for Taobao AI Search | [2026/01/09]() | Qwen3-14B | REINFORCE++, GRPO, GSPO | Local Retrieval | Single-Agent | โ€“ | โ€“ | | SmartSearch: Process Reward-Guided Query Refinement for Search Agents | 2026/01/08 GitHub stars | Qwen2.5-3B-Instruct | SFT, DPO, GRPO | Web Search | Single-Agent | Asearcher-Base | 2WikiMultihopQA, HotpotQA, Bamboogle, MuSiQue, GAIA, WebWalker | | O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL | 2026/01/07 GitHub stars | Qwen-2.5-72B-Instruct | GRPO | Web Search | Multi-Agent | Zhihu-KOL, WideSearch, ELI5 | DeepResearch Bench, DeepResearchGym | | WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning | [2026/01/06]() | WebSailor-3B/7B, Tongyi-DR-30B, Qwen-2.5-72B | GRPO | Local Retrieval | Single-Agent | โ€“ | BrowseComp-en, BrowseComp-zh, XBench-DeepSearch, GAIA | | Budget-Aware Tool-Use Enables Effective Agent Scaling | [2025/11/21]() | Gemini-2.5-Flash, Gemini-2.5-Pro, Claude-Sonnet-4 | Prompting | Web Search | Single-Agent | โ€“ | โ€“ | | AutoTool: Efficient Tool Selection for Large Language Model Agents | 2025/11/18 GitHub stars | Llama4-Scout-17B | Prompting | Web Search | Single-Agent | โ€“ | AlfWorld, ScienceWorld, ToolQuery-Academia | | Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO | 2025/11/17 GitHub stars | Qwen3-30B-A3B | M-GRPO | Web Search | Multi-Agent | โ€“ | GAIA, XBench-DeepSearch, WebWalkerQA | | ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use | [2025/10/31]() | GPT-4o, Gemini-2.5, Qwen2.5-VL, Llama-3.2-Vision | Prompting | Local Retrieval | Multi-Agent | โ€“ | โ€“ | | TOOLRM: Towards Agentic Tool-Use Reward Modeling | 2025/10/30 GitHub stars | Qwen3-4B, Qwen3-8B | RL | Web Search | Single-Agent | ToolPref-Pairwise-30K | TRBench, ACEBench | | Tongyi DeepResearch Technical Report | 2025/10/28 GitHub stars | Qwen3-30B-A3B-Base | SFT, RL | Web Search | Single-Agent | โ€“ | HLE, BrowseComp, BrowseComp-ZH, GAIA, XBench-DeepSearch, WebWalkerQA, FRAMES, XBench-DeepSearch-2510 | | WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection | 2025/10/21 GitHub stars | Qwen-2.5-14B, Qwen-3-14B | RL (cold start + RL; self-reflection) | Web Search | Single-Agent | โ€“ | HotpotQA, SimpleQA | | Enterprise Deep Research: Steerable MultiAgent Deep Research for Enterprise Analytics | 2025/10/20 GitHub stars | โ€“ | Prompting | Web Search | Multi-Agent | โ€“ | DeepResearch Bench, DeepConsult | | Stop-RAG: Value-Based Retrieval Control for Iterative RAG | 2025/10/16 GitHub stars | Llama-3.1-8B-Instruct | Fine-tuning | Local Retrieval | Single-Agent | MuSiQue, HotpotQA, 2WikiMultihopQA | HotpotQA, MuSiQue, 2WikiMultihopQA | | Towards Agentic Self-Learning LLMs in Search Environment | 2025/10/16 GitHub stars | Qwen-2.5-7B-Instruct | RL | Web Search | Multi-Agent | โ€“ | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle | | GOAT: A Training Framework for Goal-Oriented Agent with Tools | [2025/10/14]() | Qwen-2-7B, Llama-3-8B-Instruct, Llama-3-70B-Instruct | Fine-tuning | Web Search | Single-Agent | โ€“ | GOATBench | | ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents | 2025/10/14 GitHub stars | gpt-4.1, gpt-4.1-mini, o4-mini, Llama-3.3-70B | Prompting | Web Search | Single-Agent | โ€“ | GAIA | | HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation | 2025/10/09 GitHub stars | Qwen2.5-3B-Instruct, Qwen2.5-7B-Instruct, Llama-3.2-3B-Instruct | PPO, GRPO | Web Search | Single-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2Wiki, MuSiQue, Bamboogle | | A2SEARCH: Ambiguity-Aware Question Answering with Reinforcement Learning | 2025/10/09 GitHub stars | Qwen-2.5 family | RL | Web Search | Single-Agent | NQ | MuSiQue, HotpotQA, 2Wiki, Bamboogle, NQ, TriviaQA, PopQA, AmbigQA | | ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards | 2025/10/01 | Qwen2.5-7B-Instruct, Qwen2.5-3B-Instruct | GRPO | Web Search, Local Retrieval | Single-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMQA, MuSiQue, Bamboogle, FictionalHot | | Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents | [2025/09/17]() | Qwen3-8B, Qwen2.5-Omni-7B | RL | Local Retrieval | Single-Agent | ฯ„-bench, APIGen-MT | ฯ„-bench | | ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization | 2025/09/16 GitHub stars | Qwen3-30B-A3B-Thinking | GRPO, SFT | Web Search | Single-Agent | SailorFog-QA | BrowseComp-en/zh | | WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research | 2025/09/16 GitHub stars | Qwen3-30B-A3B-Instruct | SFT | Web Search | Single-Agent | WebWeaver-3k | BrowseComp-en/zh, GAIA, XBench-DeepSearch | | WebResearcher: Unleashing Unbounded Reasoning Capability in Long-Horizon Agents | 2025/09/16 GitHub stars | Qwen3-30B-A3B | RFT, RL | Web Search | Multi-Agent | WebFrontier | BrowseComp-en/zh, GAIA, WebWalkerQA, FRAMES, HotpotQA, MuSiQue, 2WikiMultiHopQA | | WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable RL | 2025/09/16 GitHub stars | Qwen3-30B-A3B | SFT, RL | Web Search, Local Retrieval | Single-Agent | SailorFog-QA-V2 | BrowseComp-EN, BrowseComp-ZH, HLE | | WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents | 2025/09/08 GitHub stars | Qwen3-8B | GRPO, SFT | Web Search | Single-Agent | WebExplorer-QA | BrowseComp-en/zh, GAIA, WebWalkerQA, FRAMES, XBench-DeepSearch, HLE | | Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward | 2025/08/18 GitHub stars | Qwen2.5-7B | RL(GRPO) | Web Search | Single-Agent | NQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAG | Bamboogle, NQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAG | | MMSearch-R1: Incentivizing LMMs to Search | 2025/06/25 GitHub stars | Qwen2.5-VL-7B | RL(GRPO) | Web Search | Single-Agent | VQA, MetaClip, FVQA, InfoSeek | FVQA-test, InfoSeek, MMSearch, SimpleVQA, LiveVQA | | VideoDeepResearch: Long Video Understanding With Agentic Tool Using | 2025/06/12 GitHub stars | GPT-4o, Gemini1.5-pro, Qwen2.5-VL-72B-Instruct | Prompting | Local Retrieval | Multi-Agent | โ€“ | MLVU, Video-MME, LVBench, LongVideoBench | | Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework | [2025/06/03]() | Claude3.7-Sonnet, GPT-4o-mini, Qwen3-235B-A22B, Qwen2.5-VL-72B-Instruct | Prompting | Web Search | Multi-Agent | โ€“ | Pew Research, Our World in Data, Open Knowledge Foundation | | RAG-Gym: Systematic Optimization of Language Agents for Retrieval-Augmented Generation | 2025/05/31 GitHub stars | Llama3.1-8B-Instruct, Qwen2.5-7B-Instruct, GPT-4o-mini | SFT, RL(PPO, DPO) | Local Retrieval | Single-Agent | HotpotQA, MedQA | HotpotQA, 2Wiki, Bamboogle, MedQA | | MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability | 2025/05/27 GitHub stars | Llama3.1-8B, Llama3.2-3B, Llama3.2-1B, Llama3, Qwen2.5-7B, Qwen2.5-3B, Qwen2.5-1.5B, Qwen2.5 | SFT, RL(DAPO) | Local Retrieval | Multi-Agent | HotpotQA | HotpotQA, FanoutQA, Musique, 2WikiMultiHopQA, Bamboogle, FreshQA | | SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis | 2025/05/25 GitHub stars | Qwen2.5-7B-Instruct, Qwen2.5-32B-Instruct, DeepseekDistilled-Qwen2.5-32B, QwQ-32B | SFT | Web Search | Single-Agent | NQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAG | Bamboogle, FRAMES, GAIA, NQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAG | | WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning | 2025/05/22 GitHub stars | Qwen2.5-3B, Llama3.1-8B | SFT, RL(M-GRPO) | Web Search | Single-Agent | WebArena-Lite, WebArena | WebArena-Lite, WebArena | | R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning | 2025/05/22 GitHub stars | Qwen2.5-7B-Instruct | SFT, RL | Local Retrieval | Single-Agent | HotpotQA, 2WikiMultiHopQA | HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle | | Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning | 2025/05/22 GitHub stars | Qwen2.5-7B-Instruct | RL(DPO) | Local Retrieval | Single-Agent | PopQA, HotpotQA, 2WikiMultihopQA | PopQA, HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue | | s3 - Efficient Yet Effective Search Agent Training via RL | 2025/05/20 GitHub stars | Qwen2.5-7B-Instruct | RL(PPO) | Local Retrieval | Single-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2wiki, Musique, MedQA-US, MedMCQA, PubMedQA, BioASQ-Y/N, MMLU-Med | | Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents | 2025/05/17 GitHub stars | Qwen2.5-14B, Qwen2.5-7B | Prompting | Local Retrieval | Single-Agent | โ€“ | Musique, NQ, 2WikiMultiHopQA, HotpotQA, Bamboogle, StrategyQA | | Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent | 2025/05/12 GitHub stars | Qwen2.5-3B-Instruct, Qwen2.5-7B-Instruct | RL(GRPO) | Local Retrieval | Single-Agent | NQ, HotpotQA | PopQA, 2WikiMultihopQA | | ZeroSearch: Incentivize the Search Capability of LLMs without Searching | 2025/05/07 GitHub stars | Qwen2.5-3B-Base, Qwen2.5-7B-Base, Qwen2.5-7B-Instruct, Qwen2.5-3B-Instruct, Llama3.2-3B-Instruct, Llama3.2-3B-Base | RL(Reinforce, GRPO, PPO) | Web Search | Single-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle | | Webthinker: Empowering large reasoning models with deep research capability | 2025/04/30 GitHub stars | GPT-o1, GPT-o3, Deepseek-R1, QwQ-32B, Qwen2.5-32B-Instruct | RL(DPO) | Web Search | Single-Agent | SuperGPQA, WebWalkerQA, OpenThoughts, NaturalReasoning, NuminaMath | GPQA, GAIA, WebWalkerQA, Humanityโ€™s Last Exam | | Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs | 2025/04/11 GitHub stars | Pangu Ultra-135B | SFT, RL | Local Retrieval | Single-Agent | โ€“ | โ€“ | | Open Deep Search: Democratizing Search with Open-source Reasoning Agents | 2025/03/26 GitHub stars | Llama3.1-70B, Deepseek-R1 | Prompting | Web Search | Single-Agent | โ€“ | SimpleQA, FRAME | | DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments | 2025/03/26 GitHub stars | Qwen2.5-7B-Instruct | RL(GRPO) | Web Search | Multi-Agent | NQ, TQ, HotpotQA, 2WikiMultiHopQA | MuSiQue, Bamboogle, PopQA, NQ, TQ, HotpotQA, 2WikiMultiHopQA | | ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning | 2025/03/25 GitHub stars | Qwen2.5-7B-Instruct, Qwen2.5-32B-Instruct | RL(GRPO) | Web Search | Single-Agent | MuSiQue | HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle | | Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning | 2025/03/12 GitHub stars | Qwen2.5-7B-Instruct, Qwen2.5-7B-Base, Qwen2.5-3B-Instruct, Qwen2.5-3B-Base | RL(PPO, GRPO) | Web Search | Single-Agent | NQ, HotpotQA | NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle | | Beyond Outlining: Heterogeneous Recursive Planning for Adaptive Long-form Writing with Language Models | 2025/03/11 GitHub stars | GPT-4o, Claude3.5-Sonnet | Prompting | Web Search | Multi-Agent | โ€“ | TELL ME A STORY, WildSeek | | R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning | 2025/03/07 GitHub stars | Qwen2.5-7B-Base, Llama3.1-8B-Instruct | SFT, RL(GRPO, Reinforce++) | Web Search, Local Retrieval | Single-Agent | HotpotQA, 2WikiMultiHopQA | HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle | | AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents | 2025/02/18 GitHub stars | Claude3.5-Sonnet | Prompting | Web Search | Multi-Agent | โ€“ | GAIA | | Agentic Reasoning: Reasoning LLMs with Tools for the Deep Research | 2025/02/07 GitHub stars | N/A | Prompting | Web Search | Multi-Agent | โ€“ | GPQA | | Search-o1: Agentic Search-Enhanced Large Reasoning Models | 2025/01/09 GitHub stars | QwQ-32B-Preview | Prompting | Web Search | Single-Agent | โ€“ | GPQA, MATH500, AMC2023, AIME2024, LiveCodeBench, NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle |

Benchmarks and Applications

Benchmarks Plot

  • REFUTE: Benchmark for scientific critique and epistemic calibration on recent (2025โ€“2026) science summaries, separating critique skill from calibrated truthfulness [[Report]](https://huggingface.co/datasets/BGPT-OFFICIAL/refute/blob/main/TECHNICAL_REPORT.md) [[Data]](https://huggingface.co/datasets/BGPT-OFFICIAL/refute) [[Leaderboard]](https://huggingface.co/spaces/BGPT-OFFICIAL/refute-leaderboard)
  • Humanity's Last Exam [[Paper]](https://arxiv.org/abs/2501.14249) [[Code]](https://github.com/centerforaisafety/hle) GitHub Repo stars
  • BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents [[Paper]](https://arxiv.org/pdf/2504.12516) [[Code]](https://github.com/openai/simple-evals) GitHub Repo stars
  • BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese ['[Paper]'](https://arxiv.org/pdf/2504.19314) [[Code]](https://github.com/PALIN2018/BrowseComp-ZH) GitHub Repo stars
  • DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents [[Paper]](https://arxiv.org/pdf/2506.11763) [[Code]](https://github.com/Ayanami0730/deepresearchbench) GitHub Repo stars
๐Ÿ”— More in this category

ยฉ 2026 GitRepoTrend ยท DavidZWZ/Awesome-Deep-Research ยท Updated daily from GitHub