Hugging Face Datasets Guide

Training Datasets & Benchmark Datasets (December 2025)

A comprehensive reference for datasets available on Hugging Face for pre-training, fine-tuning, and evaluating language models.


Table of Contents

  1. Pre-Training Datasets

  2. Fine-Tuning & Instruction Datasets

  3. Benchmark Datasets - General Knowledge

  4. Benchmark Datasets - Coding

  5. Benchmark Datasets - Reasoning & Math

  6. Benchmark Datasets - Multimodal

  7. Specialized Domain Datasets


Pre-Training Datasets

Large-scale datasets for training foundation models from scratch.

Dataset NameSizeTokensLanguagesDescriptionLicenseLink
FineWeb44TB15TEnglishState-of-the-art web dataset from 96 CommonCrawl snapshots (2013-2024). Outperforms C4, Pile, RefinedWeb. Rigorous filtering and deduplication.ODC-By 1.0HuggingFaceFW/fineweb
FineWeb-Edu~5.4TB1.3T (threshold 3)
5.4T (threshold 2)
EnglishEducational subset of FineWeb. Filtered by Llama3-70B classifier for educational quality. Best for knowledge/reasoning benchmarks (MMLU, ARC, OpenBookQA).ODC-By 1.0HuggingFaceFW/fineweb-edu
FinePDFs3.65TB3T1,733 languagesLargest PDF corpus. 475M documents extracted via Docling + RolmOCR. Combines well with web data. Complementary to FineWeb.ODC-ByHuggingFaceFW/finepdfs
C4 (Colossal Clean Crawled Corpus)750GB172BEnglish (primary)Classic dataset from T5 paper. CommonCrawl-based with heuristic filtering. Multiple variants (en, en.noclean, en.noblocklist, multilingual mC4).ODC-Byallenai/c4
The Pile825GB825BEnglish22 high-quality datasets combined. Diverse sources (books, code, web, academic). Influential but book subset removed due to copyright.MIT (varies by subset)monology/pile-uncopyrighted
RedPajama-Data-1T~1TB1.2TEnglish (primarily)Open replication of LLaMA training data. Includes CommonCrawl (878B), C4 (175B), GitHub (59B), ArXiv (28B), Wikipedia (24B), StackExchange (20B).Apache 2.0togethercomputer/RedPajama-Data-1T
SlimPajama~627GB627BEnglishCleaned and deduplicated version of RedPajama. Removes duplicates and low-quality content. More efficient than original.Apache 2.0cerebras/SlimPajama-627B
Dolma~3TB3TEnglish (primarily)AllenAI's diverse dataset. Web content, academic publications, code, books, encyclopedic materials. High-quality curation.ODC-Byallenai/dolma
RefinedWeb~600GB500B (filtered)
5T (unfiltered)
EnglishFalcon LLM training data. Aggressive quality filtering from CommonCrawl. FineWeb aimed to surpass this.ODC-Bytiiuae/falcon-refinedweb
StarCoder Data783GB~250B86 programming languagesCode training dataset. 54GB GitHub Issues, 13GB Jupyter notebooks, 32GB commits. Used to train StarCoder models.Apache 2.0bigcode/starcoderdata
The Stack~6TBVariable358 programming languagesMassive code dataset from GitHub. Deduplicated and filtered. Opt-out mechanism for developers.Multiple (check per language)bigcode/the-stack
FineVision5TB10B (answer tokens)MultilingualLatest multimodal dataset (Sep 2025). 17.3M images, 24.3M samples, 88.9M QA turns. 200+ sources for VLM training. +20% performance boost.VariousHuggingFaceM4/FineVision

Fine-Tuning & Instruction Datasets

Datasets for instruction-tuning and alignment of pre-trained models.

Dataset NameSizeTypeDescriptionUse Cases
Magpie-Ultra1M samplesSynthetic InstructionsSynthetically generated instruction pairs covering text editing, coding, comprehension. Improves reasoning and factual correctness.Instruction tuning, conversational agents
OpenOrca4.4M samplesSynthetic ReasoningGPT-4/GPT-3.5 generated explanations. Reasoning-focused instruction following.Reasoning models, educational apps
Ultrachat1.4M samplesConversationalMulti-turn dialogues covering diverse topics. Used by Zephyr and other chat models.Multi-turn chat, dialogue systems
HH-RLHF (Anthropic)169K samplesPreference DataHuman preference data for RLHF. Helpfulness and harmlessness ratings.Preference-based training, alignment
Orca-Math-200K200K samplesMath ReasoningMath word problems with step-by-step solutions. High-quality synthetic data.Math tutors, reasoning bots
WizardLM-Evol-Instruct250K samplesEvolved InstructionsInstructions generated through evolutionary prompting. Increasing complexity.General instruction following
Alpaca52K samplesInstruction FollowingSelf-instruct dataset generated by GPT-3.5. Simple task completion.Basic instruction tuning
Dolly-15K15K samplesHuman-GeneratedHuman-written instruction-response pairs. High quality but small. Open license.High-quality instruction data
ShareGPT~90K conversationsConversationalReal ChatGPT conversations shared by users. Multi-turn dialogue.Chat models, dialogue training
ReasonMed370K samplesMedical ReasoningLargest medical reasoning dataset (Q2 2025). Multi-agent verification and refinement. Used to train ReasonMed-7B.Medical AI, healthcare applications

Benchmark Datasets - General Knowledge

Datasets for evaluating general knowledge, reasoning, and language understanding.

BenchmarkSizeFormatDescriptionWhat It MeasuresDifficulty
MMLU (Massive Multitask Language Understanding)15,908 questionsMultiple choice (4 options)57 subjects from elementary to professional level. Covers humanities, STEM, social sciences. Standard benchmark.Multitask accuracy, expert knowledge across domainsMedium (being saturated)
MMLU-Pro12,000 questionsMultiple choice (10 options)Enhanced MMLU with harder questions, more options. Requires reasoning. Sources: original MMLU + STEM websites + TheoremQA + SciBench.Robust multitask understanding, deeper reasoningHigh
GPQA (Graduate-Level Google-Proof Q&A)448 questions (main)
198 (diamond)
Multiple choice (4 options)Graduate-level science questions by domain experts. Biology, physics, chemistry. Extremely difficult. Gated access to prevent contamination.Expert-level scientific knowledge, advanced reasoningVery High
ARC (AI2 Reasoning Challenge)7,787 questionsMultiple choiceScience questions from standardized tests (grade 3-9). ARC-Easy and ARC-Challenge subsets.Scientific reasoning, elementary knowledgeMedium
HellaSwag70,000 examplesMultiple choiceCommonsense natural language inference. Sentence completion with context.Commonsense reasoning, language understandingMedium
TruthfulQA817 questionsMultiple choice + generationQuestions designed to cause false answers. Tests truthfulness and informativeness.Truthfulness, resistance to common misconceptionsHigh
Winogrande44,000 questionsBinary choiceWinograd Schema challenge. Pronoun resolution requiring common sense.Commonsense reasoningMedium-High
CommonsenseQA12,247 questionsMultiple choice (5 options)Questions requiring background commonsense knowledge.Commonsense knowledge applicationMedium
OpenBookQA6,000 questionsMultiple choice (4 options)Elementary science with open book facts provided. Requires reasoning beyond facts.Multi-hop reasoning, science knowledgeMedium
PIQA (Physical Interaction QA)21,000 questionsBinary choicePhysical commonsense reasoning. Everyday scenarios.Physical world understandingMedium
GAIA450+ questionsUnambiguous answerNon-trivial questions requiring tools and autonomy. 3 difficulty levels. Agent-oriented.Tool use, autonomous problem-solving, multi-step reasoningVery High
MuSR (Multistep Soft Reasoning)Algorithmically generatedLong-form (~1000 words)Complex problems: murder mysteries, object placement, team allocation. Requires long-range context parsing.Long-context reasoning, complex integrationExtremely High

Benchmark Datasets - Coding

Datasets for evaluating code generation and programming capabilities.

BenchmarkSizeLanguagesDescriptionWhat It MeasuresNotes
HumanEval164 problemsPythonHand-written programming problems. Docstrings to code. Simple to moderate difficulty. Used by Codex/GPT-4.Functional correctness, code generationSmall size limits statistical significance
HumanEval+164 problemsPythonHumanEval with 80x more test cases per problem. Much more rigorous testing.Robust functional correctnessHarder to pass than original
MBPP (Mostly Basic Python Problems)1,000 problemsPythonCrowd-sourced entry-level Python problems. Task description + code + 3 tests.Basic programming ability, instruction followingGood for practical coding
MBPP+1,000 problemsPythonMBPP with 35x more test cases. More comprehensive testing.Robust code generationStricter than original
MultiPL-E164 problems18+ languagesHumanEval translated to multiple languages (Java, JavaScript, C++, Go, Rust, etc.).Multilingual code generationBased on HumanEval
CodeContestsThousandsMultipleDeepMind's competitive programming dataset. Used to train AlphaCode. Real algorithmic thinking required.Advanced coding, algorithmic problem-solvingVery challenging
LiveCodeBenchContinuously updatedMultipleReal-time coding problems from contests. Prevents training data contamination.Current coding ability without memorizationRegularly refreshed
DS-10001,000 problemsPython (data science)Data science coding problems. NumPy, Pandas, Scikit-learn, PyTorch, TensorFlow.Data science library usageDomain-specific
APPS10,000 problemsPythonCompetitive programming and interview questions. Varying difficulty.Algorithmic problem-solving, interview prepLarge, diverse
SWE-bench2,294 tasksPythonReal GitHub issues from popular repos. Full repository context.Real-world software engineering, debuggingMost realistic
SWE-bench Verified500 tasksPythonHuman-verified subset of SWE-bench. Higher quality, more reliable.Production-grade engineering capabilityGold standard for coding

Benchmark Datasets - Reasoning & Math

Datasets for evaluating mathematical and logical reasoning capabilities.

BenchmarkSizeTypeDescriptionWhat It MeasuresDifficulty
GSM8K8,500 problemsMath word problemsGrade school math problems. Requires multi-step arithmetic reasoning.Elementary math reasoningMedium
MATH12,500 problemsCompetition mathProblems from math competitions. Algebra, geometry, calculus, number theory. Requires advanced techniques.Advanced mathematical reasoningVery High
AIME (American Invitational Mathematics Examination)~15-30 problems/yearCompetition mathAnnual high school math competition. Extremely difficult. Used to test reasoning models.Elite mathematical problem-solvingExtremely High
TheoremQA800 questionsSTEM theoremsRequires applying theorems from math, physics, EE, CS. Graduate-level.Theorem application, STEM reasoningVery High
MathVista6,141 examplesVisual mathMath problems with visual elements (charts, diagrams, geometry).Visual mathematical reasoningHigh
DROP (Discrete Reasoning Over Paragraphs)96,000 questionsReading comprehensionMath/logic reasoning over paragraphs. Numerical reasoning. Note: Removed from some leaderboards due to evaluation issues.Discrete reasoning, numericalMedium-High
BBH (Big-Bench Hard)6,511 examplesDiverse reasoning23 challenging tasks from BIG-Bench. Logic, math, common sense.Challenging multi-domain reasoningHigh
AGIEval~8,000 questionsStandardized testsHuman-centric standardized exams (SAT, LSAT, GRE, etc.).Human-level test performanceHigh
LogiQA8,678 questionsLogical reasoningLogical reasoning questions from Chinese civil service exams.Formal logical reasoningHigh

Benchmark Datasets - Multimodal

Datasets for evaluating vision-language and multimodal capabilities.

BenchmarkSizeModalitiesDescriptionWhat It Measures
MMMU (Massive Multi-discipline Multimodal Understanding)11,500 questionsImage + TextCollege-level subject questions requiring images. Art, business, science, health, humanities.Expert multimodal understanding
MMMU-ProEnhancedImage + TextMore challenging version of MMMU with 10 options vs 4. Reduced guessing.Robust multimodal reasoning
DocVQA50,000 questionsDocument imagesQuestion answering on document images. Forms, receipts, reports.Document understanding, OCR-free reading
ChartQA9,608 questionsChart imagesQuestions about charts and graphs. Data extraction and reasoning.Visual data interpretation
AI2D5,000 diagramsScientific diagramsScience diagram understanding and QA.Scientific visual reasoning
ScienceQA21,000 questionsImages + TextMultimodal science questions. Elementary and high school level.Multimodal science reasoning
OCRBenchVariableDocumentsComprehensive OCR evaluation across document types.Text extraction accuracy
TextVQA45,336 questionsImages with textQuestions requiring reading text in images.Visual text understanding
VQAv2265,016 questionsNatural imagesOpen-ended visual question answering on photos.General visual understanding
GQA (Visual Reasoning)22M questionsImages + Scene graphsCompositional visual reasoning. Requires multi-step logic.Compositional visual reasoning
CameraBenchLarge-scaleVideo + Camera motionUnderstanding camera motion in videos. Geometric vs semantic movements. Expert-annotated.Camera movement understanding (Q2 2025)
OmniDocBenchVariableDocumentsComprehensive document understanding benchmark for multilingual parsing.Document AI capability

Specialized Domain Datasets

Domain-specific datasets for training and evaluation.

Medical & Healthcare

DatasetSizeDescriptionUse Case
ReasonMed370K samplesMedical reasoning dataset via multi-agent verification. Used for ReasonMed-7B (outperforms Llama 3.1 70B on PubMedQA).Medical AI training
PubMedQA1,000 questionsBiomedical research question answering. Yes/no/maybe format.Medical knowledge evaluation
MedQA61,000 questionsUS Medical licensing exam questions. Multiple choice.Medical expertise assessment
MedMCQA194,000 questionsIndian medical entrance exam questions. Diverse medical topics.Medical knowledge testing

Law & Compliance

DatasetSizeDescriptionUse Case
LegalBench162 tasksLegal reasoning tasks. Contracts, precedents, statutory interpretation.Legal AI evaluation
CUAD510 contractsContract understanding and analysis. 41 types of important clauses.Contract analysis

Multilingual & Translation

DatasetSizeLanguagesDescription
FLORES3,001 sentences200 languagesMultilingual translation evaluation.
XNLI7,500 pairs15 languagesCross-lingual natural language inference.
XSum227,000 articlesEnglishExtreme summarization of BBC articles.

Computer Science & Technical

DatasetSizeDescription
arXiv Papers (FineWeb-Edu subset)63,357 papersAcademic papers in multi-markdown format for semantic search and summarization.
StackExchangeMillions of Q&AsProgramming and technical Q&A from Stack Overflow, Math.SE, etc.
DatasetSizeDescriptionRelease
RTEB (Retrieval Embedding Benchmark)HybridReal-world retrieval evaluation. Public + private datasets. 20 languages. Critical domains: law, healthcare, finance, code.Oct 2025
BEIR18 datasetsDiverse retrieval tasks. Zero-shot retrieval evaluation.Standard
MS MARCO8.8M passagesInformation retrieval and question answering.Classic

Conversational & Chat

BenchmarkDescriptionWhat It Measures
MT-Bench80 multi-turn conversationsMulti-turn instruction following, rated by GPT-4 judge
AlpacaEval805 instructionsInstruction following quality vs reference model
Chatbot ArenaHuman votingReal human preferences via anonymous A/B testing
IFEval500+ promptsVerifiable instruction following (specific constraints)

Safety & Alignment

DatasetDescription
ToxiGenToxicity detection in generation
RealToxicityPromptsToxicity measurement for completions
CrowS-PairsSocial bias measurement
BBQ (Bias Benchmark for QA)Question answering bias evaluation

Dataset Selection Guide

For Pre-Training

GoalRecommended DatasetReason
Best overall qualityFineWeb or FineWeb-EduState-of-the-art curation, outperforms alternatives
Educational focusFineWeb-EduOptimized for knowledge/reasoning benchmarks
Document understandingFinePDFsComplementary to web data, 3T tokens from PDFs
Code modelsThe Stack + StarCoder DataLargest code corpus with proper licensing
MultimodalFineVision24M samples, 200+ sources, low contamination
Quick experimentsC4 or SlimPajamaWell-tested, smaller, faster to download

For Fine-Tuning

GoalRecommended Dataset
Instruction followingMagpie-Ultra, OpenOrca
Conversational abilityUltrachat, ShareGPT
ReasoningOpenOrca, Orca-Math-200K
AlignmentHH-RLHF
Medical AIReasonMed
High qualityDolly-15K (human-written)

For Benchmarking

Capability to TestUse These Benchmarks
General knowledgeMMLU, MMLU-Pro
Expert knowledgeGPQA
CodingHumanEval+, MBPP+, SWE-bench Verified
Math reasoningGSM8K, MATH, AIME
CommonsenseHellaSwag, Winogrande, PIQA
MultimodalMMMU-Pro, DocVQA, ChartQA
TruthfulnessTruthfulQA
Instruction followingIFEval, MT-Bench
Long-context reasoningMuSR
Real-world codingSWE-bench Verified

Important Notes

Data Contamination

Benchmark Saturation

License Considerations

Dataset Quality Issues

Evaluation Best Practices

  1. Use multiple benchmarks (single benchmarks misleading)

  2. Include domain-specific tests for your use case

  3. Check for contamination in training data

  4. Use held-out test sets when possible

  5. Consider both automated metrics and human evaluation

  6. Pay attention to few-shot vs zero-shot settings


Accessing Datasets

Using Datasets Library (Python)

Using Hugging Face Hub CLI


Recent Dataset Releases (2025)

DatasetRelease DateSignificance
FinePDFsSep 2025First large-scale PDF corpus (3T tokens)
FineVisionSep 2025Largest open VLM dataset (24M samples)
RTEBOct 2025New standard for retrieval evaluation
ReasonMedQ2 2025Largest medical reasoning dataset (370K)
MMLU-Pro2024Harder MMLU replacement (12K questions, 10 options)
CameraBenchQ2 2025First camera motion understanding benchmark

Community Resources


Last Updated: December 20, 2025

Note: Dataset availability and links may change. Always verify on Hugging Face Hub. Benchmark scores and difficulty ratings are approximate and may vary by model and evaluation setup.

Sources: Hugging Face Dataset Hub, official dataset papers, benchmark leaderboards, community documentation (December 2025)