DATASET PIPELINE
1. Collect
Web crawling, API access, public datasets (The Pile, C4, Dolma). Track sources and licenses.
2. Clean
Remove duplicates, filter low-quality text, deduplicate, detect language, remove PII.
3. Format
Convert to standard format (JSONL), tokenize, pack sequences, create train/val splits.
KEY CONCEPTS