← all datasets

SmolTalk

Emerging
2papers using it
25,187HF downloads
424HF likes
2025first seen

SmolTalk Dataset description This is a synthetic dataset designed for supervised finetuning (SFT) of LLMs. It was used to build SmolLM2-Instruct family of models and contains 1M samples. More details in our paper https://arxiv.org/abs/2502.02737 During the development of SmolLM2, we observed that models finetuned on pu

Papers using SmolTalk (2)

SmolTalk dataset β€” papers, benchmarks & downloads Β· Large Language Models