DeepSeek-R1-Distill-Llama-70B
DeepSeek · 2025-01-20 · 70.6B parameters
DeepSeek-R1-Distill-Llama-70B is a dense reasoning checkpoint fine-tuned from Llama-3.3-70B-Instruct using reasoning data generated by DeepSeek-R1 and released January 20, 2025. Its released configuration declares a 131,072-token maximum via Llama 3 RoPE scaling from an original 8,192-position setting, while tokenizer_config.json separately sets model_max_length to 16,384.