Target one 80 GB device, a 128 GB DGX Spark, or a validated tensor-parallel host.
- Model size
- 117B / 5.1B active · 128K max
- Model format
- MXFP4
- Runs with
- vLLM / TensorRT-LLM
Target one 80 GB device, a 128 GB DGX Spark, or a validated tensor-parallel host.