nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 Text Generation • 303B • Updated 23 days ago • 329k • • 330
view article Article Unbelievable! Run 70B LLM Inference on a Single 4GB GPU with This NEW Technique lyogavin • Nov 30, 2023 • 49