-
inference-optimization/Llama-3.1-8B-Instruct-NVFP4
5B • Updated • 24 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-BlockSize16
5B • Updated • 12 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ
5B • Updated • 24 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-SmoothQuant
5B • Updated • 24
Inference Optimization
community
AI & ML interests
None defined yet.
Recent Activity
View all activity
-
inference-optimization/Llama-3.1-8B-Instruct-NVFP4
5B • Updated • 24 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-BlockSize16
5B • Updated • 12 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ
5B • Updated • 24 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-SmoothQuant
5B • Updated • 24
Tiny models used for testing
models 260
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anchors-qwen235b-instruct-bs16-v3-ckpt5
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anchors-qwen235b-instruct-bs16-v3-ckpt4
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anchors-qwen235b-instruct-bs16-v3-ckpt3
2B • Updated • 12
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anchors-qwen235b-instruct-bs16-v3-ckpt2
2B • Updated • 16
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anchors-qwen235b-instruct-bs16-v3-ckpt1
2B • Updated • 15
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anchors-qwen235b-instruct-bs16-v3-ckpt0
2B • Updated • 18
inference-optimization/tmp-max-anchors-ablation-2048
2B • Updated • 21
inference-optimization/tmp-max-anchors-ablation-1536
2B • Updated • 18
inference-optimization/tmp-max-anchors-ablation-1024
2B • Updated • 15
inference-optimization/tmp-max-anchors-ablation-512
2B • Updated • 18
datasets 28
inference-optimization/qwen3-test-model
Updated • 20
inference-optimization/dflash-qwen3-8b-qwen235b-instruct-bs16-prepared-data
Preview • Updated • 134
inference-optimization/every-eval-ever-demo
Viewer • Updated • 1 • 25
inference-optimization/DeepSeek-V4-Flash-responses
Viewer • Updated • 508k • 81
inference-optimization/Qwen3.5-4B-responses
Viewer • Updated • 7.47k • 43
inference-optimization/Qwen3.5-0.8B-responses
Viewer • Updated • 7.47k • 149
inference-optimization/Qwen3.5-9B-responses
Viewer • Updated • 7.67k • 81
inference-optimization/Qwen3-8B-Regenerated-Collection
Preview • Updated • 191
inference-optimization/Qwen3-30B-A3B-responses
Preview • Updated • 97
inference-optimization/gpt-oss-120b-responses
Preview • Updated • 127