nm-testing/SparseLlama-3.1-8B-gsm8k-pruned.2of4-FP8
8B • Updated • 5
nm-testing/SparseLlama-3.1-8B-gsm8k-pruned.2of4-quantized.w8a8
8B • Updated • 9
nm-testing/TinyLlama-1.1B-Chat-v1.0-pruned_50.2of4-uncompressed
1B • Updated • 6
nm-testing/SparseLlama-3-8B-pruned_50.2of4_Fp8-compressed
5B • Updated • 8
nm-testing/Phi-3.5-vision-instruct-W8A8-Dynamic-Per-Token
4B • Updated • 66
nm-testing/Phi-3.5-vision-instruct-FP8-dynamic
4B • Updated • 824
nm-testing/MiniCPM-V-2_6-FP8-dynamic
8B • Updated • 10
nm-testing/llama1.1b_0.5_sparse_bitmask
Text Generation
• 0.8B • Updated • 10
nm-testing/llama7b-one-shot-2_4-w4a16-packed
Text Generation
• 1B • Updated • 6
nm-testing/tinyllama-one-shot-w4a16-group128-packed
Text Generation
• 0.3B • Updated • 14
nm-testing/tinyllama-one-shot-w4a16-channel-packed
Text Generation
• 0.3B • Updated • 8
nm-testing/tinyllama-one-shot-w4a16-channel-compressed
Text Generation
• 1B • Updated • 6
nm-testing/tinyllama-one-shot-dynamic-test
Text Generation
• 1B • Updated • 35
nm-testing/tinyllama-one-shot-static-quant-test-compressed
Text Generation
• 1B • Updated • 79
nm-testing/asym-w8w8-int8-static-per-tensor-tiny-llama
1B • Updated • 5.12k
nm-testing/OLMoE-1B-7B-0924-Instruct-FP8
7B • Updated • 287
nm-testing/DeepSeek-Coder-V2-Lite-Instruct-W8A8
16B • Updated • 21
nm-testing/tinyllama-w8a8-compressed
1B • Updated • 1.72k
nm-testing/tinyllama-w4a16-compressed
1B • Updated • 2.2k
nm-testing/tinyllama-fp8-dynamic-compressed
1B • Updated • 902
nm-testing/Meta-Llama-3-8B-Instruct-fp8-compressed
8B • Updated • 7
nm-testing/tinyllama-one-shot-w4a16-group-compressed
Text Generation
• 1B • Updated • 7
nm-testing/deepseekv2-lite-awq
16B • Updated • 50
• 1
nm-testing/Meta-Llama-3-8B-Instruct-fp8-hf_compat
8B • Updated • 18
nm-testing/Meta-Llama-3-70B-Instruct-FBGEMM-nonuniform
Text Generation
• 71B • Updated • 1.76k
• 1
nm-testing/Meta-Llama-3-8B-Instruct-FBGEMM-nonuniform
Text Generation
• 8B • Updated • 8
nm-testing/llama-3-8b-instruct-fbgemm-test-model
Text Generation
• 8B • Updated • 14