-
inference-optimization/Llama-3.1-8B-Instruct-NVFP4
5B • Updated • 24 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-BlockSize16
5B • Updated • 12 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ
5B • Updated • 24 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-SmoothQuant
5B • Updated • 24
Inference Optimization
community
AI & ML interests
None defined yet.
Recent Activity
View all activity
Tiny models used for testing
-
inference-optimization/gemma-4-1B-0.8B-tiny
1B • Updated • 70 • 1 -
inference-optimization/DSV4-tiny-empty
3B • Updated • 2.81k -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 7.94k • 2 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 18.3k • 1
-
inference-optimization/Llama-3.1-8B-Instruct-NVFP4
5B • Updated • 24 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-BlockSize16
5B • Updated • 12 • 1 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ
5B • Updated • 24 -
inference-optimization/Llama-3.1-8B-Instruct-NVFP4-GPTQ-SmoothQuant
5B • Updated • 24
Tiny models used for testing
-
inference-optimization/gemma-4-1B-0.8B-tiny
1B • Updated • 70 • 1 -
inference-optimization/DSV4-tiny-empty
3B • Updated • 2.81k -
inference-optimization/Qwen3-1.6B-A0.9B
Text Generation • 2B • Updated • 7.94k • 2 -
inference-optimization/Llama-3.2-0.5B-Instruct
Text Generation • 0.5B • Updated • 18.3k • 1
models 281
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anc-qwen235b-instr-bs16-v3-avg121314
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anc-qwen235b-instr-bs16-v3-10ep-ckpt14
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anc-qwen235b-instr-bs16-v3-10ep-ckpt13
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anc-qwen235b-instr-bs16-v3-10ep-ckpt12
2B • Updated
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anc-qwen235b-instr-bs16-v3-10ep-ckpt11
2B • Updated
inference-optimization/Kimi-K3-0.40B-MXFP4
0.4B • Updated • 1 • 2
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anc-qwen235b-instr-bs16-v3-10ep-ckpt10
2B • Updated • 1
inference-optimization/Kimi-K3-0.40B-NVFP4
0.4B • Updated • 2 • 1
inference-optimization/Kimi-K3-0.40B
Feature Extraction • 0.4B • Updated • 24 • 25
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw.2048anc-qwen235b-instr-bs16-v3-10ep-ckpt9
2B • Updated • 16
datasets 28
inference-optimization/qwen3-test-model
Updated • 20
inference-optimization/dflash-qwen3-8b-qwen235b-instruct-bs16-prepared-data
Preview • Updated • 135
inference-optimization/every-eval-ever-demo
Viewer • Updated • 1 • 25
inference-optimization/DeepSeek-V4-Flash-responses
Viewer • Updated • 508k • 78
inference-optimization/Qwen3.5-4B-responses
Viewer • Updated • 7.47k • 51
inference-optimization/Qwen3.5-0.8B-responses
Viewer • Updated • 7.47k • 160
inference-optimization/Qwen3.5-9B-responses
Viewer • Updated • 7.67k • 80
inference-optimization/Qwen3-8B-Regenerated-Collection
Preview • Updated • 183
inference-optimization/Qwen3-30B-A3B-responses
Preview • Updated • 179
inference-optimization/gpt-oss-120b-responses
Preview • Updated • 130