Skip to content
mlx.app

M3 · 8 GB

100 GB/s memory bandwidth · 5.6 GB usable for models · 2.4 GB left to macOS

The short answer

12 models run comfortably and 4 more will run tight at 8K context. The largest that fits is InternVL3 8B at q4, generating around 16.2 tokens per second.

macOS2.4 GBweights4.5 GBKV cache0.0 GBheadroom1.1 GB

Every model on this Mac

ModelSizeBest quantVerdictSpeed est.
Qwen2.5 0.5B Instruct490Mbf16FITS · 4.5 GB FREE74.5 tok/s
BGE-M3567Mbf16FITS · 4.5 GB FREE64.4 tok/s
Qwen3 0.6B600Mbf16FITS · 3.5 GB FREE60.8 tok/s
Parakeet TDT 0.6B v2600Mbf16FITS · 4.4 GB FREE60.8 tok/s
Llama 3.2 1B Instruct1.2Bbf16FITS · 2.9 GB FREE29.4 tok/s
Whisper Large v31.6Bbf16FITS · 2.5 GB FREE23.5 tok/s
Qwen3 1.7B1.7Bbf16FITS · 1.3 GB FREE21.5 tok/s
Llama 3.2 3B Instruct3.2Bq8FITS · 1.7 GB FREE21.4 tok/s
Qwen3 4B4Bq6FITS · 1.1 GB FREE22.5 tok/s
Qwen3 Embedding 4B4Bq4FITS · 2.1 GB FREE32.4 tok/s
Mistral 7B Instruct v0.37.3Bq4TIGHT · 0.4 GB FREE17.8 tok/s
Qwen2.5 7B Instruct7.6Bq4FITS · 0.9 GB FREE17.1 tok/s
InternVL3 8B8Bq4FITS · 1.1 GB FREE16.2 tok/s
Llama 3.1 8B Instruct8.0Bq4TIGHT · 0.0 GB FREE16.2 tok/s
Qwen3 8B8.2BOVER
Qwen2.5-VL 7B Instruct8.3Bq4TIGHT · 0.5 GB FREE15.6 tok/s
Gemma 2 9B IT9.2Bq4TIGHT · 0.4 GB FREE14.0 tok/s
Llama 3.2 11B Vision Instruct10.7BOVER
Qwen2.5 14B Instruct14.7BOVER
Qwen3 14B14.8BOVER
GPT-OSS 20B21BOVER
Codestral 22B v0.122.2BOVER
Mistral Small 24B Instruct 250124BOVER
Gemma 3 27B IT27BOVER
Gemma 2 27B IT27.2BOVER
Qwen3 30B-A3B Instruct 250730.5BOVER
Qwen3 Coder 30B-A3B Instruct30.5BOVER
Qwen2.5 32B Instruct32.5BOVER
Qwen2.5 Coder 32B Instruct32.5BOVER
DeepSeek R1 Distill Qwen 32B32.5BOVER
Qwen3 32B32.8BOVER
Qwen2.5-VL 32B Instruct33BOVER
Mixtral 8x7B Instruct v0.146.7BOVER
Llama 3.3 70B Instruct70.6BOVER
Qwen2.5 72B Instruct72.7BOVER
Llama 3.2 90B Vision Instruct88BOVER
GPT-OSS 120B116.8BOVER
Qwen3 235B-A22B235BOVER
DeepSeek V3671BOVER