Colibri itu apa
Colibri adalah inference engine (mesin buat menjalankan model AI) yang ditulis murni pakai bahasa C, tanpa dependency apa-apa. Binary-nya cuma beberapa ratus KB. Klaim utamanya berani: menjalankan model Mixture-of-Experts (MoE) frontier, dari 744 miliar sampai 2,8 triliun parameter, di hardware consumer, bukan lewat cloud, tapi di mesin yang kamu punya sendiri.
Kenapa MoE penting di sini? Model MoE itu gede secara total, tapi tiap memproses satu token dia cuma mengaktifkan sebagian kecil “expert”-nya. Contohnya GLM-5.2: total 744B parameter, tapi yang aktif per token cuma sekitar 40B, dan dari situ yang benar-benar berubah tiap token cuma sekitar 11 GB (bagian routed expert). Celah inilah yang dieksploitasi Colibri.
Idenya: memori itu bertingkat, bukan satu kolam
Inference engine biasa maksa seluruh model muat di memori cepat (VRAM atau RAM). Colibri nggak. Dia memperlakukan VRAM, RAM, dan storage (SSD) sebagai satu hierarki bertingkat.
Bagian yang padat dan sering kepakai (attention, shared expert, embedding) disimpan permanen di RAM dalam bentuk terkuantisasi int4. Sementara routed expert yang jumlahnya ribuan dan cuma kepakai sesekali disimpan di disk, lalu di-stream saat dibutuhkan. Jadi model 372 GB nggak perlu muat semua di RAM sekaligus.
Kayak JIT, tapi buat bobot model
Colibri menggambarkan dirinya seperti “JIT, tapi untuk weight”. Alih-alih menahan semua parameter di memori, dia memantau expert mana yang benar-benar sering jalan, terus menaikkan expert “panas” itu ke tier memori yang lebih cepat berdasarkan pola routing yang terukur. Makin lama dipakai, dia makin ngerti bagian mana yang perlu didekatkan.
Biar streaming dari disk nggak jadi bottleneck, Colibri nge-batch pembacaan expert dan meng-overlap I/O dengan komputasi. Bahkan ada dukungan dual-SSD: tiap expert diarahkan ke salah satu drive lewat hash deterministik yang ditimbang sesuai bandwidth masing-masing drive, jadi bisa baca dari dua drive sekaligus. Klaimnya, ini menambah kecepatan sekitar 33%.
Model apa aja yang didukung
Colibri mendukung sembilan keluarga model, tiap model satu file C, dengan front-end yang sama (coli chat / coli serve / coli web). Beberapa di antaranya:
- GLM-5.2 / 5.3 (744B / 419B)
- GLM-5.3-Flash dengan vision (321B)
- Inkling (975B)
- Kimi K3 (2,8T)
- DeepSeek V4 / V4.1 Flash (284B / 552B)
- Qwen3.8-Flash-Next (125B + 51B n-gram)
- Qwen3.6 (35B)
- OLMoE (7B)
Catatan: sebagian nama model di atas adalah yang diklaim didukung oleh proyeknya sendiri, jadi cek langsung ke repo buat status terbarunya.
Realistis nggak? Ini angkanya
Di sini Colibri patut dipuji karena jujur. Mereka publish “tangga pengukuran” di hardware nyata, bukan cuma microbenchmark. Contoh buat GLM-5.2 (744B):
- 6x RTX 5090 (semua muat di memori): 5,8 sampai 6,8 token/detik
- CPU-only dengan RAM 128 GB: sekitar 1,8 token/detik (warm)
- Satu RTX 5070 Ti: 1,07 token/detik
- Box minimal 25 GB: 0,05 sampai 0,1 token/detik (cold)
Jadi harus jelas: “bisa jalan” nggak sama dengan “enak dipakai”. Di setup paling minimal, 0,05 token/detik itu artinya nunggu belasan detik buat satu kata. Tapi poinnya memang bukan kecepatan, poinnya adalah kamu benar-benar bisa menjalankan model sebesar ini di mesin yang harganya jauh di bawah harga cluster GPU.
Yang kamu butuhin
Buat GLM-5.2 sebagai contoh:
- Disk: sekitar 372 GB buat menyimpan bobot int4 (convert sendiri dari sumber, atau download versi yang sudah dikonversi)
- RAM: minimum 16 GB, nyaman di 24 GB
- GPU: opsional, semua model bisa jalan CPU-only
- Binary: prebuilt buat Linux, macOS, atau Windows, plus Python 3 buat launcher-nya
Model lain beda-beda kebutuhannya: Qwen3.6 (35B) butuh 24 GB RAM penuh, sedangkan OLMoE (7B) cukup 8 GB.
Fitur menarik lainnya
- Brio mode: alih-alih menghasilkan teks, dia menilai sekumpulan pilihan tertutup dan mengembalikan probabilitas plus entropi. Berguna buat soal pilihan ganda atau klasifikasi.
- Expert Atlas: peta visual 13.260 expert di GLM-5.2, dikelompokkan ke sepuluh wilayah spesialisasi (Python, SQL, matematika, puisi, hukum, bahasa Mandarin, dan lain-lain) berdasarkan afinitas routing yang terukur.
- Speculative decoding: prediksi multi-token dan draft yang dipaksa grammar, tapi dengan syarat harus terbukti mempercepat lewat pengukuran nyata.
Buat siapa ini?
Colibri jelas bukan buat semua orang. Kalau kamu cuma butuh chatbot cepat, pakai API cloud atau model kecil lokal jauh lebih masuk akal (kami pernah bahas model LLM yang pas per kelas RAM).
Tapi Colibri menarik kalau kamu butuh privasi total (semua jalan lokal), mau eksperimen dengan model frontier tanpa bayar cloud, atau memang penasaran secara teknis gimana caranya model triliunan parameter bisa “dipaksa” jalan di SSD.
Yang paling menarik justru filosofinya. Colibri menolak klaim tanpa bukti: tidak ada yang dipertahankan hanya karena konvensional, dan tidak ada yang diadopsi hanya karena satu microbenchmark terlihat cepat. Semua optimasi harus terbukti lewat inference end-to-end di mesin nyata. Repo-nya open source di GitHub (JustVugg/colibri).
Butuh AI yang jalan di infrastruktur sendiri?
Kalau bisnismu butuh AI yang privat dan jalan lokal (on-prem), kami bisa bantu memilih model yang pas dan memasangnya biar benar-benar kepakai. Ceritain kebutuhanmu.
ngobrol sama kami →