Colibri itu apa

Colibri adalah inference engine (mesin buat menjalankan model AI) yang ditulis murni pakai bahasa C, tanpa dependency apa-apa. Binary-nya cuma beberapa ratus KB. Klaim utamanya berani: menjalankan model Mixture-of-Experts (MoE) frontier, dari 744 miliar sampai 2,8 triliun parameter, di hardware consumer, bukan lewat cloud, tapi di mesin yang kamu punya sendiri.

Kenapa MoE penting di sini? Model MoE itu gede secara total, tapi tiap memproses satu token dia cuma mengaktifkan sebagian kecil “expert”-nya. Contohnya GLM-5.2: total 744B parameter, tapi yang aktif per token cuma sekitar 40B, dan dari situ yang benar-benar berubah tiap token cuma sekitar 11 GB (bagian routed expert). Celah inilah yang dieksploitasi Colibri.

Idenya: memori itu bertingkat, bukan satu kolam

Inference engine biasa maksa seluruh model muat di memori cepat (VRAM atau RAM). Colibri nggak. Dia memperlakukan VRAM, RAM, dan storage (SSD) sebagai satu hierarki bertingkat.

Bagian yang padat dan sering kepakai (attention, shared expert, embedding) disimpan permanen di RAM dalam bentuk terkuantisasi int4. Sementara routed expert yang jumlahnya ribuan dan cuma kepakai sesekali disimpan di disk, lalu di-stream saat dibutuhkan. Jadi model 372 GB nggak perlu muat semua di RAM sekaligus.

Kayak JIT, tapi buat bobot model

Colibri menggambarkan dirinya seperti “JIT, tapi untuk weight”. Alih-alih menahan semua parameter di memori, dia memantau expert mana yang benar-benar sering jalan, terus menaikkan expert “panas” itu ke tier memori yang lebih cepat berdasarkan pola routing yang terukur. Makin lama dipakai, dia makin ngerti bagian mana yang perlu didekatkan.

Biar streaming dari disk nggak jadi bottleneck, Colibri nge-batch pembacaan expert dan meng-overlap I/O dengan komputasi. Bahkan ada dukungan dual-SSD: tiap expert diarahkan ke salah satu drive lewat hash deterministik yang ditimbang sesuai bandwidth masing-masing drive, jadi bisa baca dari dua drive sekaligus. Klaimnya, ini menambah kecepatan sekitar 33%.

Model apa aja yang didukung

Colibri mendukung sembilan keluarga model, tiap model satu file C, dengan front-end yang sama (coli chat / coli serve / coli web). Beberapa di antaranya:

Catatan: sebagian nama model di atas adalah yang diklaim didukung oleh proyeknya sendiri, jadi cek langsung ke repo buat status terbarunya.

Realistis nggak? Ini angkanya

Di sini Colibri patut dipuji karena jujur. Mereka publish “tangga pengukuran” di hardware nyata, bukan cuma microbenchmark. Contoh buat GLM-5.2 (744B):

Jadi harus jelas: “bisa jalan” nggak sama dengan “enak dipakai”. Di setup paling minimal, 0,05 token/detik itu artinya nunggu belasan detik buat satu kata. Tapi poinnya memang bukan kecepatan, poinnya adalah kamu benar-benar bisa menjalankan model sebesar ini di mesin yang harganya jauh di bawah harga cluster GPU.

Yang kamu butuhin

Buat GLM-5.2 sebagai contoh:

Model lain beda-beda kebutuhannya: Qwen3.6 (35B) butuh 24 GB RAM penuh, sedangkan OLMoE (7B) cukup 8 GB.

Fitur menarik lainnya

Buat siapa ini?

Colibri jelas bukan buat semua orang. Kalau kamu cuma butuh chatbot cepat, pakai API cloud atau model kecil lokal jauh lebih masuk akal (kami pernah bahas model LLM yang pas per kelas RAM).

Tapi Colibri menarik kalau kamu butuh privasi total (semua jalan lokal), mau eksperimen dengan model frontier tanpa bayar cloud, atau memang penasaran secara teknis gimana caranya model triliunan parameter bisa “dipaksa” jalan di SSD.

Yang paling menarik justru filosofinya. Colibri menolak klaim tanpa bukti: tidak ada yang dipertahankan hanya karena konvensional, dan tidak ada yang diadopsi hanya karena satu microbenchmark terlihat cepat. Semua optimasi harus terbukti lewat inference end-to-end di mesin nyata. Repo-nya open source di GitHub (JustVugg/colibri).

Butuh AI yang jalan di infrastruktur sendiri?

Kalau bisnismu butuh AI yang privat dan jalan lokal (on-prem), kami bisa bantu memilih model yang pas dan memasangnya biar benar-benar kepakai. Ceritain kebutuhanmu.

ngobrol sama kami →