Skip to content

Membangun Agen AI Offline yang Mengutamakan Privasi (Qwen, DeepSeek, Llama)

Kode yang dikirim ke layanan AI cloud meninggalkan komputer Anda. Untuk basis kode proprietary, aplikasi kesehatan, atau sistem keuangan, hal ini dapat menjadi risiko. Dengan Ollama dan FlyEnv, model bahasa dapat berjalan sepenuhnya secara lokal tanpa penyiapan machine learning yang rumit.

Mengapa AI Offline

AspekAI cloudAI lokal dengan Ollama
Privasi dataDikirim ke pihak ketigaTetap di mesin Anda
InternetDiperlukanTidak diperlukan setelah model diunduh
BiayaBiaya langganan atau tokenTanpa biaya API
Kendali modelTerbatasPilih dan kelola model sendiri

Asisten lokal dapat menjawab pertanyaan coding, menjelaskan fungsi, membuat contoh kode, dan mereview perubahan tanpa mengirim isi proyek ke cloud.

Persyaratan

Ukuran modelRAM minimumCocok untuk
3B4 GBBantuan dasar
7B8 GBPengembangan umum
13B16 GBPenalaran lebih rumit
70B64 GB+Beban kerja besar

Gunakan 16 GB RAM atau lebih untuk pengalaman coding yang serbaguna dan sediakan sekitar 10 GB ruang disk bagi model.

Penyiapan Langkah demi Langkah

1. Pasang Ollama

Pada FlyEnv, buka modul Ollama lalu klik Install. Ollama dipasang sebagai layanan native tanpa kontainer dan tanpa environment Python tambahan.

Pemasangan Ollama

2. Jalankan Layanan

Klik Start pada modul Ollama. API akan tersedia pada http://127.0.0.1:11434.

Layanan Ollama

3. Unduh Model

Pada tab Models, pilih model dan klik Pull. Mulailah dengan model 7B untuk mesin 16 GB RAM.

ModelKekuatan umum
DeepSeek-R1Pembuatan kode dan penalaran
Llama 3.3Tugas umum yang seimbang
Qwen 2.5Multibahasa dan coding
Phi-4Model riset Microsoft
MixtralModel mixture-of-experts

Pemasangan model

4. Aktifkan Asisten AI

Pada FlyEnv Settings, aktifkan AI Assistant. Buka ikon asisten di kanan bawah, masuk ke pengaturan, lalu gunakan API URL http://127.0.0.1:11434 dan pilih model yang sudah dipasang.

Pengaturan Asisten AI

Menggunakannya untuk Pengembangan

Gunakan asisten untuk menjelaskan kode, membuat boilerplate, mereview fungsi, atau membantu belajar:

text
Jelaskan query Laravel Eloquent ini.
Tulis controller NestJS untuk CRUD pengguna.
Review fungsi ini untuk masalah keamanan.
Ajarkan dependency injection pada PHP.

Gunakan preset Role seperti Code Reviewer, Teacher, Architect, atau Debugger. Anda juga dapat membuat prompt peran sendiri untuk pola proyek tertentu.

Optimasi Performa

Pilih ukuran model sesuai tugas: model kecil untuk pertanyaan cepat, model 7B untuk coding sehari-hari, dan model lebih besar untuk review atau arsitektur. Ollama menggunakan akselerasi GPU bila tersedia. Untuk mengelola ruang disk:

bash
ollama rm llama2:13b
ollama list

Pertanyaan Umum

T: Apakah benar-benar offline?

J: Ya. Setelah model diunduh, pemrosesan tidak membutuhkan internet dan data tidak meninggalkan komputer Anda.

T: Dapatkah model fine-tuned dipakai?

J: Ollama mendukung model berformat GGUF; simpan pada direktori model Ollama sesuai dokumentasinya.

T: Mengapa kualitasnya tidak selalu seperti ChatGPT?

J: Model lokal kecil memiliki parameter lebih sedikit. Model 13B hingga 70B biasanya memberi hasil lebih baik tetapi membutuhkan memori lebih besar.

Alur Kerja yang Mengutamakan Privasi

Gunakan AI lokal untuk kode proprietary dan pekerjaan klien. Untuk proyek open source, Anda dapat memilih AI lokal atau cloud berdasarkan kebutuhan. Tinjau lisensi model sebelum penggunaan komersial.

Langkah Berikutnya