DeepSeek merilis V4-Flash-Vision-Exp, model multimodal pertama di keluarga V4 yang bisa “melihat” screenshot, UI, dan chart. 305 miliar parameter. Lisensi MIT: siapapun bisa pakai gratis untuk komersial.
Ini bukan sekadar update fitur. V4-Flash-Vision-Exp adalah agent yang dirancang sejak awal untuk memahami visual, bukan model chat yang dipoles dengan tambahan gambar. DeepSeek menyebutnya “first native vision model” di lini V4.
Apa Itu DeepSeek V4 Vision
V4-Flash-Vision-Exp adalah model experimental yang menambahkan visual encoder ke atas arsitektur V4-Flash yang sudah ada. Basis teksnya tetap 284B parameter MoE (Mixture-of-Experts) dengan 13B aktif per token. Penambahan vision encoder dan aligner membawa total parameter menjadi sekitar 305B.
Bukan untuk chat sehari-hari. Target utamanya adalah agent yang perlu membaca screenshot antarmuka, menginterpretasi chart, atau memproses dokumen visual sebagai bagian dari workflow multi-step. DeepSeek merilis versi API pada 21 Agustus 2026, lalu membuka bobot ke publik pada 31 Agustus 2026. Komunitas Hugging Face langsung bergerak: konversi GGUF sudah tersedia, meski ukuran 155 GB di 4-bit artinya ini bukan proyek laptop.
Spesifikasi dan Benchmark
| Aspek | Detail |
|---|---|
| Total parameter | ~305B (284B teks + ~21B vision encoder & aligner) |
| Aktif per token | 13B (MoE) |
| Context window | 1.000.000 tokens |
| Lisensi | MIT |
| Harga API | $0,22 input / $0,66 output per juta token |
| Image token cap | 384 token per gambar |
| Arsitektur | MoE + DFlash attention + Hyper-Connections + DSpark |
Benchmark yang dilaporkan DeepSeek (self-reported via Harness Minimal Mode):
| Benchmark | V4-Flash-Vision-Exp | Opus-4.8 | Catatan |
|---|---|---|---|
| ApexBench (Pass@1) | 36,5 | 39,4 | Trail 2,9 poin |
| Agents’ Last Exam | 27,3 | 25,7 | Menang +1,6 poin |
| ZeroBench (Pass@5) | 35,0 | 34,0 | Menang +1 poin |
| DeepSWE | 59,3 | 58,0 | Menang +1,3 poin |
| Chartography | 64,3 | 65,0 | Trail 0,7 poin |
Catatan penting: DeepSeek menguji semua benchmark melalui Harness Minimal Mode milik sendiri, yang belum dipublikasikan secara terbuka. Angka-angka ini belum bisa direproduksi oleh pihak independen. Self-reported benchmarks selalu perlu sabar tunggu verifikasi.
Open-Source MIT vs Qwen Community License
DeepSeek memilih lisensi MIT. Tanpa syarat field-of-use, tanpa copyleft, tanpa pembatasan komersial. Download, host sendiri, fine-tune, distribusikan ulang. Sebebas itu.
Qwen (Alibaba) pakai Community License yang punya batasan untuk model-as-a-service dan penggunaan komersial skala besar. Beda jauh. Untuk developer Indonesia yang budget-nya terbatas tapi mau experiment dengan vision models, MIT bukan cuma opsi terbaik. Seringkali satu-satunya opsi yang realistis.
Perbandingan Harga: DeepSeek vs GPT-6 Astra
| Model | Input per M token | Output per M token | Selisih |
|---|---|---|---|
| DeepSeek V4 Vision | $0,22 | $0,66 | — |
| GPT-6 Astra | $10 | $50 | 45x lebih mahal |
DeepSeek 45 kali lebih murah dari GPT-6 Astra. Tapi harga per token bukan satu-satunya gambaran. GPT-6 Astra unggul di computer use dan browser use yang lebih matang. DeepSeek, di sisi lain, jadi pilihan jelas untuk batch processing dan document understanding di mana biaya jadi faktor utama.
Kapan Pakai DeepSeek, Kapan Pakai GPT-6
Kesalahan umum: pakai GPT-6 untuk semua tugas, padahal sebagian bisa dikerjakan DeepSeek dengan biaya 45x lebih rendah.
DeepSeek cocok untuk: batch processing ribuan dokumen, extract data dari chart atau screenshot, fine-tuning domain spesifik tanpa kirim data ke API pihak ketiga, inference di infrastructure sendiri.
GPT-6 Astra cocok untuk: real-time agent yang butuh computer use, tugas kompleks yang butuh reasoning depth tinggi, integrasi langsung dengan ekosistem OpenAI/AWS.
Prinsip dasarnya: biaya rendah dan toleransi latency, pakai DeepSeek. Kecepatan real-time dan kompleksitas tinggi, pakai GPT-6.
Tanya Jawab
Model multimodal experimental pertama dari DeepSeek V4 yang bisa memproses gambar dan teks bersamaan. Dirancang untuk agent yang butuh pemahaman visual, bukan chat biasa.
$0,22 per juta input tokens dan $0,66 per juta output tokens. Gambar dikenakan maksimal 384 token per gambar dengan rate yang sama.
Bobot model tersedia gratis di Hugging Face dengan lisensi MIT. Bisa di-host sendiri di GPU sendiri. Untuk inference via API, berlaku tarif di atas.
Menang di 3 dari 5 benchmark: Agents’ Last Exam (27,3 vs 25,7), ZeroBench (35,0 vs 34,0), dan DeepSWE (59,3 vs 58,0). Trail di ApexBench (36,5 vs 39,4) dan Chartography (64,3 vs 65,0).
Semua benchmark self-reported via Harness Minimal Mode yang belum publik. Perlu evaluasi independen untuk konfirmasi. Label “Exp” menandakan ini model experimental, bukan production-stable.
DeepSeek membuka akses multimodal ke publik dengan lisensi MIT, sesuatu yang setahun lalu masih mustahil dari model kelas 300B. Pertanyaannya bukan lagi “bisakah open-source menyaingi proprietary?” tapi “seberapa cepat gap-nya menyusut?” Label “Exp” dan benchmark yang belum terverifikasi independen mengingatkan: ini baru permulaan. Siapapun yang dismiss open-source vision models sekarang, mungkin perlu pikir ulang.
Baca Juga
- GPT-6 Astra dan AGI Era (konteks lengkap model frontier terbaru)