AI

DeepSeek V4 Vision: Model Multimodal Open-Source Pertama dengan Lisensi MIT

DeepSeek V4-Flash-Vision-Exp: model multimodal 305B, lisensi MIT, benchmark dekat Opus-4.8. Harga 45x lebih murah dari GPT-6 Astra.
06 Sep 2026 Dimas 3 min read

DeepSeek merilis V4-Flash-Vision-Exp, model multimodal pertama di keluarga V4 yang bisa “melihat” screenshot, UI, dan chart. 305 miliar parameter. Lisensi MIT: siapapun bisa pakai gratis untuk komersial.

Ini bukan sekadar update fitur. V4-Flash-Vision-Exp adalah agent yang dirancang sejak awal untuk memahami visual, bukan model chat yang dipoles dengan tambahan gambar. DeepSeek menyebutnya “first native vision model” di lini V4.

Apa Itu DeepSeek V4 Vision

V4-Flash-Vision-Exp adalah model experimental yang menambahkan visual encoder ke atas arsitektur V4-Flash yang sudah ada. Basis teksnya tetap 284B parameter MoE (Mixture-of-Experts) dengan 13B aktif per token. Penambahan vision encoder dan aligner membawa total parameter menjadi sekitar 305B.

Bukan untuk chat sehari-hari. Target utamanya adalah agent yang perlu membaca screenshot antarmuka, menginterpretasi chart, atau memproses dokumen visual sebagai bagian dari workflow multi-step. DeepSeek merilis versi API pada 21 Agustus 2026, lalu membuka bobot ke publik pada 31 Agustus 2026. Komunitas Hugging Face langsung bergerak: konversi GGUF sudah tersedia, meski ukuran 155 GB di 4-bit artinya ini bukan proyek laptop.

Spesifikasi dan Benchmark

AspekDetail
Total parameter~305B (284B teks + ~21B vision encoder & aligner)
Aktif per token13B (MoE)
Context window1.000.000 tokens
LisensiMIT
Harga API$0,22 input / $0,66 output per juta token
Image token cap384 token per gambar
ArsitekturMoE + DFlash attention + Hyper-Connections + DSpark

Benchmark yang dilaporkan DeepSeek (self-reported via Harness Minimal Mode):

BenchmarkV4-Flash-Vision-ExpOpus-4.8Catatan
ApexBench (Pass@1)36,539,4Trail 2,9 poin
Agents’ Last Exam27,325,7Menang +1,6 poin
ZeroBench (Pass@5)35,034,0Menang +1 poin
DeepSWE59,358,0Menang +1,3 poin
Chartography64,365,0Trail 0,7 poin

Catatan penting: DeepSeek menguji semua benchmark melalui Harness Minimal Mode milik sendiri, yang belum dipublikasikan secara terbuka. Angka-angka ini belum bisa direproduksi oleh pihak independen. Self-reported benchmarks selalu perlu sabar tunggu verifikasi.

Open-Source MIT vs Qwen Community License

DeepSeek memilih lisensi MIT. Tanpa syarat field-of-use, tanpa copyleft, tanpa pembatasan komersial. Download, host sendiri, fine-tune, distribusikan ulang. Sebebas itu.

Qwen (Alibaba) pakai Community License yang punya batasan untuk model-as-a-service dan penggunaan komersial skala besar. Beda jauh. Untuk developer Indonesia yang budget-nya terbatas tapi mau experiment dengan vision models, MIT bukan cuma opsi terbaik. Seringkali satu-satunya opsi yang realistis.

Perbandingan Harga: DeepSeek vs GPT-6 Astra

ModelInput per M tokenOutput per M tokenSelisih
DeepSeek V4 Vision$0,22$0,66
GPT-6 Astra$10$5045x lebih mahal

DeepSeek 45 kali lebih murah dari GPT-6 Astra. Tapi harga per token bukan satu-satunya gambaran. GPT-6 Astra unggul di computer use dan browser use yang lebih matang. DeepSeek, di sisi lain, jadi pilihan jelas untuk batch processing dan document understanding di mana biaya jadi faktor utama.

Kapan Pakai DeepSeek, Kapan Pakai GPT-6

Kesalahan umum: pakai GPT-6 untuk semua tugas, padahal sebagian bisa dikerjakan DeepSeek dengan biaya 45x lebih rendah.

DeepSeek cocok untuk: batch processing ribuan dokumen, extract data dari chart atau screenshot, fine-tuning domain spesifik tanpa kirim data ke API pihak ketiga, inference di infrastructure sendiri.

GPT-6 Astra cocok untuk: real-time agent yang butuh computer use, tugas kompleks yang butuh reasoning depth tinggi, integrasi langsung dengan ekosistem OpenAI/AWS.

Prinsip dasarnya: biaya rendah dan toleransi latency, pakai DeepSeek. Kecepatan real-time dan kompleksitas tinggi, pakai GPT-6.

Tanya Jawab

Apa itu DeepSeek V4-Flash-Vision-Exp?

Model multimodal experimental pertama dari DeepSeek V4 yang bisa memproses gambar dan teks bersamaan. Dirancang untuk agent yang butuh pemahaman visual, bukan chat biasa.

Berapa harga API DeepSeek V4 Vision?

$0,22 per juta input tokens dan $0,66 per juta output tokens. Gambar dikenakan maksimal 384 token per gambar dengan rate yang sama.

Apakah DeepSeek V4 Vision bisa dipakai gratis?

Bobot model tersedia gratis di Hugging Face dengan lisensi MIT. Bisa di-host sendiri di GPU sendiri. Untuk inference via API, berlaku tarif di atas.

Bagaimana performa DeepSeek V4 Vision dibanding Opus-4.8?

Menang di 3 dari 5 benchmark: Agents’ Last Exam (27,3 vs 25,7), ZeroBench (35,0 vs 34,0), dan DeepSWE (59,3 vs 58,0). Trail di ApexBench (36,5 vs 39,4) dan Chartography (64,3 vs 65,0).

Apakah benchmark DeepSeek bisa dipercaya?

Semua benchmark self-reported via Harness Minimal Mode yang belum publik. Perlu evaluasi independen untuk konfirmasi. Label “Exp” menandakan ini model experimental, bukan production-stable.

DeepSeek membuka akses multimodal ke publik dengan lisensi MIT, sesuatu yang setahun lalu masih mustahil dari model kelas 300B. Pertanyaannya bukan lagi “bisakah open-source menyaingi proprietary?” tapi “seberapa cepat gap-nya menyusut?” Label “Exp” dan benchmark yang belum terverifikasi independen mengingatkan: ini baru permulaan. Siapapun yang dismiss open-source vision models sekarang, mungkin perlu pikir ulang.

Baca Juga

Dimas Tarich W

Media Strategy & Content Operations at Spacyon.com. Agentic AI & Digital Marketing Enthusiast.