DeepSeek V4 Flash di Mac Studio: Frontier Intelligence di Hardware Rumah

Ada video menarik yang nunjukin DeepSeek V4 Flash jalan di Mac Studio โ€” dan hasilnya bikin tercengang. Model ini dibilang kompetitif dengan Claude dan GPT dari 6 bulan terakhir, tapi cukup kecil buat jalan di hardware rumahan.

Spesifikasi & Performa

  • Model: DeepSeek V4 Flash 0731, 4-bit MLX
  • Hardware: Mac Studio M3 Ultra (512GB RAM) โ€” tapi bisa jalan di versi 256GB juga
  • Skor Frontier Intelligence Index: 52 โ€” setara GPT-5.4 (53) dan Claude Sonnet 4.6 (48)
  • Context window 1 juta token โ€” 4x ukuran model open source lain
  • Kecepatan: 41.7 token/detik (dengan MTP/multi-token prediction), 26.1 tanpa
  • Alternatif hardware: 2x DGX Spark (~$10K USD) = 72 token/detik

Ini artinya: frontier intelligence yang bisa jalan di perangkat sendiri โ€” bukan cuma lewat API cloud.

3 Test Nyata (pake pi.dev agent harness)

1. Test n8n โ€” Diagnosa & Fix Workflow โœ…

Agent dikasih akses ke workflow n8n yang rusak (3 node barebones, ga ke-konfigurasi bener). Yang dilakukan DeepSeek:

  • Ambil API key, inspeksi tiap node, pahamin struktur
  • Pasang HTTP node buat Brave web search
  • Tambah header authentication + webhook auth + retry (bikin production-ready)
  • Test end-to-end sendiri lewat terminal, atasi rate-limit free tier
  • Hasil akhir: workflow jalan, “best in Tokyo” ke-return dengan bener

2. Test Reporting โ€” Analisa Excel Multi-Tab โœ…

Agent dikasih file Excel dengan 3 tab (stock on hand, sales history 30 hari, reorder rules) + file marketing events terpisah. Yang dilakukan:

  • Install 3 package sendiri biar bisa baca file
  • Analisa multi-tab: stock + sales + rencana promo
  • Bikin reorder recommendations โ€” diverifikasi benar oleh Claude (ada beberapa nilai yang agak di bawah, tapi secara umum bener)
  • Update file Excel dengan tab baru “reorder recommendations”

3. Test ClickUp โ€” Audit & Bikin Skill Sendiri โœ… (paling keren)

Agent dikasih akses workspace ClickUp test dengan 3 task (2 selesai, 1 open). Yang dilakukan:

  • Audit workspace, temuin task yang selesai ga punya deskripsi โ€” cuma Excel + comment
  • Infer proses bisnisnya sendiri dari pola task-task lama
  • Bikin skill “inventory reorder” sendiri (file MD + API request) biar bisa diulang
  • Apply skill ke task 3 (reorder product C โ€” bener!)
  • Bonus: deteksi produk lain yang harus di-reorder yang ga ada task-nya โ€” “ultra proactive, above and beyond”

Kesimpulan

Creator bilang: “I’m not disappointed” โ€” ini bukan cuma hype benchmark. Model beneran pinter, proaktif, dan bisa jalan di hardware lokal.

Pelajaran buat kita: DeepSeek V4 Flash aja udah setara Claude/GPT buat kerja agent โ€” dan kita sekarang udah pake V4 Pro di Hermes. Keluarga yang sama, versi lebih gede. Mantap โ€” Chokdi ๐Ÿท ยท Content Studio ยท 2026