Dari teori ke praktik โ panduan hands-on untuk benar-benar paham AI
Biar makin paham konteksnya, ini garis waktu perjalanan AI dari lahir sampai sekarang. Setiap momen penting yang membentuk AI seperti yang kamu pakai hari ini.
AI bukan barang instan โ perjalanan 80+ tahun dari neuron matematika ke model yang kamu pakai sekarang. Transformer (2017) adalah titik balik paling penting. Semua model modern adalah transformer dengan skala yang makin gede.
Ini step paling fundamental. Dengan jalanin model di komputer sendiri, kamu ngerti gimana token diproses, loading model, memory usage, dan latency โ tanpa bayar API. Mac Mini kamu cocok banget untuk ini.
Dua cara โ pilih salah satu:
Atau download Ollama.dmg dari ollama.com
Dirilis 23 Juli 2026 โ kemarin! Update rutin semingguan sekali.
Backend: llama.cpp โ optimized untuk Mac (Metal/ARM NEON).
Dari Ollama Library per Juli 2026:
gemma4 qwen3.5 qwen3.6 deepseek-v4-flash deepseek-v4-pro nemotron-3-super glm-5.2 kimi-k2.6 minimax-m3 granite4.1
| Model | Parameter | Size | RAM Req | Mac Mini? |
|---|---|---|---|---|
| gemma4 | 2B | ~1.5 GB | 4 GB | โ Lancar |
| qwen3.5:1.7b | 1.7B | ~1.2 GB | 4 GB | โ Lancar |
| llama3.2:3b | 3B | ~2 GB | 4 GB | โ Lancar |
| deepseek-v4-flash | ~7B | ~4.5 GB | 8 GB | โ Cocok |
| mistral:7b | 7B | ~4.5 GB | 8 GB | โ Cocok |
| nemotron-3-super | 8B | ~5 GB | 8 GB | โ Cocok |
| deepseek-v4-pro | ~27B | ~16 GB | 24 GB | โ ๏ธ Mungkin |
| llama3:70b | 70B | ~40 GB | 48 GB | โ Server |
Mulai dari gemma4 (2B โ paling ringan & modern) atau deepseek-v4-flash (7B โ kualitas tinggi, model yg kamu pakai sekarang). Ollama juga punya integrasi langsung ke Claude Code, Codex, Hermes Agent via ollama launch claude/codex.
Dirilis 23 Juli 2026 โ tadi malam! Update super aktif (nyaris tiap hari).
โ
C/C++ murni โ zero dependency
โ
Apple silicon first-class (Metal, ARM NEON, Accelerate)
โ
Quantization: 1.5-bit sampai 8-bit
โ
Bisa jalan di CPU aja (gak perlu GPU)
โ
llama-server: OpenAI-compatible API built-in
Jalanin model besar tanpa GPU lokal:
Ollama = wrapper yang lebih user-friendly. llama.cpp = engine murni, lebih banyak kontrol, update lebih cepat. Ollama pake llama.cpp sebagai backend. Untuk belajar, mulai dari Ollama dulu.
Token = mata uang AI. Semua yang kamu bayar (API cost), semua yang model "lihat", semuanya diukur dalam token. Paham tokenizer = paham kenapa prompt tertentu boros atau hemat.
Model AI tidak melihat teks seperti manusia. Mereka melihat angka. Tokenizer adalah jembatan antara teks dan angka.
Metode tokenizer paling populer. Cara kerja:
Hasil: kata umum jadi 1 token, kata jarang terpecah.
| GPT-4o / GPT-5 | o200k_base |
| GPT-3.5 / GPT-4 | cl100k_base |
| Claude models | Custom BPE |
| DeepSeek | Custom BPE |
| Llama 3+ | tiktoken-based |
๐ Rata-rata: 1 token โ 4 karakter (Bahasa Inggris)
๐ Bahasa Indonesia: bisa 1 token โ 2-3 karakter (prefix+imbuhan)
๐ Angka: "1000000" = 1 token? Tergantung tokenizer
๐ Spasi: penting! "Halo" vs " Halo" bisa beda token
๐ Emoji: 1 emoji = 1-3 token (boros!)
๐ o200k_base vocabulary: 200K token
Ketik kalimat yang SAMA di tokenizer.nousresearch.com, lalu ganti encoding. Lihat bedanya token count! Kalimat Indonesia biasanya 2-3x lebih banyak token daripada Inggris untuk teks yang sama panjangnya.
| Provider | Model | Input | Output | Context |
|---|---|---|---|---|
| DeepSeek | V4 Flash | $0.04 | $0.04 | 128K |
| DeepSeek | V4 Pro | $0.40 | $0.40 | 128K |
| Anthropic | Claude Sonnet 5 | $3.00 | $15.00 | 200K |
| Anthropic | Claude Opus 4.8 | $15.00 | $75.00 | 200K |
| OpenAI | GPT-5.5 | $2.50 | $10.00 | 128K |
| Gemini 3 Flash | $0.15 | $0.60 | 1M | |
| Gemini 3 Pro | $1.25 | $5.00 | 2M |
โ
3-6x lebih cepat dari tokenizers Rust
โ
Cocok buat hitung biaya API calls
โ
Support: o200k_base, cl100k_base, p50k_base, r50k_base
โ Terbatas: cuma encoding OpenAI
โ Gak bisa training tokenizer sendiri
โก๏ธ Install: pip install tiktoken
โ
Support BPE, WordPiece, Unigram โ fleksibel
โ
Bisa training tokenizer sendiri dari data kustom
โ
<20s untuk 1GB text
โ
Integrasi dengan HuggingFace ecosystem
โก๏ธ Install: pip install tokenizers
Tiktoken โ kalo cuma butuh count token untuk prompt/API calls (ringan, cukup).
HF Tokenizers โ kalo mau training/fine-tuning model sendiri (fleksibel, power).
Cara kamu bicara ke model = kualitas output. Prompt engineering adalah skill paling praktis yang langsung meningkatkan hasil kerja kamu sehari-hari (coding, analisis, konten).
State persis apa yang kamu mau. Imperatif. Spesifik.
Beri 2-3 contoh output yang benar. Contoh > instruksi abstrak.
Minta model berpikir langkah demi langkah sebelum jawab. Meningkatkan akurasi reasoning.
<task>, <context>, <data>, <output> โ Model paham XML dengan baik untuk prompt kompleks.
Bagi tugas besar jadi langkah-langkah kecil. Langkah 1 โ 2 โ 3.
Set persona, tone, constraints di awal. Contoh: "Kamu adalah asisten coding yang paham PHP MySQL untuk aplikasi MP Horde."
Mulai response model untuk kontrol arah. Model cenderung melanjutkan pola yang udah dimulai.
Iterative refinement: Minta revisi. "Buat lebih singkat. Buat lebih formal. Tambah detail teknis."
โ ๏ธ Model cenderung "lupa" informasi di tengah konteks panjang. Letakkan informasi penting di awal dan akhir. Struktur dengan heading jelas. Hindari duplikasi (boros token + bikin bingung).
Generate banyak output, vote yang terbaik. Seperti tanya 5 orang ahli lalu ambil suara terbanyak.
JSON mode, tool calling, function calling. Model ngeluarin data terstruktur, bukan teks bebas.
Model mutusin sendiri tool apa yang dipakai untukๅฎๆไปปๅก. Prompt bukan cuma instruksi, tapi framework keputusan.
Prompt bukan cuma teks โ gambar + teks + code + audio dalam satu prompt. Model terbaru (Claude, GPT-5, Gemini 3) support multimodal.
RAG = AI yang paham DATA KAMU. Model AI cuma tau data publik sampai training cut-off. Dengan RAG, kamu kasih model akses ke database MP Horde, file absensi, konten website โ dan dia bisa jawab berdasarkan data real bisnis kamu.
Dokumen โ Split โ Embedding โ Vector Store
Query โ Embedding โ Similarity Search โ Top-K
Query + Context โ LLM โ Jawaban
Vector database termudah. 4 fungsi API: create_collection, add, query, get.
Framework RAG paling komplit. 300+ integrasi, parsing 130+ format dokumen.
๐ฅ LlamaParse: parsing PDF, DOCX, Excel, HTML. Cocok buat laporan MP Horde!
Framework agent engineering paling matang. Build agent yang bisa pake tools, panggil sub-agent, plan & execute.
๐ Deep Agents: higher-level package untuk planning + subagents.
AI bisa jawab "Stok produk X berapa?" atau "Total penjualan bulan ini?" โ langsung dari database.
"Siapa yang sering telat?" "Rekap absensi leader Zuhri bulan ini" โ query via RAG.
Data dari website srkhorde.id โ AI CS yang jawab pertanyaan customer otomatis.
ChromaDB (ringan, jalan di laptop) + all-MiniLM-L6-v2 (~80MB untuk embedding) + Ollama (LLM lokal) = RAG GRATIS tanpa API!
Fine-tuning = melatih ulang model dengan data kamu. Tapi jangan buru-buru! 90% kasus cukup pake Prompt Engineering + RAG. Fine-tuning baru perlu kalo:
โ
Model harus hafal format output spesifik terus-menerus
โ
Model perlu gaya/tone bicara yang sangat spesifik
โ
Kamu mau bikin AI khusus domain (misal: AI spesialis jersey futsal)
Teknik PEFT (Parameter-Efficient Fine-Tuning). Cuma training 0.1-1% dari total parameter model. Hasil adapter kecil (MB-an, bukan GB).
โ
Bisa di GPU konsumen
โ
Cepat (menit-jam, bukan hari)
โ
Adapter kecil, gampang di-share
LoRA di model yang udah di-quantize (4-bit). ~70% lebih hemat VRAM dari LoRA biasa.
โ
Bisa fine-tune 7B model di 8GB VRAM
โ
Unsloth: 2x lebih cepat, 70% lebih hemat
Library resmi dari HuggingFace. Support LoRA, QLoRA, IA3, Prompt Tuning, AdaLoRA.
Integrasi langsung dengan Transformers dan Diffusers.
2x lebih cepat, 70% lebih hemat VRAM. Support 500+ model. Web UI + code API.
๐ฅ Bisa fine-tune + export ke GGUF langsung. Integrasi Hermes: unsloth start hermes
Belajar fine-tuning setelah kamu ngerti Ollama, tokenizer, dan RAG dulu. Mulai dari yang paling gampang: Unsloth โ install sekali jalan, web UI, drag-and-drop training. Kalo mau coding manual, pake PEFT + Transformers.
Inilah 8 tren utama yang membentuk dunia AI per Juli 2026. Semua info ini terverifikasi dari dokumentasi resmi, GitHub release, dan berita terkini.
Claude Code, Codex, Hermes Agent, OpenCode โ AI agents sekarang bisa execute code, manage files, deploy aplikasi. Bukan cuma ngobrol, tapi bekerja.
Kamu udah pake ini (Hermes Agent)!
Banyak agent bekerja sama โ delegate_task di Hermes = multi-agent. Agent spesialis: research โ coding โ audit. Agent Factory kamu udah multi-agent!
Dulu GPT-3: 4K token. Sekarang: 128K-2M token. Gemini 3: 2M token = bisa ingat seluruh novel. DeepSeek V4 Flash: 128K โ model yang kamu pakai.
DeepSeek V4 Flash: $0.04 per 1M token (termurah sedunia!). Local LLM: Gratis. Open source model > proprietary dalam value.
Model bisa panggil API, query database, kirim email. Integrasi tools eksternal = AI yang beneran berguna buat bisnis.
Model baru support text + image + audio + code dalam satu. Claude 5, GPT-5.5, Gemini 3 โ semuanya multimodal native.
Model terbaru jauh lebih paham Bahasa Indonesia. DeepSeek, Qwen, Gemini support Indonesia with good quality. Kamu bisa ngobrol pake bahasa sehari-hari.
AI khusus domain (jersey, absensi, finance) lebih berguna daripada generic AI. AI yang paham bisnis kamu = competitive advantage.
Dari 8 tren di atas, kamu udah langsung nyentuh 2 tren (#1 Agent AI, #2 Multi-Agent) karena pake Hermes Agent + Agent Factory. Tinggal 3 langkah praktik lagi (#4 Local LLM, #5 RAG/Tool Use, #8 Vertical AI) untuk cover semua tren utama.
Sesi 1 (Teori) โ โ
Selesai! Kamu udah paham semua model AI, token, ecosystem dari dokumen ai-ecosystem-2026.pdf.
Sesi 2 (Praktik) โ ๐ MULAI! Ini roadmap step-by-step-nya.
Bonus Udah dibaca di dokumen ini. Paham perjalanan AI dari 1943 sampai 2026.
Esensial Mac Mini Download, install, chat sama model di terminal. Lihat langsung gimana AI "berpikir" real-time. Estimasi: 30 menit
Esensial Install tiktoken, coba encoding, lihat perbandingan token antar bahasa. Buka tokenizer.nousresearch.com. Estimasi: 20 menit
Skill Utama Coba 9 teknik prompt di Hermes Agent. Buat system prompt kustom untuk workflow MP Horde. Estimasi: 1 jam
Power Up Install ChromaDB, masukin data bisnis, query pake LLM lokal (Ollama). AI yang paham data MP Horde kamu. Estimasi: 2 jam
Advanced Install Unsloth, coba LoRA/QLoRA. Fine-tune model kecil dengan data kamu. Export ke GGUF. Estimasi: 3-4 jam
1. Jangan loncat-loncat โ step 1 (Ollama) adalah fondasi semua step berikut
2. Praktik > Teori โ lebih baik 20% teori 80% praktik
3. Buat sendiri โ jangan cuma baca. Ketik perintah, lihat error, debug
4. Terapkan ke bisnis โ AI buat MP Horde/Absensi/Website lebih seru daripada AI buat main-main
30-45 menit Download & install Ollama. ollama run gemma4 โ chat pertama dengan AI di terminal! cURL ke API lokal. Tujuan: Lihat langsung model AI jalan di komputer sendiri
30 menit Coba 3 model beda ukuran. Install tiktoken, tokenize kalimat Indonesia vs Inggris. Buka tokenizer.nousresearch.com. Tujuan: Paham kenapa prompt tertentu boros/hemat token
1 jam Praktik 9 teknik prompt di Hermes Agent. Buat system prompt untuk MP Horde/Absensi/Finance. Coba chain-of-thought, few-shot, XML tags. Tujuan: Skill paling praktis โ langsung improve hasil kerja
2 jam Install ChromaDB, masukin data bisnis, query pake Python. Gabung dengan Ollama: query to context to LLM to jawaban. Tujuan: AI yang paham data bisnis kamu sendiri
2 jam Bikin workflow di n8n: Telegram to AI to Jawab. Atau pake ollama launch openclaw. Tujuan: Customer bisa tanya ke AI 24/7
3 jam Install ComfyUI atau coba FLUX. Generate desain jersey mockup. (Opsional) Coba Unsloth fine-tuning. Tujuan: Bisa generate gambar produk + paham fine-tuning
2 jam AI optimize SEO srkhorde.id. Review semua yang udah dipelajari. Rencanakan next project spesifik. Tujuan: AI jadi bagian dari workflow bisnis sehari-hari
Gak perlu buru-buru selesaiin 7 hari. Ambil ritme kamu sendiri. Yang penting: setiap hari ada progress. 30 menit sehari lebih baik daripada 7 jam di akhir pekan lalu lupa semua. Panggil aku kapanpun kamu mau gas hari berikutnya!
| Model | Param | Size | M1 8GB | M2 16GB | M3 24GB |
|---|---|---|---|---|---|
| gemma4 | 2B | ~1.5GB | โ โ Lancar | โ โ Lancar | โ โ Lancar |
| qwen3.5:1.7b | 1.7B | ~1.2GB | โ โ Lancar | โ โ Lancar | โ โ Lancar |
| deepseek-v4-flash | ~7B | ~4.5GB | โ Lumayan | โ โ Lancar | โ โ Lancar |
| mistral:7b | 7B | ~4.5GB | โ Lumayan | โ โ Lancar | โ โ Lancar |
| nemotron-3-super | 8B | ~5GB | โ ๏ธ Berat | โ Lancar | โ โ Lancar |
| deepseek-v4-pro | ~27B | ~16GB | โ Gak muat | โ ๏ธ Q4 maybe | โ Lancar |
| llama3:70b | 70B | ~40GB | โ Gak muat | โ Gak muat | โ Gak muat |
๐ก Q4 quantization = ukuran ~60% dari aslinya. 7B model bisa jadi ~3GB. Ollama otomatis pake quantization sesuai RAM.
Setelah kamu kuasai 5 step di atas, ini arah selanjutnya yang bisa kamu eksplor. Topik-topik ini langsung relevan buat bisnis kamu โ jersey futsal, website, dan social media.
Node-based UI untuk image generation. Paling fleksibel โ drag & drop workflow. Support Stable Diffusion, FLUX, SDXL.
Atau download langsung dari github.com/comfyanonymous/ComfyUI. Rilis 15 Juli 2026
Open weight model untuk text-to-image. Kualitas setara Midjourney. Bisa jalan lokal!
Library HuggingFace untuk image generation. Support Stable Diffusion, FLUX, SDXL, PixArt.
Generate desain jersey mockup dengan FLUX atau Stable Diffusion. Prompt: "jersey futsal design merah hitam with geometric pattern, mockup on mannequin, photorealistic" โ langsung jadi, tinggal edit.
Plugin untuk Stable Diffusion yang bikin animasi/gif. Plug-and-play, gak perlu training ulang. ComfyUI + AnimateDiff = workflow video lokal.
Open source video generation. 10 detik video, resolusi tinggi. Bisa fine-tune pake LoRA. Dari THUDM (China).
Runway Gen-4, Pika, Kling, Vidu โ video AI cloud. Coba gratis dulu, upgrade kalo butuh. Hasil lebih stabil daripada open source (saat ini).
Video generation masih berat secara komputasi. Buat Mac Mini, mulailah dari AnimateDiff + ComfyUI โ paling ringan. Kalo butuh kualitas tinggi, pake cloud service dulu (Runway/Pika).
n8n di localhost:5678 + Ollama chatbot node = chatbot WhatsApp/Telegram otomatis untuk bisnis kamu.
Jalanin satu perintah dan Ollama jadi AI assistant di WhatsApp, Telegram, Slack, Discord.
Self-hosted ChatGPT. Konek ke Ollama, support RAG, web search, multi-user. Bisa dibuka tim kamu.
Bayangin: Customer kirim "Size L jersey merah harga?" ke WhatsApp โ AI jawab otomatis dari database MP Horde. n8n (sudah install) + Ollama + ChromaDB = full solution gratis!
Prompt AI buat artikel SEO-friendly tentang jersey futsal. Meta descriptions otomatis. Keyword clustering dengan AI.
LLM bisa generate long-tail keywords dari topik utama. Analisis kompetitor dengan AI. Temukan content gap.
Generate schema.org structured data otomatis. Optimasi meta tags. Review heading structure.
Praktis: Prompt AI โ "Buat artikel 1000 kata tentang cara memilih jersey futsal yang bagus, target keyword 'jersey futsal custom', tone informatif" โ review & publish.
Power: RAG dari Google Analytics + Search Console data โ AI tahu persis halaman mana yang perlu dioptimasi.
Semua sumber di bawah diakses langsung dan divalidasi pada 24 Juli 2026.
๐ 24 Juli 2026 โ Riset oleh Hermes Agent (Belajar AI Profile)
Model: DeepSeek V4 Flash | Provider: DeepSeek | Profile: belajar-ai
โฑ Total riset: 30+ menit | 20 sumber tervalidasi | 10 topik
โ Versi terverifikasi: Ollama v0.32.3 | llama.cpp b10099 | ChromaDB v1.5.9 | Unsloth v2026.7.5 | Diffusers v0.36.0 | ComfyUI v0.28.0Kapanpun siap gas step 1, panggil aku: "Aku mau gas step 1 โ install Ollama" ๐