BAB 18
Sumber: Disusun berdasarkan perkembangan terkini multimodal AI (Claude, GPT-4o, Gemini) Estimasi Waktu: 35-45 menit Prasyarat: Pelajaran 04 (Generative AI Fundamentals)
Materi ini membahas AI multimodal - sistem AI yang bisa memproses dan menghasilkan berbagai jenis data: teks, gambar, audio, dan video. Ini adalah evolusi besar dari AI yang hanya bisa menangani teks, membuka kemungkinan penggunaan yang jauh lebih luas.
Setelah mempelajari materi ini, kamu akan mampu:
AI multimodal adalah sistem yang bisa menerima, memproses, dan/atau menghasilkan lebih dari satu jenis data (modalitas).
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
β AI MULTIMODAL β
β β
β INPUT OUTPUT β
β ββββββββββββ ββββββββββββ β
β β Teks β β Teks β β
β β Gambar β ββββΊ β Gambar β β
β β Audio β β Audio β β
β β Video β β Video β β
β ββββββββββββ ββββββββββββ β
β β
β Model: Claude (Vision), GPT-4o, Gemini, β
β DALL-E, Midjourney, ElevenLabs, Sora β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
| Kemampuan | Deskripsi | Contoh |
|---|---|---|
| Deskripsi gambar | Mendeskripsikan isi gambar secara detail | βJelaskan apa yang ada di foto iniβ |
| OCR (Text Extraction) | Membaca teks dalam gambar | Ekstrak teks dari foto dokumen |
| Analisis chart/graph | Memahami visualisasi data | βApa tren dari grafik ini?β |
| Code dari screenshot | Membaca kode dari tangkapan layar | Konversi screenshot UI ke kode |
| Perbandingan visual | Membandingkan dua atau lebih gambar | βApa perbedaan antara kedua desain ini?β |
| Identifikasi masalah | Mendeteksi issue dalam gambar | βApa yang salah dengan diagram ini?β |
Lihat gambar ini dan:
1. Deskripsikan secara keseluruhan (apa yang kamu lihat?)
2. Identifikasi elemen-elemen kunci
3. Analisis hubungan antar elemen
4. Tarik kesimpulan atau insight
Dalam screenshot aplikasi ini, identifikasi:
- UI elements yang tidak konsisten
- Potential accessibility issues
- Sugesti untuk improvement
Konversikan tabel dalam gambar ini ke format markdown.
Pastikan semua data dan formatting terpreservasi.
| Model | Kelebihan | Kekurangan |
|---|---|---|
| DALL-E 3 | Mengikuti prompt dengan akurat, integrasi dengan ChatGPT | Kadang terlalu βcleanβ, kurang artistik |
| Midjourney | Kualitas artistik tinggi, estetik bagus | Kurang akurat mengikuti prompt detail |
| Stable Diffusion | Open-source, highly customizable, bisa di-run lokal | Butuh setup teknis, hasil bervariasi |
| Imagen (Google) | Realistis, integrasi dengan ekosistem Google | Akses terbatas |
[SUBJEK UTAMA], [AKSI/POSE], [SETTING/LOKASI],
[STYLE/GAYA], [MOOD/SUASANA], [DETAIL TEKNIS]
Contoh:
"Seorang developer muda Indonesia, duduk di depan laptop,
di coworking space modern yang terang,
digital art style, suasana fokus dan produktif,
high detail, warm lighting, 16:9 aspect ratio"
| Tool | Fungsi |
|---|---|
| OpenAI Whisper | STT, multi-bahasa, open-source |
| ElevenLabs | TTS berkualitas tinggi, voice cloning |
| Google Speech-to-Text | STT enterprise-grade |
| AssemblyAI | STT dengan fitur lanjutan |
| Tool | Fungsi |
|---|---|
| Sora (OpenAI) | Text-to-video berkualitas tinggi |
| Runway | Video generation dan editing |
| Pika | Text/image-to-video |
| HeyGen | AI avatar untuk presentasi video |
| Descript | Video editing berbasis teks |
Use Case: Review Desain
1. Upload mockup desain ke Claude/GPT-4o
2. Prompt: "Review desain ini untuk:
- Konsistensi visual
- UX best practices
- Accessibility issues
- Sugesti perbaikan spesifik"
3. Terima analisis detail + sugesti
4. Upload versi revisi
5. Bandingkan dan iterasi
Use Case: UI Implementation
1. Screenshot desain UI dari Figma
2. Upload ke AI dengan prompt:
"Konversikan desain ini ke React component.
Gunakan Tailwind CSS.
Pastikan responsive design."
3. Review dan sesuaikan kode yang dihasilkan
4. Test dan iterasi
Use Case: Meeting Notes
1. Rekaman meeting (audio/video)
2. Transkripsi dengan Whisper
3. Ringkas dengan LLM:
"Buat notulensi meeting dari transkripsi ini.
Sertakan: keputusan utama, action items, dan deadline."
4. Review dan distribusikan
Upload gambar (screenshot aplikasi, foto whiteboard, chart) ke Claude dan gunakan teknik prompting vision untuk analisis mendalam. Terapkan Product, Process, dan Performance Discernment.
Pilih satu tugas dan desain workflow yang menggunakan minimal 2 modalitas. Contoh: buat presentasi (teks + gambar), atau konversi video tutorial jadi ringkasan tertulis.
Buat prompt yang sama untuk 2 model image generation berbeda. Bandingkan hasilnya dan analisis kelebihan/kekurangan masing-masing.