BAB 18

18 - Multimodal AI: Teks, Gambar, Audio, dan Video

Sumber: Disusun berdasarkan perkembangan terkini multimodal AI (Claude, GPT-4o, Gemini) Estimasi Waktu: 35-45 menit Prasyarat: Pelajaran 04 (Generative AI Fundamentals)


Apa Itu Materi Ini?

Materi ini membahas AI multimodal - sistem AI yang bisa memproses dan menghasilkan berbagai jenis data: teks, gambar, audio, dan video. Ini adalah evolusi besar dari AI yang hanya bisa menangani teks, membuka kemungkinan penggunaan yang jauh lebih luas.


Tujuan Pembelajaran

Setelah mempelajari materi ini, kamu akan mampu:


1. Apa Itu Multimodal AI?

Definisi

AI multimodal adalah sistem yang bisa menerima, memproses, dan/atau menghasilkan lebih dari satu jenis data (modalitas).

β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”
β”‚                AI MULTIMODAL                             β”‚
β”‚                                                         β”‚
β”‚   INPUT                    OUTPUT                       β”‚
β”‚   β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”            β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”                  β”‚
β”‚   β”‚   Teks   β”‚            β”‚   Teks   β”‚                  β”‚
β”‚   β”‚  Gambar  β”‚    ───►    β”‚  Gambar  β”‚                  β”‚
β”‚   β”‚  Audio   β”‚            β”‚  Audio   β”‚                  β”‚
β”‚   β”‚  Video   β”‚            β”‚  Video   β”‚                  β”‚
β”‚   β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜            β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜                  β”‚
β”‚                                                         β”‚
β”‚   Model: Claude (Vision), GPT-4o, Gemini,               β”‚
β”‚          DALL-E, Midjourney, ElevenLabs, Sora            β”‚
β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜

Mengapa Multimodal Penting?


2. Vision (Analisis Gambar)

Kapabilitas

KemampuanDeskripsiContoh
Deskripsi gambarMendeskripsikan isi gambar secara detailβ€œJelaskan apa yang ada di foto ini”
OCR (Text Extraction)Membaca teks dalam gambarEkstrak teks dari foto dokumen
Analisis chart/graphMemahami visualisasi dataβ€œApa tren dari grafik ini?”
Code dari screenshotMembaca kode dari tangkapan layarKonversi screenshot UI ke kode
Perbandingan visualMembandingkan dua atau lebih gambarβ€œApa perbedaan antara kedua desain ini?”
Identifikasi masalahMendeteksi issue dalam gambarβ€œApa yang salah dengan diagram ini?”

Teknik Prompting untuk Vision

Teknik 1: Deskripsi Bertahap

Lihat gambar ini dan:
1. Deskripsikan secara keseluruhan (apa yang kamu lihat?)
2. Identifikasi elemen-elemen kunci
3. Analisis hubungan antar elemen
4. Tarik kesimpulan atau insight

Teknik 2: Analisis Targeted

Dalam screenshot aplikasi ini, identifikasi:
- UI elements yang tidak konsisten
- Potential accessibility issues
- Sugesti untuk improvement

Teknik 3: Konversi Format

Konversikan tabel dalam gambar ini ke format markdown.
Pastikan semua data dan formatting terpreservasi.

Keterbatasan Vision


3. Image Generation (Pembuatan Gambar)

Model Populer

ModelKelebihanKekurangan
DALL-E 3Mengikuti prompt dengan akurat, integrasi dengan ChatGPTKadang terlalu β€œclean”, kurang artistik
MidjourneyKualitas artistik tinggi, estetik bagusKurang akurat mengikuti prompt detail
Stable DiffusionOpen-source, highly customizable, bisa di-run lokalButuh setup teknis, hasil bervariasi
Imagen (Google)Realistis, integrasi dengan ekosistem GoogleAkses terbatas

Teknik Prompting untuk Image Generation

Struktur Prompt Efektif

[SUBJEK UTAMA], [AKSI/POSE], [SETTING/LOKASI],
[STYLE/GAYA], [MOOD/SUASANA], [DETAIL TEKNIS]

Contoh:
"Seorang developer muda Indonesia, duduk di depan laptop,
 di coworking space modern yang terang,
 digital art style, suasana fokus dan produktif,
 high detail, warm lighting, 16:9 aspect ratio"

Tips Penting

  1. Spesifik tentang gaya: β€œwatercolor”, β€œpixel art”, β€œphotorealistic”
  2. Sertakan mood: β€œcheerful”, β€œdramatic”, β€œminimalist”
  3. Tentukan komposisi: β€œclose-up”, β€œwide shot”, β€œbird’s eye view”
  4. Gunakan negative prompt jika platform mendukung: β€œno text, no blur”
  5. Iterasi - gambar pertama jarang sempurna

4. Audio (Suara)

Kapabilitas Audio AI

Speech-to-Text (STT)

Text-to-Speech (TTS)

Audio Understanding

Tools Populer

ToolFungsi
OpenAI WhisperSTT, multi-bahasa, open-source
ElevenLabsTTS berkualitas tinggi, voice cloning
Google Speech-to-TextSTT enterprise-grade
AssemblyAISTT dengan fitur lanjutan

Use Case Praktis


5. Video

Kapabilitas Video AI

Video Understanding (Analisis)

Video Generation (Pembuatan)

Model dan Tools

ToolFungsi
Sora (OpenAI)Text-to-video berkualitas tinggi
RunwayVideo generation dan editing
PikaText/image-to-video
HeyGenAI avatar untuk presentasi video
DescriptVideo editing berbasis teks

6. Integrasi Multimodal dalam Workflow

Pola: Teks + Gambar

Use Case: Review Desain

1. Upload mockup desain ke Claude/GPT-4o
2. Prompt: "Review desain ini untuk:
   - Konsistensi visual
   - UX best practices
   - Accessibility issues
   - Sugesti perbaikan spesifik"
3. Terima analisis detail + sugesti
4. Upload versi revisi
5. Bandingkan dan iterasi

Pola: Gambar β†’ Kode

Use Case: UI Implementation

1. Screenshot desain UI dari Figma
2. Upload ke AI dengan prompt:
   "Konversikan desain ini ke React component.
    Gunakan Tailwind CSS.
    Pastikan responsive design."
3. Review dan sesuaikan kode yang dihasilkan
4. Test dan iterasi

Pola: Audio β†’ Dokumen

Use Case: Meeting Notes

1. Rekaman meeting (audio/video)
2. Transkripsi dengan Whisper
3. Ringkas dengan LLM:
   "Buat notulensi meeting dari transkripsi ini.
    Sertakan: keputusan utama, action items, dan deadline."
4. Review dan distribusikan

7. Pertimbangan Etis

Masalah yang Perlu Diperhatikan

Deepfakes dan Manipulasi

Hak Cipta

Bias dalam Generasi

Privacy


Latihan: Eksplorasi Multimodal (~20 menit)

Pilihan A: Vision Analysis

Upload gambar (screenshot aplikasi, foto whiteboard, chart) ke Claude dan gunakan teknik prompting vision untuk analisis mendalam. Terapkan Product, Process, dan Performance Discernment.

Pilihan B: Multi-format Workflow

Pilih satu tugas dan desain workflow yang menggunakan minimal 2 modalitas. Contoh: buat presentasi (teks + gambar), atau konversi video tutorial jadi ringkasan tertulis.

Pilihan C: Komparasi

Buat prompt yang sama untuk 2 model image generation berbeda. Bandingkan hasilnya dan analisis kelebihan/kekurangan masing-masing.


Poin-Poin Utama

  1. Multimodal AI memproses lebih dari teks - gambar, audio, dan video
  2. Vision memungkinkan AI β€œmelihat” dan menganalisis visual - tapi tetap bisa salah
  3. Image generation powerful tapi butuh prompting yang spesifik dan iteratif
  4. Audio AI sudah sangat matang untuk transkripsi dan text-to-speech
  5. Video AI berkembang pesat tapi masih relatif baru
  6. Integrasi multimodal dalam workflow menghasilkan use case yang sangat powerful
  7. Etika semakin penting di era multimodal - deepfakes, hak cipta, dan privacy

Referensi Lanjutan


Informasi Kursus