← Back to catalog
Multimodal AI System Engineering cover image
Artificial Intelligence Advanced

Multimodal AI System Engineering

Build end-to-end applications combining vision, speech, and textual understanding.

Instructor Elena Rostova
Duration 240 minutes (4 lessons)
Estimated Effort 4 hours total (2 hrs/week over 2 weeks)
Price USD 85.00
USD 85.00 Full Lifetime Access

Sign in to track your learning progress.

Course Overview

Process cross-modal embeddings, integrate Vision-Language models into RAG pipelines, and build real-time multi-modal streaming workflows.

What You Will Learn

Process image, audio, and textual data with unified multimodal models
Build visual Question Answering (VQA) pipelines using Vision-LLMs
Extract structured JSON data from complex PDF documents and diagrams
Embed multimodal content into vector databases for cross-modal retrieval
Implement real-time audio transcription and speech synthesis flows

Tools & Technologies Used

Python 3.11 Whisper OpenCV Qdrant Pydantic FastAPI

Structured Curriculum

2 Modules  ·  4 Lessons  ·  240 Minutes Total

Module 1

Module 1: Vision-Language Models & Document Parsing

2 lessons

Extract text, tables, and visual evidence from images and PDFs.

  • 📄

    Vision-LLM Prompting & Schema Extraction

    Pass image inputs to Vision models to extract structured JSON data from invoices and charts.

    Code Workshop 55 min
  • 📄

    Multi-Modal Document Parsing Pipelines

    Combine OCR, layout detection, and vision models to parse complex PDF layouts.

    Hands-on Exercise 65 min
Module 2

Module 2: Audio Intelligence & Cross-Modal RAG

2 lessons

Index visual and audio embeddings for multi-modal similarity search.

  • 📄

    Speech-to-Text Transcription with Whisper

    Transcribe audio streams with word-level timestamps and speaker diarization.

    Lab Session 60 min
  • 📄

    Cross-Modal Vector Embeddings in Qdrant

    Index joint image-text embeddings (CLIP) for natural language image search.

    System Design 60 min

Practical Project & Capstone Outcome

🚀 Capstone Project

Multimodal Technical Inspector & Audio Summarizer

Construct an application that ingests blueprint images and voice notes, queries a multimodal vector index, and outputs an interactive inspection report.

Prerequisites

  • Python intermediate proficiency
  • Basic familiarity with REST APIs

Intended Audience

  • AI Platform Engineers building multi-modal search and document processing services
  • Software Engineers developing vision-aware web applications

Instructor Information

E

Elena Rostova

Course Author & Industry Expert

Elena Rostova is a Senior Multimodal Systems Architect who has built document intelligence and vision-RAG systems for global tech enterprises.

Frequently Asked Questions

Does this course cover local vision models like Llama 3.2 Vision?

Yes, lessons cover both hosted API endpoints and local open-source vision runtimes.