AI Data Engineering and RAG Practitioner

AI Data Engineering and RAG Practitioner

NEOPOLIS AKADEMY

AI Data Engineering and RAG Practitioner

Design robust data pipelines for RAG: ingestion, parsing, chunking, embeddings, vector and hybrid search, access control, citation handling, and data refresh strategies.

View this course on Akademy ↗

Enrolment and practical details are available on Neopolis Akademy.

AI Data Engineering and RAG Practitioner

What you will explore

This intermediate course addresses preparing sources for RAG, from ingestion to indexed storage.

It details chunking strategies and embedding selection to improve relevance in vector search.

The curriculum covers vector and hybrid search implementations, combining semantic and boolean signals.

It also treats citation handling, access control policies and refresh strategies to keep RAG data current.

STEP BY STEP

Course programme

01RAG Data Foundations

Foundational RAG concepts for AI data engineers: architecture, limits and source governance. Covers source inventory, data ownership, freshness, ACLs, parsing common formats (PDF, HTML, Markdown, CSV) and metadata design for citations and filtering.

Describes RAG architecture, when RAG is inappropriate, and core considerations (key concepts and takeaways).

Details source inventory, data ownership, freshness controls and ACLs to support reliable RAG pipelines.

Covers practical parsing approaches for PDFs, HTML, Markdown, CSV and structured records and their impact on indexing.

Outlines metadata design principles to enable accurate citations and effective filtering in RAG retrievals.

Explore this module on Akademy ↗
02Chunking and Embeddings

Chunking and embedding techniques: chunking strategies (fixed, semantic, recursive, document-aware), embedding model selection including multilingual options, deduplication and normalization, and incremental indexing with re-index triggers.

Compares chunking strategies suited to RAG pipelines and explains trade-offs by document structure.

Presents criteria for choosing embedding models and multilingual considerations for robust vector search.

Describes deduplication, normalization and content hashing methods to reduce redundancy and inconsistencies in indexes.

Explains incremental indexing and re-index triggers to keep data relevant without rebuilding the entire corpus.

Explore this module on Akademy ↗
03Vector and Hybrid Search

Vector and hybrid search: fundamentals (cosine, dot product, HNSW, IVF), using pgvector for small-to-medium RAG, Qdrant for dedicated vector search with payload filtering, and hybrid BM25+vector+reranking strategies.

Introduces vector search principles (similarity measures, approximate indexes like HNSW/IVF) and their impact on latency/quality.

Explains integrating pgvector into Postgres as a practical option for small-to-medium RAG setups.

Describes Qdrant as a dedicated engine including payload filtering and appropriate usage scenarios.

Outlines hybrid architectures combining BM25, vector search and reranking stages to boost precision and recall.

Explore this module on Akademy ↗
04Grounded Answers and Citations

Grounded answers and citations: prompt template patterns for grounded responses, source attribution UX, document-level access control, and production operations (refresh, jobs, monitoring, rollback).

Describes prompt template patterns intended to produce responses grounded in retrieved passages and associated best practices.

Covers the UX of presenting citations and attributing sources to preserve traceability of generated answers.

Specifies document-level access control mechanisms and permissions to enforce access rules and confidentiality.

Addresses production operational concerns: data refresh, indexing jobs, pipeline monitoring and rollback strategies.

Explore this module on Akademy ↗

Programme source: Neopolis Akademy. Original course page