Course Outline
Introduction to Apache Iceberg
- Overview of Apache Iceberg
- Recap of fundamental concepts
Deep Dive into Iceberg Architecture
- Detailed analysis of Iceberg's table format
- Comprehensive architecture overview, covering metadata and file layout
- Internal mechanisms of schema and partition evolution
Advanced Installation and Configuration
- Configuring Iceberg for peak performance across different environments
- Integration with diverse data processing engines
- Advanced setup involving security, encryption, and access controls
- Deployment of Iceberg within a distributed environment
Advanced Operations and Maintenance
- Managing extensive Iceberg tables
- Executing and managing complex schema changes
- Addressing partition evolution and hidden partitioning
- Advanced CRUD operations incorporating schema and partition modifications
Query Optimization Techniques
- Strategies for minimizing query latency
- Applying partition and file pruning
- Metadata caching and optimization approaches
- Implementation and testing of query optimization strategies
Performance Tuning for Large Datasets
- Enhancing performance for large-scale datasets
- Leveraging Iceberg's native features for performance adjustments
- Case studies on performance tuning in practical scenarios
- Fine-tuning performance for extensive datasets
Advanced Data Migration and Integration
- Migrating complex data structures from alternative systems
- Integrating Iceberg with real-time data streams
- Migrating complex datasets and incorporating real-time data streams
Reliability and Consistency
- Maintaining data consistency and integrity in distributed environments
- Establishing and managing transactional guarantees
- Addressing failures and recovery mechanisms
- Implementing features for reliability and consistency
Advanced Features and Customization
- Custom catalog implementations
- Extending Iceberg with bespoke features
- Implementing custom catalogs and expanding Iceberg functionalities
Data Governance and Compliance
- Establishing data governance policies
- Ensuring compliance with data regulations
- Managing audit trails and data lineage
- Implementing governance and compliance features
Summary and Future Steps
Requirements
- Proficiency in core concepts, basic operations, and Iceberg table management
Target Audience
- Data engineers
- Data architects
- Data analysts
- Software developers
Testimonials (2)
A journey through the Spark world: a very intense course. DSL, spark sql, partitioning vs bucketing for me.
Georgiana Elisabeta
Course - Apache Spark Fundamentals
Hands on exercises. Class should have been 5 days, but the 3 days helped to clear up a lot of questions that I had from working with NiFi already