Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Course Outline
Performance Fundamentals and Key Metrics
- Analysis of latency, throughput, power consumption, and resource utilization
- Distinguishing between system-level and model-level bottlenecks
- Profiling techniques for inference versus training scenarios
Profiling Techniques on Huawei Ascend
- Leveraging CANN Profiler and MindInsight tools
- Advanced diagnostics for kernels and operators
- Strategies for offload patterns and memory mapping
Profiling Techniques on Biren GPU
- Utilizing Biren SDK performance monitoring capabilities
- Exploring kernel fusion, memory alignment, and execution queue management
- Implementing power and temperature-aware profiling strategies
Profiling Techniques on Cambricon MLU
- Employing BANGPy and Neuware performance toolsets
- Gaining kernel-level visibility and interpreting diagnostic logs
- Integrating the MLU profiler with various deployment frameworks
Graph and Model-Level Optimization Strategies
- Applying graph pruning and quantization methods
- Restructuring computational graphs through operator fusion
- Standardizing input sizes and optimizing batch parameters
Memory and Kernel Optimization Strategies
- Enhancing memory layout efficiency and data reuse
- Managing buffers effectively across diverse chipsets
- Applying platform-specific kernel-level tuning techniques
Cross-Platform Best Practices
- Achieving performance portability through abstraction strategies
- Developing shared tuning pipelines for multi-chip environments
- Case study: Optimizing an object detection model across Ascend, Biren, and MLU architectures
Conclusion and Recommended Next Steps
Requirements
- Professional experience in AI model training or deployment workflows
- Proficiency in GPU/MLU compute principles and model optimization strategies
- Fundamental knowledge of performance profiling tools and key metrics
Target Audience
- Performance Engineers
- Machine Learning Infrastructure Teams
- AI System Architects
21 Hours