DAIMLER DOT
SCIENTIFIC ML ENSEMBLE
Multi-branch ensemble для прогноза DOT-метрик по составу смеси: Deep Sets, Set Transformer, retrieval и robust branches с adaptive blending и rare/coverage correction.
- KEY METRICS
- -45.7%NMAE DELTA VISCOSITYvs linear baseline
- -30.8%NMAE OXIDATIONvs linear baseline
- 5-FOLDOOF VALIDATION
- 6ENSEMBLE BRANCHES
01 / PROBLEM
Small train set, variable set length, missing batch-specific properties, nonlinear temperature/time/biofuel behavior — классический tabular подход здесь не работает напрямую.
02 / APPROACH
Multi-branch ensemble: Linear robust branch, Kernel branch, Retrieval branch, Deep Sets, Set Transformer, Robust feature branch → HYBRID BLEND → ADAPTIVE BLEND → REFINEMENT → RARE / COVERAGE CORRECTION.
03 / FEATURE ENGINEERING
- Mixture statistics, component-family proportions, test conditions
- Physical property indicators, coverage features, similarity/retrieval features
- Физически осмысленные interactions: temperature × time, biofuel × temperature, biofuel × time, catalyst × temperature
- Exact→typical fallback: exact component+batch property, иначе typical component property
- Coverage features: exact coverage, resolved coverage, fallback ratio, property strength
04 / ENGINEERING DECISIONS
- Set-модели (Deep Sets, Set Transformer) для переменного числа компонентов
- Retrieval branch использует similarity между сценариями
- Adaptive blend подстраивает веса ветвей, refinement сглаживает систематику
- Rare / coverage correction для сценариев с неполными данными
05 / RESULTS
5-fold OOF validation, метрики MAE / RMSE / normalized MAE. Финальный head выбирается отдельно для каждой target. Improvement против linear baseline: Delta viscosity ≈45.7% lower normalized MAE; Oxidation ≈30.8% lower normalized MAE.
06 / STACK
Python · PyTorch · scikit-learn · pandas / NumPy · Deep Sets · Set Transformer · retrieval features