BACK TO PROJECTSSCIENTIFIC ML / TABULAR / SET MODELS

DAIMLER DOT

SCIENTIFIC ML ENSEMBLE

Multi-branch ensemble для прогноза DOT-метрик по составу смеси: Deep Sets, Set Transformer, retrieval и robust branches с adaptive blending и rare/coverage correction.

GITHUB
Deep SetsSet Transformerscikit-learnPyTorchFeature Engineering
KEY METRICS
  • -45.7%
    NMAE DELTA VISCOSITY
    vs linear baseline
  • -30.8%
    NMAE OXIDATION
    vs linear baseline
  • 5-FOLD
    OOF VALIDATION
  • 6
    ENSEMBLE BRANCHES
SLUG: daimler-dotTYPE: ENSEMBLESTACK: Deep Sets · Set Transformer · scikit-learn · PyTorch · Feature Engineering

01 / PROBLEM

Small train set, variable set length, missing batch-specific properties, nonlinear temperature/time/biofuel behavior — классический tabular подход здесь не работает напрямую.

02 / APPROACH

Multi-branch ensemble: Linear robust branch, Kernel branch, Retrieval branch, Deep Sets, Set Transformer, Robust feature branch → HYBRID BLEND → ADAPTIVE BLEND → REFINEMENT → RARE / COVERAGE CORRECTION.

03 / FEATURE ENGINEERING

  • Mixture statistics, component-family proportions, test conditions
  • Physical property indicators, coverage features, similarity/retrieval features
  • Физически осмысленные interactions: temperature × time, biofuel × temperature, biofuel × time, catalyst × temperature
  • Exact→typical fallback: exact component+batch property, иначе typical component property
  • Coverage features: exact coverage, resolved coverage, fallback ratio, property strength

04 / ENGINEERING DECISIONS

  • Set-модели (Deep Sets, Set Transformer) для переменного числа компонентов
  • Retrieval branch использует similarity между сценариями
  • Adaptive blend подстраивает веса ветвей, refinement сглаживает систематику
  • Rare / coverage correction для сценариев с неполными данными

05 / RESULTS

5-fold OOF validation, метрики MAE / RMSE / normalized MAE. Финальный head выбирается отдельно для каждой target. Improvement против linear baseline: Delta viscosity ≈45.7% lower normalized MAE; Oxidation ≈30.8% lower normalized MAE.

06 / STACK

Python · PyTorch · scikit-learn · pandas / NumPy · Deep Sets · Set Transformer · retrieval features