Mixture of Experts

4 Lessons

DEMix Layers: Disentangling Domains for Modular Language Modeling

DEMix Layers: Disentangling Domains for Modular Language Modeling

MoE model where each expert corresponds to a different domain i.e. source text dataset (Reddit, Medical Papers, etc.). Can extrapolate to new domains by copying and training nearest expert
Read more →