🏷️ mixture of experts

6 articles about mixture of experts — guides, tutorials and comparisons to master this topic on AI-master.dev.

Naive-N0.5-Flash: the open-weight 309B MoE with no full-attention layers at all aims for 2,000 tokens/s per user

Naive-N0.5-Flash : le MoE open-weight de 309B paramètres sans full-attention dévoilé par NaiveAI vise 2 000 tokens/s par utilisateur sur Hugging Face.

LLM & Modèles débutant

Cohere North Small Translate: an open-weight MoE for translation that beats DeepL and Google Translate on WMT26 — sovereign translation becomes free

North Small Translate : le MoE open-weight de Cohere qui bat DeepL et Google Translate sur WMT26. La traduction souveraine gratuite décryptée.

Outils IA débutant

GLM-5.2: The most powerful open weights model in the world — 753B MoE, 1M context, MIT license, the LLM landscape shifts

Découvrez GLM-5.2 de Z.ai : le modèle open weights le plus puissant au monde. 753B MoE, 1M de contexte et licence MIT qui bouleverse le paysage LLM.

LLM & Modèles débutant

DeepSeek's DeepEP: the open source lib that optimizes GPU communication for large-scale MoE models

DeepSeek libère DeepEP, une bibliothèque open source qui optimise la communication GPU pour accélérer l'entraînement des modèles MoE à grande échelle.

LLM & Modèles débutant

Translate this title to English: UniPool : the newcomer in MoE architectures decouples network depth from expert growth

Découvrez UniPool, l'innovation qui révolutionne les architectures MoE en déconnectant la profondeur du réseau de la croissance des experts.

LLM & Modèles débutant

DeepSeek V4: Two new models — Pro and Flash — change the game

Découvrez l'architecture MoE et MLA V2 de DeepSeek V4 Pro et Flash. Analyse des benchmarks, specs et impact face à GPT-5 et Claude 3.5.

LLM & Modèles débutant