Sélection AIArchitecture par couche

Architecture opérationnelle — Août 2026

Modèles

Couche Modèle Alias(s) Taille
Hybrid-Cloud Qwen3.6-35B flash, default, thinking, vision Option 1, 35B MoE / 3B actif
Qwen3.8-Flash-Next flash, default, thinking, vision, max Option 2, 125B MoE, 51B n-grames internes, 6B actif, 1M contexte
MiniMax-H3 video 33B dense
BGE-M3 embedding 568M
BGE-reranker-v2-m3 reranker 568M
FLUX.2-klein-4B image 4B
GLiNER2.5-Multi-V1 privacy 287M, mDeBERTa-v3-base Privacy Filter api-llm-privacy-proxy-gliner2-5
Public-Cloud GLM-5.3-Flash max 320B MoE / 18B actif — 1M contexte, multimodal
Local Qwen3.5-9B flash, default, thinking, vision Option 1, 9B dense
Qwen3.8-27B flash, default, thinking, vision, max Option 2, 27B dense

Frameworks

Outil Usage
Hermes Usage général, raisonnement
OpenCode DevSecOps
Kilo Code Développement pur

Mémoire

Pour la couche d'embedding vectoriel (RAG, mémoire sémantique) :

QR Code

QR Code

Scanner pour accéder à cette page