| Couche | Modèle | Alias(s) | Taille |
|---|---|---|---|
| Hybrid-Cloud | Qwen3.6-35B | flash, default, thinking, vision | Option 1, 35B MoE / 3B actif |
| Qwen3.8-Flash-Next | flash, default, thinking, vision, max | Option 2, 125B MoE, 51B n-grames internes, 6B actif, 1M contexte | |
| MiniMax-H3 | video | 33B dense | |
| BGE-M3 | embedding | 568M | |
| BGE-reranker-v2-m3 | reranker | 568M | |
| FLUX.2-klein-4B | image | 4B | |
| GLiNER2.5-Multi-V1 | privacy | 287M, mDeBERTa-v3-base Privacy Filter api-llm-privacy-proxy-gliner2-5 | |
| Public-Cloud | GLM-5.3-Flash | max | 320B MoE / 18B actif — 1M contexte, multimodal |
| Local | Qwen3.5-9B | flash, default, thinking, vision | Option 1, 9B dense |
| Qwen3.8-27B | flash, default, thinking, vision, max | Option 2, 27B dense |
| Outil | Usage |
|---|---|
| Hermes | Usage général, raisonnement |
| OpenCode | DevSecOps |
| Kilo Code | Développement pur |
Pour la couche d'embedding vectoriel (RAG, mémoire sémantique) :
QR Code
Scanner pour accéder à cette page