Skip to content

Qwen 3.5 Small : L'IA qui tient dans votre poche

🎙️ Podcast : Écouter (6 min)


Alibaba complète la famille Qwen 3.5 avec quatre modèles compacts qui redéfinissent ce qu'on peut attendre de l'IA légère. 0.8B, 2B, 4B, 9B — tous open source (Apache 2.0), tous nativement multimodaux.

Le plus surprenant ? Le 9B surpasse le Qwen3-30B de la génération précédente sur la plupart des benchmarks, et bat GPT-5-Nano sur les tests de vision.


La ligne complète

Modèle Paramètres VRAM (BF16) VRAM (4-bit) Usage cible
Qwen3.5-0.8B 0.8B ~1.6 GB ~0.5 GB Téléphone, Raspberry Pi, n'importe quel GPU
Qwen3.5-2B 2B ~4 GB ~1.5 GB Laptop GPU, mobile SoC
Qwen3.5-4B 4B ~8 GB ~3 GB RTX 3060 12GB, M1/M2 Mac
Qwen3.5-9B 9B ~18 GB ~5 GB RTX 3090/4090, M2 Pro+ Mac

Tout le monde a les mêmes specs : - Contexte natif : 262K tokens (extensible à ~1M pour le 9B via YaRN) - Multimodal natif : Texte, image, vidéo — pas d'adaptateur, pas de modèle vision séparé - Architecture : Gated DeltaNet hybride (3:1 linéaire:plein attention) - Langues : 201 langues et dialectes - Licence : Apache 2.0 (y compris les modèles base)


Les chiffres qui choquent

9B vs 30B — David bat Goliath

Le Qwen3.5-9B en mode "thinking" surpasse le Qwen3-30B (3× plus gros) sur plusieurs benchmarks clés :

Benchmark Qwen3.5-9B Qwen3-30B Qwen3-80B
GPQA Diamond 81.7 73.4 77.2
IFEval 91.5 88.9 88.9
LongBench v2 55.2 44.8 48.0
MMLU-Pro 82.5 80.9 82.7

Il devance le 80B sur le raisonnement complexe (GPQA), le suivi d'instruction (IFEval) et les tâches long-context. C'est l'architecture Qwen 3.5 qui fait sa magie : meilleur attention, RL renforcé, pretraining multimodal natif.

Vision — Écraser GPT-5-Nano

Sur les benchmarks multimodaux, le 9B écrase GPT-5-Nano d'OpenAI :

Benchmark Qwen3.5-9B GPT-5-Nano Écart
MMMU-Pro 70.1 57.2 +13
MathVision 78.9 62.2 +17
OmniDocBench 1.5 87.7 55.9 +32

Ce ne sont pas des marginales — ce sont des raclées dans un modèle moins d'un tiers la taille de ce qu'OpenAI facture.

Les petits tiennent la route

Même les 0.8B et 2B postent des scores qui auraient impressionné l'an dernier :

Benchmark Qwen3.5-2B Qwen3.5-0.8B
OCRBench 84.5 74.5
VideoMME 75.6 63.8
MathVista 76.7 62.2

Le 2B surpasse des modèles 7B de la génération précédente. Le 0.8B est vraiment utile pour le déploiement edge : 62.2 sur MathVista depuis moins d'un milliard de paramètres.


Architecture — Ce qui les rend différents

Ce ne sont pas des versions rapetissées d'un gros modèle. Ils sont conçus pour leur échelle avec les innovations Qwen 3.5 :

Gated DeltaNet hybride — Basé sur le papier Gated Delta Networks, combine le mécanisme de gated decay de Mamba2 avec la règle delta pour les mises à jour d'état caché. Les couches d'attention linéaire gèrent le calcul de routine avec une complexité mémoire constante, tandis que les couches d'attention complètes gèrent le raisonnement critique de précision. Le ratio 3:1 (trois blocs DeltaNet pour un bloc d'attention complète) garde la mémoire bornée tout en préservant la qualité.

DeepStack Vision Transformer — L'encodeur vision utilise des patch embeddings Conv3d pour capturer la dynamique temporelle vidéo et fusionne des features de plusieurs couches (pas juste la couche finale). C'est pourquoi même le 0.8B peut comprendre la vidéo.

Strong-to-weak distillation — Les petits modèles ont été entraînés par distillation de connaissances depuis les gros modèles teacher (397B et medium series), avec transfert off-policy et on-policy. Pour les modèles à cette échelle, la distillation bat le RL direct.

Multi-token prediction (MTP) — Les quatre modèles prédisent plusieurs tokens à la fois pendant l'inférence, offrant un speedup direct sans perte de qualité.


Pourquoi ça matters

L'espace des "petits modèles" s'agite.

  • Google Gemma 3 offre 1B et 4B mais sans vision native partout
  • Meta Llama 3.2 small est text-only aux petites tailles
  • Microsoft Phi-4-mini à 14B est fort mais 50% plus gros que le 9B et text-focused

Qwen 3.5 est la première famille où : - Un 0.8B peut traiter de la vidéo - Un 4B peut servir d'agent multimodal léger - Un 9B bat les modèles 30B de la génération précédente

Pour les développeurs qui buildent de l'IA on-device, le calcul vient de changer. L'an dernier, faire tourner un modèle multimodal en local voulait dire 13B+ et un GPU sérieux. Aujourd'hui, un 4B avec 262K de contexte gère texte, images et vidéo depuis 8GB de VRAM.


Disponibilité

Plateformes : HuggingFace, ModelScope, llama.cpp, vLLM, SGLang, MLX

Quantization : GGUF et variantes disponibles pour les 4 modèles

Base models : Inclus pour recherche et fine-tuning

Code : GitHub QwenLM/Qwen3.5


Sources


Article rédigé le 2 mars 2026 à 22:15 GMT+1