LFM2.5-DSpark : jusqu'à 3,2× plus rapide pour l'inférence
Le 20 août 2026, Hugging Face a présenté LFM2.5-DSpark, un modèle optimisé pour les tâches d'inférence. Conçu sur la base de l'architecture LFM2.5, il exploite des techniques de quantisation dynamique et de parallélisation avancée pour réduire le temps de calcul. Les premiers benchmarks montrent une amélioration de la vitesse allant jusqu'à 3,2 fois par rapport aux versions précédentes, tout en maintenant une précision comparable.
Cette performance est obtenue grâce à une intégration native avec les GPU modernes et les accélérateurs LPU de Groq, permettant une utilisation plus efficace de la mémoire et du débit de données. Les développeurs peuvent ainsi déployer des modèles plus lourds sur des infrastructures existantes sans augmenter les coûts d'inférence.
L'impact se fait déjà sentir dans les domaines du traitement du langage naturel, de la vision par ordinateur et des systèmes de recommandation, où la latence réduite améliore l'expérience utilisateur et ouvre la voie à de nouvelles applications temps réel.