DeepSeek est une entreprise chinoise spécialisée dans les grands modèles de langage, ces systèmes capables de générer du texte, d’écrire du code ou de résoudre certains problèmes à partir d’instructions. Installée à Hangzhou, elle s’adresse au grand public par son assistant conversationnel, mais aussi aux développeurs et aux entreprises par son API et ses modèles téléchargeables. Son site, deepseek.com, donne accès à ses services et à sa documentation.
Une origine ancrée dans la recherche quantitative
DeepSeek a été fondée en 2023 par Liang Wenfeng, également cofondateur de High-Flyer, un fonds chinois spécialisé dans l’investissement quantitatif. Le projet bénéficie de cet environnement, où le calcul intensif et l’apprentissage automatique occupent une place importante. Il se distingue toutefois des activités financières du fonds par son objectif : développer des modèles d’intelligence artificielle généralistes.
L’entreprise gagne en visibilité avec DeepSeek-V2 en 2024, puis DeepSeek-V3 à la fin de la même année. En janvier 2025, la publication de DeepSeek-R1, centré sur les tâches de raisonnement, élargit son audience internationale. Ses résultats alimentent alors le débat sur les ressources réellement nécessaires pour construire des modèles performants.
Des modèles ouverts, des services et une recherche d’efficacité
Les activités de DeepSeek couvrent la conception de modèles, leur entraînement et leur mise à disposition. Ses systèmes peuvent être utilisés pour la rédaction, la programmation, l’analyse de documents et la résolution de problèmes mathématiques. L’API permet d’intégrer ces fonctions dans des applications tierces, tandis que les poids publiés offrent la possibilité de déployer certains modèles sur une infrastructure choisie par l’utilisateur, sous réserve des capacités matérielles nécessaires et des licences applicables.
Sur le plan technique, DeepSeek-V3 utilise une architecture dite « mixture of experts » : seule une partie des paramètres est mobilisée pour chaque traitement. Cette approche vise à limiter le calcul nécessaire. DeepSeek-R1 explore notamment l’apprentissage par renforcement pour améliorer le raisonnement. L’entreprise publie des rapports techniques permettant d’examiner ses méthodes et ses évaluations.
Cette ouverture doit être qualifiée : rendre les poids accessibles ne signifie pas publier toutes les données ni l’intégralité du processus d’entraînement. De même, les coûts d’entraînement communiqués pour un modèle ne représentent pas nécessairement l’ensemble des dépenses de recherche, d’infrastructure et d’exploitation.
Et maintenant ?
La trajectoire de DeepSeek dépendra de sa capacité à maintenir la qualité de ses modèles tout en assurant des services fiables. Pour les entreprises utilisatrices, les critères de choix dépassent les résultats aux tests : confidentialité des données, sécurité, conditions d’hébergement, disponibilité et conformité réglementaire pèsent également dans les décisions.
Son développement s’inscrit aussi dans un contexte de restrictions américaines sur l’exportation de certaines puces avancées vers la Chine. L’efficacité logicielle constitue donc un enjeu stratégique. Pour DeepSeek, le défi sera de transformer la visibilité acquise grâce à ses publications en usages durables, dans un marché où les modèles ouverts et les offres propriétaires évoluent rapidement.