Aller au contenu

Article

Modèles de langage locaux en finance d’entreprise — quand les données ne doivent pas sortir

Les livres des clients d’un cabinet comptable, la paie, les contrats — certaines données ne doivent jamais être collées dans un chat en ligne, si bon soit le modèle. Un modèle exécuté sur votre propre machine résout ce problème au prix de la puissance et du confort. Ci-dessous : quand cela suffit, ce que cela coûte et à quoi cela ressemble dans trois usages que j’ai construits.

Auteur: Tomasz FordymackiPublié le:

Cloud ou serveur propre — comparaison

CritèreModèle local (Ollama, 7–14 Md de paramètres)Modèle cloud (p. ex. Claude)
Donnéesne quittent pas la machine — aucun contrat de sous-traitance, aucune question du clientpartent chez le fournisseur ; anonymisation et contrat requis ; certains clients refuseront
Qualité du raisonnementbonne sur des tâches étroites (classification, extraction) ; faible sur les longues analysesnettement meilleure ; gère les documents longs et le raisonnement
Coûtmatériel (machine à grande mémoire ou GPU : quelques milliers de złoty une fois) + électricitéà partir de quelques dizaines de złoty par mois à petite échelle ; croît avec le volume
Vitessequelques secondes à une dizaine par document sur une machine ordinaire ; secondes sur GPUsecondes, quel que soit le matériel
Maintenancemises à jour du modèle et d’Ollama de votre côté ; fonctionne hors lignezéro maintenance ; dépendance au fournisseur et à ses tarifs
Quand je le choisiscabinet comptable, paie, données multi-clients, client à politique « rien à l’extérieur »analyses, rapports, traductions, données anonymisées, mes propres outils

Trois usages qui fonctionnent en local

  1. 1Classer les libellés d’écritures dans le contrôleur des livresL’export du logiciel comptable contient des libellés du type « fact. 12/03 serv. transp. + palettes » — une règle ne sait pas si c’est du transport ou de l’emballage. Le modèle local reçoit le libellé et la liste des postes de gestion et renvoie une proposition avec un niveau de confiance ; sous le seuil, cela va à la comptable. Les données des quatorze sociétés du cabinet ne quittent pas son serveur, et la comptable valide une douzaine de cas par jour au lieu d’en lire des centaines.
  2. 2Un glossaire avec recherche sémantique (RAG)La base de 176 termes financiers à l’origine de FinGloss tourne sur un modèle local de plongements et un modèle local de réponse : la question « quelle différence entre dette nette et passifs » retrouve les termes les plus proches, et la réponse cite la source. Le modèle n’invente pas, car il ne répond qu’à partir de ce qu’il a trouvé — c’est toute la différence entre le RAG et « demander au chat ».
  3. 3Extraire des champs de contrats et facturesParties, montants, délais de paiement, préavis — du PDF au tableau, avec contrôle d’échantillon par un humain. En analyse pré-transaction, c’est la liste des contrats importants en une heure au lieu de deux jours ; les données de la cible restent sur la machine, ce qui compte une fois le NDA signé.

Ce qu’un modèle local ne fera pas bien

  • Il n’écrira pas un commentaire de résultat envoyable à la direction sans réécriture — les phrases sont correctes mais plates et parfois fausses dans le détail.
  • Il ne lira pas un contrat de cent pages d’un coup — la fenêtre de contexte des petits modèles est trop courte ; il faut découper, ce qui nuit aux réponses sur l’ensemble.
  • Il ne calcule pas — comme aucun modèle de langage. L’arithmétique dans du code, testée, toujours.
  • Il ne remplace pas l’anonymisation quand les données doivent de toute façon atteindre un tiers (auditeur, banque) — la localité ne protège que cette étape.

Service : automatisation de la finance et IA

Article : quoi automatiser et quoi ne pas confier au modèle

Questions fréquentes

Quel matériel faut-il ?

Pour des modèles de 7 à 8 milliards de paramètres, une machine de 16 Go de mémoire suffit — une tâche courte répond en quelques secondes. Un modèle de 14 milliards veut 32 Go ; un GPU (à partir d’environ 12 Go de mémoire propre) accélère tout plusieurs fois. Un serveur de cabinet à 64 Go traitera une file de tâches nocturne pour une douzaine de sociétés.

Un modèle local est-il conforme au RGPD « par défaut » ?

Il résout un problème — l’absence de transfert de données à un tiers. Il ne résout pas les autres : base légale, conservation, accès, sauvegardes, journaux contenant des données. L’architecture à passerelle et zones s’applique de la même façon ; la localité retire simplement de la liste le contrat de sous-traitance avec un fournisseur de modèle.

Quels modèles ?

Cela change tous les quelques mois, je ne m’attache donc pas aux noms. La règle : pour la classification et l’extraction — le plus petit modèle qui réussit un test sur cent de vos exemples ; pour les plongements — un modèle multilingue, car les libellés polonais s’en sortent moins bien dans un modèle anglophone. Un test sur vos propres données compte plus qu’un classement en ligne.

Parlons de votre situation

Écrivez quelques phrases sur la société et le problème. Je réponds sous deux jours ouvrés et le premier échange est gratuit.

M’écrire

Ce site compte les visites sans cookies. Avec votre accord, j’activerai aussi Google Analytics (un cookie de 2 ans) pour savoir quels calculateurs et articles sont lus. Sans accord, rien ne part chez Google. Détails dans les mentions légales.