Une sortie structurée pour une décision précise
Router un ticket, classer une publicité ou filtrer une page demande parfois une décision dans un format connu. Un long texte généré peut ajouter du travail d'extraction sans répondre à un besoin de rédaction. Il faut donc préciser la sortie attendue avant de choisir le modèle.
TypeSafe AI présente Jev comme un « System One Model » qui reçoit un état, par exemple une page, une publicité, un ticket ou un DOM, puis renvoie une décision structurée avec un score de confiance. Les sorties annoncées sont typées. Cette approche mérite d'être évaluée pour les microdécisions répétées d'un workflow.
Le choix dépend du travail demandé. Un modèle spécialisé peut servir au routage, au classement, au filtrage ou à l'évaluation. Le raisonnement et les cas ambigus peuvent rester confiés à un LLM. La frontière entre ces usages doit être définie sur des exemples représentatifs.
Les chiffres de TypeSafe AI et leur périmètre
Dans sa démonstration, TypeSafe AI annonce 724 publicités analysées en 40 secondes pour 0,09 $. Le fournisseur indique un workflow 193,6 fois plus rapide et 444,6 fois moins cher qu'un LLM sur le cas testé, ainsi qu'un tarif de 0,042 $ par million de tokens d'entrée.
Ces chiffres proviennent du fournisseur et ne constituent pas un benchmark indépendant. Le gain annoncé concerne le workflow testé. Avant de l'utiliser dans une estimation budgétaire, il faut vérifier les données d'entrée, le modèle comparé et les critères retenus pour accepter une décision.
Le test doit aussi préciser ce qu'il inclut : appels au modèle, préparation des entrées, traitement des sorties et gestion des exceptions. Une comparaison qui omet une partie de ces dépenses peut surestimer l'intérêt d'une solution. Les multiplicateurs annoncés ne garantissent pas le même résultat dans votre environnement.
Calculer le coût par décision correcte
Le prix du token renseigne sur un tarif. Pour évaluer le workflow, je retiendrais le coût d'une décision correcte : la dépense totale sur un périmètre donné, rapportée au nombre de décisions acceptées comme justes. Cela demande une définition commune de ce qui est correct.
Le calcul doit inclure les nouveaux essais après échec, le traitement des sorties, les corrections et le temps humain consacré aux exceptions. Un modèle économique à l'appel peut perdre son avantage si ses réponses nécessitent davantage de reprises.
On peut alors comparer, sur les mêmes cas, des règles métier, un modèle spécialisé et un LLM généraliste. Les règles peuvent suffire lorsque la décision est déjà explicite. Les modèles doivent être évalués là où leurs capacités apportent un résultat utile, avec les mêmes exigences de qualité.
Prévoir le traitement des décisions incertaines
Le score de confiance peut servir à orienter les cas vers un traitement automatique ou une revue humaine. Une confiance insuffisante doit déclencher un parcours prévu, avec un responsable capable d'examiner la décision. Le seuil ne remplace pas la mesure des erreurs réellement observées.
Il faut suivre combien de décisions passent en revue, combien sont corrigées et quel effort cette revue demande. Un seuil prudent peut augmenter la charge humaine ; un seuil trop permissif peut laisser passer davantage d'erreurs. Le réglage doit être testé sur votre usage.
Les cas ambigus peuvent également être orientés vers un LLM avant une intervention humaine. Il s'agit d'une option de conception à comparer, en tenant compte de la qualité finale, du délai et du coût cumulé de ce parcours.
Construire un pilote comparable
Commencez par choisir une microdécision et définir son format de sortie, son volume et sa tolérance à l'erreur. Constituez un échantillon représentatif de vos entrées, avec des décisions de référence et une procédure pour arbitrer les désaccords.
Sur ce même échantillon, mesurez la qualité, le temps de traitement, les exceptions et le coût complet des options retenues. Documentez le seuil de confiance et le périmètre confié au LLM. Ces étapes sont des suggestions de méthode, pas une validation du produit.
Après le pilote, conservez les données qui justifient le choix et prévoyez une revue périodique. Un changement de volume, de nature des entrées ou de tarification peut modifier le coût par décision correcte et conduire à revoir le routage.
Le post à l’origine de cette analyse
Article développé à partir du post LinkedIn. Les liens ci-dessous sont ceux du post d’origine ; leur présence ne constitue pas une vérification indépendante.
LinkedIn ↗