Aller au contenu
KOR IT

KOR IT LAB / 01

AI Lab

L'AI Lab existe pour répondre à des questions opérationnelles sur les systèmes agentiques auxquelles la documentation ne répond pas : ce que coûte réellement une charge d'agent sur une machine donnée, où se situe véritablement la contrainte, et à quoi ressemble le comportement d'un agent lorsque chaque étape est instrumentée.

Sécurité de l'IA
  • Inférence locale
  • Modèles ouverts
  • Architectures d'agents
  • Mémoire
  • Performance
  • IA souveraine
Machine
AMD EPYC 7451 · 24C/48T · 256 Go ECC · NVMe · Proxmox
Inférence
llama.cpp avec des modèles ouverts de la famille Qwen
État
PostgreSQL · Qdrant · MinIO
EXPÉRIENCE 01Laboratoire actif

Caractérisation d'une charge d'agent à 64K de contexte

Question

Pour une boucle d'agent qui reconstruit à chaque tour un prompt long et largement répété, où se situe la contrainte de performance sur une machine sans GPU ?

Méthode

Nous avons mesuré la configuration telle qu'elle est réellement utilisée, et non un meilleur cas synthétique. Le prefill et la génération sont rapportés séparément, parce qu'un chiffre unique de tokens par seconde masque la structure de coût des charges agentiques, où le prompt est long, largement répété, et reconstruit à chaque tour.

Mesure de laboratoire — configuration testée
Longueur de contexte testée
64K
Débit de prefill
22,5 tok/s
Débit de génération agrégé
33,5 tok/s
Taux de hit du cache de préfixe
94,4 %

Mesure relevée sur une configuration testée dans un environnement expérimental. Ce n'est pas un benchmark, et elle n'est transposable ni à un autre matériel, ni à un autre modèle, ni à une autre charge de travail.

Constats

  • Le prefill, et non la génération, est la contrainte pour cette charge : 22,5 tok/s de prefill contre 33,5 tok/s de génération agrégée à 64K de contexte, ce qui inverse l'intuition héritée de l'usage conversationnel.
  • Le cache de préfixe domine la réactivité de la boucle d'agent à long contexte. Comme les tours d'agent reconstruisent un prompt largement identique, le taux de hit mesuré de 94,4 % pèse davantage sur la latence perçue que le débit brut de génération.
  • Le placement NUMA n'est pas un détail de réglage sur une machine à quatre domaines. La performance d'inférence y est gouvernée par la localité mémoire, et le placement doit être décidé délibérément plutôt que laissé à l'ordonnanceur.

Limites

  • Le débit a été relevé sous charge de laboratoire, non sous usage multi-agent concurrent soutenu.
  • Le comportement observé est propre aux modèles de la famille Qwen testés ; aucune affirmation n'est faite sur d'autres modèles ouverts ou sur des modèles hébergés.
EXPÉRIENCE 02Laboratoire actif

La médiation des outils comme trace comportementale

Question

Faire transiter chaque appel d'outil d'un agent par une passerelle de médiation unique produit-il une meilleure description de son comportement que l'inspection de sa sortie ?

Méthode

Toutes les invocations d'outils du laboratoire passent par une passerelle unique qui enregistre l'appel, ses arguments, la décision de politique et le résultat. Nous avons ensuite comparé ce que cette trace dit de l'action de l'agent à ce que l'agent lui-même prétendait avoir fait.

Constats

  • La séquence des invocations d'outils décrit bien mieux ce qu'un agent a fait que sa narration de ce qu'il comptait faire.
  • La médiation rend le comportement de l'agent lisible d'une manière que l'inspection de la sortie du modèle ne permet pas — la trace de la passerelle est complète par construction, alors que la narration est un artefact généré.
  • Une fois la médiation en place, la politique a un endroit où exister : autoriser, revoir et mettre en quarantaine deviennent des décisions implémentables plutôt que des instructions de prompt.

Limites

  • Le laboratoire n'a aucun adversaire extérieur. Le contenu non fiable y est introduit par nous, donc le modèle de menace est éprouvé contre des attaques auxquelles nous avions déjà pensé.
  • Le bac à sable est éprouvé face à de l'exécution de code ordinaire, non face à une tentative d'évasion déterminée par un attaquant compétent.

Prochaines expériences

Écrites avant d'être menées, pour que les résultats soient jugés à l'aune de ce que nous cherchions et non de ce que nous avons remarqué en chemin.

01

Mesurer le débit et le comportement du cache au-dessus et en dessous de 64K pour caractériser le point où le coût de prefill devient prohibitif sur cette machine.

02

Instrumenter l'exécution multi-agent concurrente pour trouver le point où le placement NUMA cesse de tenir.

03

Comparer le comportement de complétion des agents selon que les permissions d'outils sont appliquées à la passerelle ou seulement par instruction de prompt.

This page is available in English Votre navigateur privilégie l'anglais. KOR IT publie une version anglaise de cette page.

Read in English