Salut à tous,
La semaine dernière je bossais tranquille chez moi sur Rennes sur un chatbot pour un client qui a une boutique en ligne, il veut un truc qui gère le support client avec un minimum d'intelligence, genre qui se souvient de la commande précédente sans que le client ait à tout réexpliquer à chaque message.
Du coup je passe pas mal de temps sur la partie gestion du contexte et mémoire longue, comment on garde une conversation cohérente sur plusieurs échanges sans que le LLM parte en vrille ou oublie ce qui a été dit trois messages avant. J'ai éplucher pas mal de threads sur Reddit et des forums plus spécialisés pour voir comment d'autres gèrent ça, et franchement il y a pas mille façons de faire, entre le fine-tuning et les systèmes de mémoire externe genre vector store.
En cherchant des retours d'architecture je suis tombé sur plusieurs services de ai porn chat qui semblent tourner sur des stacks pas si différentes au final, LLM fine-tuné plus génération d'image à la volée. Ce qui m'intéresse surtout c'est la cohérence narrative sur la durée... j'ai vu passer des abonnements autour de 5 ou 6 dollars par mois sur ces plateformes, ça laisse penser que le coût d'inférence doit être optimisé sérieusement quelque part. Si quelqu'un a des billes techniques là dessus, je suis preneur. Merci d'avance.
Architecture technique derrière les services de ai porn chat, quelqu'un a des infos ?
-
Stephanes5
- Messages : 1
- Enregistré le : Aujourd’hui, 10:18
