WikiGEO & IA

Titans (architecture)

Architecture LLM Google DeepMind avec mémoire long-terme. Mémorise préférentiellement les passages à haute Surprise.

Définition

Architecture de LLM de Google DeepMind combinant attention court-terme et mémoire neuronale long-terme. Peut gérer des contextes de plus de 2 millions de tokens. Les contenus à haute Surprise Metric sont préférentiellement mémorisés lors de l'inférence.

Titans gère trois mémoires : immédiate, longue durée, permanente

Titans, publié par Google DeepMind, introduit la mémorisation active pendant l'inférence, sans réentraînement. Trois couches : le Core (attention classique sur le focus actuel), la Neural Memory (un réseau profond qui apprend à mémoriser en temps réel les informations à fort gradient de surprise) et la Persistent Memory (les connaissances fixes : entités fortes, faits invariants, noms établis).

Les chiffres du paper : plus de 2 millions de tokens de contexte

Le paper revendique des contextes de plus de 2 millions de tokens, contre environ 8 000 à 200 000 pour un Transformer classique, et des résultats supérieurs à GPT-4 sur le benchmark BABILong (raisonnement long contexte) avec moins de paramètres.

Deux façons d'être retenu : être un nom établi ou surprendre le modèle

Si les moteurs génératifs adoptent ce type d'architecture, la stratégie de contenu bascule : maximiser le gradient de surprise plutôt que la seule pertinence sémantique. Deux voies pour exister dans la mémoire d'un modèle : être un fait invariant de sa Persistent Memory (un nom établi sur son sujet), ou percer sa Neural Memory par la surprise. Le contenu moyen, lui, est compressé puis oublié.

Parlons de votre projet.

Je vous prépare un pré-audit de votre site et l'on en discute durant notre visio.