Todo assistente de IA trabalha dentro de uma janela de contexto: a quantidade de texto que ele consegue considerar de uma vez. Cabe ali o seu pedido, a conversa até aquele ponto, os documentos anexados e a resposta que ele está escrevendo. O que não cabe, ele não vê.
O que isso explica
- Ele “esqueceu” o que você disse no início de uma conversa longa. A conversa passou do limite e o começo saiu da janela, ou ficou tão longe que perdeu peso.
- Ele respondeu com base no documento errado. Você anexou três; a janela estava cheia; ele priorizou o que estava mais perto do fim.
- A resposta ficou pior depois de muitas trocas. Contexto cheio de tentativas e correções confunde. É o motivo do hábito de uma conversa por assunto.
Tokens, a unidade de medida
A janela é medida em tokens, pedaços de palavra. Em português, uma palavra costuma valer entre um e dois tokens. Você não precisa contar; precisa saber que existe um limite, que documentos longos o consomem rápido, e que nas ferramentas pagas o limite costuma ser maior. Quando um fornecedor fala em “janela de um milhão de tokens”, está dizendo que cabem centenas de páginas de uma vez.
O que a janela não é
Não é memória. Quando a conversa termina, a janela se esvazia. Se você abrir outra, o assistente começa do zero, a não ser que a ferramenta tenha um recurso de memória entre conversas, que é assunto do próximo tópico.
Uma regra prática
Se a tarefa depende de muita informação, dê a informação no início, de forma organizada, e faça o pedido depois. Se a conversa ficou longa e a qualidade caiu, resuma o que importa em um parágrafo, abra uma conversa nova e cole o resumo. É o que qualquer pessoa experiente faz, e leva um minuto.