AIARTIGO

Por trás de cada prompt existe muito mais matemática do que magia.

Por trás de cada prompt existe muito mais matemática do que magia.
Imagem: Cezar Taurion

Tenho visto muita gente querendo trabalhar com LLMsLLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI começando diretamente por prompts, RAG, agentes, frameworks e APIs. Tudo isso é útil. Mas, se a intenção é compreender tecnicamente o que acontece dentro de um modelo, existe uma camada anterior difícil de evitar: matemática.

Isso não significa precisar ser matemático. O nível necessário depende do que se pretende fazer. Mas alguns conceitos ajudam muito a deixar de enxergar o LLM como uma caixa-preta.

Eu começaria por álgebra linear, que considero a base mais importante. Um token é inicialmente uma unidade discreta associada a um índice. Esse índice é usado para selecionar um vetor de embedding, que fornece uma representação inicial daquele token. À medida que atravessa as camadas do Transformer, essa representação é continuamente transformada e passa a depender do contexto.

É importante entender o que significa “dimensão” aqui. Não estamos falando necessariamente de características diretamente interpretáveis como “cor”, “tamanho” ou “sentimento”. São coordenadas aprendidas pelo modelo em espaços de alta dimensionalidade.

Por isso, vetores e matrizes aparecem em toda parte. Grande parte das representações internas pode ser descrita por vetores, enquanto muitas das transformações aprendidas envolvem multiplicações por matrizes.

O produto escalar é particularmente importante porque produz um número a partir de dois vetores e aparece no cálculo da atenção. No mecanismo de atenção, ele ajuda a produzir um escore aprendido de compatibilidade ou relevância entre representações. Normas medem magnitude e conceitos de geometria em alta dimensão ajudam a entender por que relações entre vetores são tão importantes.

Isso aparece claramente na expressão Attention(Q,K,V) = softmax(QKᵀ/√dₖ)V. Q significa Query, K, Key, e V, Value. Eles são obtidos por projeções aprendidas das representações que chegam à camada. Uma interpretação útil, embora simplificada, é pensar em Q como aquilo que uma posição busca, K como as características utilizadas para determinar a relevância das demais posições e V como a informação que será ponderada e combinada.

O produto entre Q e K produz os escores de atenção. A divisão por √dₖ ajuda a controlar sua escala. O softmax transforma os escores em pesos normalizados e esses pesos determinam como os valores V serão combinados. Essa é apenas uma parte do mecanismo completo de atenção, mas já mostra quanta álgebra linear existe dentro de uma única operação.

A segunda base é probabilidade e estatística. Um LLM autoregressivo recebe um contexto e produz uma distribuição sobre os possíveis próximos tokens. Se escrevo “A capital da França é”, o modelo não precisa recuperar uma frase armazenada. Ele calcula escores, chamados logits, para os possíveis próximos tokens.

O softmax transforma esses logits em uma distribuição de probabilidades. Dependendo da tokenização, “Paris” pode corresponder a um ou mais tokens, mas a continuação correspondente tende a receber probabilidade elevada em um modelo que tenha aprendido adequadamente essa regularidade.

É aqui que probabilidade condicional começa a fazer sentido. O modelo está essencialmente estimando algo como P(próximo token | tokens anteriores). Depois que um token é selecionado, ele passa a fazer parte do contexto e o processo se repete. Assim, uma sequência pode ser produzida token por token.

Isso também ajuda a entender temperatura, top-k e top-p. Temperatura modifica a distribuição utilizada na decodificação. Top-k restringe os candidatos aos k tokens mais bem pontuados. Top-p seleciona o menor conjunto dos tokens mais prováveis cuja massa de probabilidade acumulada atinge ou ultrapassa determinado limiar p. São mecanismos de decodificação, não formas diferentes de conhecimento do modelo.

Aqui aparecem também exponenciais e logaritmos. O softmax utiliza exponenciais para transformar logits em valores positivos normalizados. Log-probabilidades são particularmente úteis quando lidamos com sequências, pois transformam produtos de probabilidades em somas e ajudam a evitar problemas numéricos associados à multiplicação de muitos valores pequenos.

A terceira base é cálculo diferencial. Durante o treinamento, precisamos determinar como alterações nos parâmetros afetariam a função de perda. É aí que entram derivadas e gradientes.

Uma derivada responde, intuitivamente: se eu alterar um pouco este valor, quanto o resultado muda? Como a função de perda depende de um enorme número de parâmetros, suas derivadas parciais indicam sua sensibilidade local em relação a cada um deles. O conjunto dessas derivadas forma o gradiente. A regra da cadeia permite propagar essas relações através das sucessivas operações da rede. O backpropagation é o procedimento eficiente utilizado para calcular esses gradientes através do grafo computacional.

Isso nos leva à quarta base: otimização. O backpropagation calcula os gradientes. O otimizador determina como utilizá-los para atualizar os parâmetros. O gradient descent procura reduzir a função de perda realizando atualizações na direção oposta ao gradiente. O learning rate controla o tamanho dessas atualizações. Pequeno demais pode tornar o aprendizado lento; grande demais pode produzir instabilidade.

Em vez de calcular o gradiente sobre todo o conjunto de treinamento antes de cada atualização, normalmente utilizamos mini-batches. O gradiente calculado sobre cada mini-batch funciona como uma estimativa do gradiente do objetivo definido sobre a distribuição de treinamento.

Técnicas como momentum incorporam informações de atualizações anteriores. Otimizadores como Adam mantêm estimativas de momentos dos gradientes e as utilizam para adaptar as atualizações dos parâmetros.

A conhecida metáfora da bola descendo uma montanha ajuda, mas tem limites. Um LLM com bilhões de parâmetros cria um problema de otimização em um espaço de parâmetros de altíssima dimensionalidade, com regiões planas, diferentes curvaturas e saddle points, pontos em que a curvatura pode ter sinais diferentes dependendo da direção considerada.

E o objetivo não é simplesmente obter o menor erro possível nos dados de treinamento. Queremos também generalização: que o modelo apresente desempenho adequado diante de combinações e situações que não apareceram exatamente daquela forma durante o treinamento.

A quinta base é teoria da informação. A entropia pode ser entendida, simplificando, como uma medida de incerteza associada a uma distribuição. Se praticamente toda a probabilidade está concentrada em uma possibilidade, há pouca incerteza. Se está distribuída entre muitas possibilidades, há mais.

A cross-entropy é central no pré-treinamento autoregressivo. Em vez de falar em “token correto”, é mais rigoroso falar no token observado nos dados de treinamento.

Para esse token, a contribuição para a perda é essencialmente Loss = −log P(token observado | contexto). Se o modelo atribui alta probabilidade ao token observado, a perda é pequena. Se atribui probabilidade muito baixa, a penalização é grande.

O treinamento pode, portanto, ser visto como o processo de ajustar os parâmetros para aumentar, em média, a probabilidade atribuída aos tokens observados nos dados. E vale uma precisão importante: cross-entropy não é, tecnicamente, uma métrica de distância.

Por fim, entramos em uma área que já aproxima a matemática da engenharia: métodos numéricos e representação computacional. Toda essa matemática precisa ser executada em GPUs e outros aceleradores, e números precisam ser representados com quantidade finita de bits.

FP32, FP16, BF16 e FP8 utilizam diferentes formatos e oferecem diferentes compromissos entre precisão, faixa numérica, memória e desempenho. Menos bits não significa simplesmente “menos qualidade”. BF16, por exemplo, possui características de precisão e faixa numérica diferentes de FP16.

Quantização vai além, representando pesos e, dependendo da técnica, ativações ou outros valores com menos bits. Isso pode reduzir significativamente o consumo de memória e, em determinadas condições, acelerar a inferência. Mas menor precisão numérica não garante automaticamente menor latência: o resultado depende também de hardware, kernels, arquitetura e implementação.

Overflow, underflow, estabilidade numérica e precisão mista importam porque uma equação matematicamente correta pode apresentar problemas quando executada com representações numéricas finitas.

É aqui que matemática encontra engenharia. No fundo, essas áreas contam partes diferentes da mesma história. Álgebra linear ajuda a explicar como representações são construídas e transformadas. Probabilidade descreve como o modelo distribui suas previsões. Cálculo mostra como medimos a sensibilidade da perda aos parâmetros. Otimização determina como esses parâmetros são atualizados. Teoria da informação ajuda a formular objetivos de treinamento. Métodos numéricos determinam como toda essa matemática pode ser executada eficientemente em hardware real.

Mas existe ainda uma ressalva importante. Compreender essa matemática não significa compreender integralmente por que determinadas capacidades aparecem nas representações aprendidas pelo modelo. Saber calcular a atenção ou o gradiente não significa saber interpretar causalmente tudo aquilo que um Transformer aprendeu.

É justamente aí que entram áreas como interpretabilidade mecanística, análise de ativações, circuitos e intervenções causais.

Não precisamos dominar tudo isso para usar um LLM, construir um RAG ou criar um agente. Mas existe uma enorme diferença entre saber operar a tecnologia e compreender os princípios que tornam seu funcionamento possível.

Quanto mais quisermos avançar da primeira dimensão para a segunda, mais a matemática deixa de ser apenas conhecimento complementar e passa a fazer parte da linguagem necessária para compreender o que realmente acontece dentro desses modelos.

É CEO da Litteris Consulting. Profissional e estudioso de Tecnologia da Informação desde fins da década de 70, com educação formal diversificada, em Economia, mestrado em Ciência da Computação e MBA em Marketing de Serviços, e experiência profissional moldada pela passagem em empresas de porte mundial. Escreve constantemente sobre tecnologia da informação em publicações especializadas como CIO Magazine, Mundo Java, além do iMasters, e apresenta palestras em eventos e conferências de renome. É autor de sete livros que abordam assuntos como Software Livre, Grid Computing, Software Embarcado, Cloud Computing e Big data.

Ver perfil