Como a IA transforma o mundo em números: escalares, vetores, matrizes e tensores

Entenda como escalares, vetores, matrizes e tensores formam a base matemática dos modelos de IA, de embeddings a redes neurais e LLMs.

Compartilhar
Como a IA transforma o mundo em números: escalares, vetores, matrizes e tensores

Matemática para IA - Parte 01

Quando usamos ChatGPT, geramos uma imagem com inteligência artificial ou fazemos uma busca semântica, parece que a máquina está trabalhando diretamente com palavras, imagens e conceitos. Mas, por baixo de tudo isso, existe uma realidade muito mais simples: os modelos de inteligência artificial trabalham com números.

Explicação em vídeo deste artigo

Abrir no YouTube

Textos, imagens, sons e características de objetos precisam ser convertidos em estruturas matemáticas antes que um modelo consiga processá-los. É aqui que entram quatro conceitos fundamentais: escalares, vetores, matrizes e tensores.

Quase tudo que entra, circula e sai de um modelo de IA pode ser representado por números organizados em vetores, matrizes ou tensores.

1. O elemento mais simples: o escalar

Um escalar é simplesmente um número. Por exemplo:

temperatura = 27.5
idade = 35
learning_rate = 0.001

Apesar de simples, escalares aparecem continuamente em sistemas de IA: taxa de aprendizado, probabilidades, pesos individuais e valores de funções de perda são alguns exemplos.

2. Vetores: representando objetos através de números

Imagine que queremos representar uma pessoa usando três características: idade, altura e peso. Podemos escrever essa representação como:

x = [35, 1.80, 90]

Agora não temos apenas um número, mas um vetor. O ponto mais importante é não pensar no vetor apenas como uma lista: ele pode ser a representação matemática de alguma coisa.

Um carro poderia ser representado por velocidade, peso, potência e consumo. Um posto de combustível poderia ser representado por preço, latitude, longitude e volume. Essa transformação de objetos em números é central para Machine Learning.

3. De vetores para significado: embeddings

Como um computador pode representar a palavra café? Modelos modernos utilizam vetores para representar palavras, frases, documentos, imagens e outros objetos.

café      = [ 0.72, 0.41,  0.88]
chá       = [ 0.69, 0.39,  0.84]
automóvel = [-0.42, 0.91, -0.35]

Os vetores de “café” e “chá” são relativamente semelhantes. Isso nos leva a uma ideia central da IA moderna:

Significado pode ser representado geometricamente.

Essas representações são chamadas de embeddings. Embeddings reais podem possuir centenas ou milhares de dimensões. Mais adiante, conceitos como produto escalar, distância e similaridade de cosseno permitirão medir matematicamente o quanto duas representações são semelhantes.

4. Matrizes: números organizados em duas dimensões

Suponha que tenhamos três pessoas, cada uma representada por idade, altura e peso:

X = [
  [35, 1.80, 90],
  [28, 1.65, 65],
  [42, 1.75, 82]
]

Isso é uma matriz: números organizados em linhas e colunas. Matrizes também possuem uma função ainda mais importante em IA: elas podem representar transformações.

5. Uma das equações mais importantes das redes neurais

Uma expressão aparecerá repetidamente quando estudamos redes neurais:

y = Wx + b

Nela, x é o vetor de entrada, W é uma matriz de pesos e b é um vetor de bias.

Considere:

x = [2, 3]
W = [[0.5, 0.2],
     [0.1, 0.8]]
b = [0.1, 0.2]

O produto Wx resulta em:

[1.6, 2.6]

Somando b:

y = [1.7, 2.8]

Essa operação aparentemente pequena está diretamente relacionada ao funcionamento de redes neurais.

6. O que representa a matriz W?

W é a matriz de pesos que parametriza a transformação. A transformação linear propriamente dita ocorre em Wx. Quando acrescentamos b, temos Wx+b, uma transformação afim.

Durante o treinamento, os valores existentes em W e b são ajustados pelo algoritmo de aprendizado. Em outras palavras, o modelo aprende quais valores devem existir nas matrizes de pesos para transformar suas entradas nas saídas desejadas.

7. Tensores: quando precisamos de mais dimensões

Vetores possuem uma dimensão e matrizes possuem duas. Dados reais frequentemente exigem mais dimensões. Para isso utilizamos tensores.

  • Escalar: 0D — um único valor.
  • Vetor: 1D — uma sequência de valores.
  • Matriz: 2D — linhas e colunas.
  • Tensor: 3D ou mais — imagens, batches e sequências.

Uma imagem RGB de 1920 × 1080 possui três canais de cor. Portanto, pode ser representada por:

1920 × 1080 × 3

8. E o que significa 1 × 1920 × 1080 × 3?

Uma imagem isolada pode possuir dimensão 1920 × 1080 × 3. Se acrescentarmos uma dimensão na frente, 1 × 1920 × 1080 × 3, esse primeiro valor pode representar o batch.

Com 32 imagens, por exemplo:

32 × 1920 × 1080 × 3

O primeiro número indica que temos 32 imagens sendo processadas juntas.

9. Como isso aparece em um LLM?

Considere a frase: “O café brasileiro é excelente.” Antes de ser processada, ela é dividida em tokens. De maneira simplificada:

["O", "café", "brasileiro", "é", "excelente"]

Cada token recebe uma representação vetorial. Se cada token tivesse um embedding de 768 dimensões, teríamos uma estrutura de 5 × 768.

Se processarmos 32 sequências simultaneamente:

32 × 5 × 768
↑    ↑   ↑
batch tokens embedding

Modelos reais usam sequências muito maiores e representações com milhares de dimensões, mas a ideia fundamental é a mesma.

10. Aprenda a perguntar: o que cada dimensão significa?

Ao trabalhar com NumPy, PyTorch ou TensorFlow, veremos frequentemente algo como:

tensor.shape
# (32, 512, 4096)

Em vez de apenas aceitar os números, devemos criar o hábito de perguntar: o que cada dimensão representa?

Por exemplo, 32 pode representar o batch, 512 a quantidade de tokens e 4096 a dimensão do embedding.

11. Uma representação mental para guardar

Escalar → um valor.

Vetor → um objeto representado por várias características.

Matriz → vários objetos ou uma transformação.

Tensor → dados multidimensionais processados pelos modelos.

12. Da realidade até o modelo

Um modelo não recebe diretamente o conceito humano de café, carro ou pessoa. Ele recebe representações numéricas. A inteligência emerge das transformações aprendidas sobre essas representações.

13. Exercício rápido

  1. Se temos temperatura = 27.5, estamos trabalhando com um escalar, vetor, matriz ou tensor?
  2. Se uma pessoa é representada por [idade, peso, altura], qual estrutura temos?
  3. Como classificaríamos uma imagem RGB com dimensão 1920 × 1080 × 3?
  4. Na equação y = Wx+b, o que representa W?

14. O que vem depois?

Agora sabemos como a IA organiza informação numericamente. A próxima pergunta é: se duas palavras são representadas por vetores, como determinar matematicamente se elas possuem significados semelhantes?

No próximo artigo da série veremos vetores como objetos geométricos: direção, magnitude, norma e distância. Isso prepara o terreno para produto escalar e similaridade de cosseno.


Este artigo faz parte da série Fundamentos Matemáticos para Inteligência Artificial, do MirandasTech.

Gostou do artigo? Compartilhe. Conhecimento ganha força quando circula.