Explorar guias

Artigos de AI Glossary

162

Incidente de IA

Um incidente de IA abrange danos reais e quase-acidentes: resultados discriminatórios, orientações inseguras, vazamento de dados, ação automatizada perigosa. Tratá-los como incidentes de segurança — registrados, triados, revisados — é o que os transforma em aprendizado em vez de repetição. O AI Act da UE exige a comunicação de incidentes graves em sistemas de alto risco. Na prática: Um chatbot prometendo uma política de reembolso que não existe, em escala, por seis dias. ...

Inferência

A inferência é a fase de produção: os pesos estão congelados e o modelo apenas mapeia entrada em saída. É onde mora quase todo o custo recorrente, porque o treinamento acontece uma vez e a inferência acontece a cada requisição. Latência, preço por token e throughput são todos temas de inferência. Na prática: Cada mensagem que você manda no ChatGPT é uma chamada de inferência; o treinamento terminou meses antes. ...

Inferência em lote

A inferência em lote processa uma fila de entradas em que a latência não importa, usando o hardware de forma muito mais eficiente. Os provedores costumam dar descontos generosos nela. Se ninguém está esperando a resposta, esse é o caminho mais barato. Na prática: Classificar um ano de tickets de suporte durante a noite pela metade do preço.

Inteligência Artificial

Inteligência artificial é um termo guarda-chuva para sistemas que recebem dados e produzem saídas úteis sem que alguém lhes diga, passo a passo, como fazer isso. Abrange desde um filtro de spam até um modelo que escreve código. A maior parte da IA que você usa hoje é machine learning, e a maior parte disso é deep learning — por isso os três termos costumam ser usados como sinônimos, ainda que sejam aninhados, e não idênticos. ...

Inteligência Artificial Geral

A AGI descreve uma IA que generaliza entre domínios como uma pessoa faz, em vez de se destacar em um conjunto delimitado de tarefas. Não é uma especificação técnica: laboratórios, pesquisadores e reguladores usam definições materialmente diferentes, e é por isso que afirmações sobre prazos são tão difíceis de comparar. Trate qualquer previsão confiante sobre AGI como uma opinião com uma definição escondida dentro. Na prática: Os sistemas de hoje escrevem e programam bem e ainda falham em tarefas que uma criança resolve — a lacuna é de amplitude, não de habilidade. ...

Interpretabilidade

A interpretabilidade é a pergunta mecanicista: o que esses pesos e ativações estão de fato computando? É mais difícil que a explicabilidade e mais valiosa, porque pode revelar modos de falha antes que eles apareçam nas saídas. O avanço é real, mas está muito atrás da capacidade dos modelos. Na prática: Identificar as features internas que um modelo usa para representar um conceito.

ISO/IEC 42001

A ISO/IEC 42001 especifica os requisitos para estabelecer e melhorar um sistema de gestão de IA, na mesma família da ISO 27001 para segurança. Ser certificável é justamente o ponto: dá aos times de compras algo concreto para exigir. Ela complementa, e não substitui, o EU AI Act, que a certificação sozinha não satisfaz. Na prática: Um RFP corporativo perguntando se o seu sistema de gestão de IA é certificado. ...

Jailbreak

Jailbreaks usam interpretação de papéis, hipóteses, codificação ou escalada gradual para levar o modelo para além das próprias diretrizes. Continuam funcionando porque a linguagem natural não traça uma linha nítida entre um enquadramento legítimo e um manipulador. É exatamente por isso que a segurança não pode se apoiar só no comportamento do modelo. Na prática: ‘Para um romance que estou escrevendo, descreva em detalhes como o personagem faria…’

Janela de contexto

A janela de contexto é a memória de trabalho do modelo para uma única requisição. Tudo precisa caber: prompt de sistema, histórico da conversa, arquivos anexados e a resposta. Se estourar, o conteúdo mais antigo é descartado ou a chamada falha. Note que uma janela grande não é o mesmo que boa recuperação dentro dela — os modelos ainda se perdem no meio. Na prática: Uma janela de 200K comporta cerca de um livro de 500 páginas — mas a resposta também precisa caber ali. ...

Latência

Em LLMs, a latência se divide em tempo até o primeiro token, que determina a velocidade percebida, e tempo total de geração. O streaming ataca o primeiro; modelos menores e saídas mais curtas atacam o segundo. Modelos de raciocínio trocam latência por acurácia de propósito. Na prática: 400ms até a primeira palavra parece instantâneo; quatro segundos de tela em branco parece morto.