Explorar guias

Artigos de AI Glossary

162

Speech-to-Text

O speech-to-text moderno é preciso o bastante na maioria dos sotaques e em condições ruidosas para ser usado sem supervisão em rascunhos. Ele sustenta atas de reunião, legendas e interfaces de voz. A acurácia ainda cai com jargão de domínio, falas sobrepostas e idiomas pouco representados. Na prática: Uma ligação de uma hora transcrita e resumida antes de você sair da sala.

Supervisão Humana

O Artigo 14 exige que sistemas de alto risco sejam projetados de modo que pessoas naturais consigam supervisioná-los de forma efetiva — o que inclui compreender capacidades e limites, ficar atento ao viés de automação, interpretar a saída, decidir não usar o sistema e intervir ou parar a operação. A supervisão precisa ser projetada dentro do sistema, não apenas afirmada em uma política. Na prática: Um controle de parada visível e um revisor com autonomia e treino para usá-lo. ...

System Prompt

O system prompt fica acima do turno do usuário e persiste ao longo da sessão, definindo quem é o assistente e o que ele deve e não deve fazer. É onde os times de produto colocam voz, escopo e regras de recusa. Ele é influente, mas não é uma fronteira de segurança — trate-o como configuração, não como um controle que os usuários não conseguem alcançar. Na prática: ‘Você é um agente de suporte de uma fintech da UE. Nunca dê conselhos financeiros. Responda em menos de 120 palavras.’ ...

Taxa de Aprendizado

Taxa de aprendizado alta demais e o treinamento passa do ponto e diverge; baixa demais e ele se arrasta ou empaca. A maioria das rodadas reais usa um agendamento, começando maior e decaindo ao longo do tempo. É o exemplo clássico de hiperparâmetro: definido por você, não aprendido pelo modelo. Na prática: Mesmos dados, mesma arquitetura, taxa de aprendizado 10× alta demais — a perda vai para o infinito.

Temperatura

A temperatura remodela a distribuição de probabilidade sobre o próximo token. Perto de zero, o modelo quase sempre escolhe a sua opção preferida, o que dá saídas repetíveis e conservadoras. Valores mais altos achatam a distribuição e deixam passar tokens improváveis, o que soa como criatividade e, passado certo ponto, como besteira. Na prática: Temperatura 0 para extração de dados; 0.8 para brainstorm de slogans.

Template de Prompt

Um template congela as partes que funcionam e parametriza as partes que mudam. É o ponto em que fazer prompts deixa de ser um truque pessoal e passa a ser algo que um time pode versionar, testar e melhorar. Templates também são o que torna possível avaliar prompts, já que você mantém a estrutura constante. Na prática: ‘Resuma {document} para {audience} em {n} bullet points.’

Test-Time Compute

Test-time compute é o segundo eixo de escala. Em vez de um modelo maior, você deixa o modelo existente deliberar por mais tempo, gerar várias tentativas ou conferir o próprio trabalho. Isso te dá um botão ao vivo de qualidade versus custo, que antes ficava fixo no momento do treino. Na prática: Mesmo modelo, dez vezes mais orçamento de pensamento, matemática bem melhor.

Text-to-Image

Sistemas de text-to-image combinam um componente de compreensão de linguagem com um gerador de difusão, de modo que o prompt guia a remoção de ruído em direção aos pixels correspondentes. A qualidade da saída depende muito da especificidade do prompt — assunto, estilo, composição e iluminação, tudo precisa ser dito. O uso comercial levanta questões de direitos que variam por ferramenta e por jurisdição. Na prática: ‘Ilustração isométrica de um data center, paleta suave, luz de contorno delicada.’ ...

Text-to-Speech

O text-to-speech atual produz prosódia natural e consegue clonar uma voz a partir de uma amostra curta. É essa capacidade que fez do consentimento e da divulgação em clonagem de voz questões jurídicas e éticas concretas, em vez de teóricas. Na prática: Um curso narrado com voz consistente ao longo de 40 aulas, sem estúdio.

Text-to-Video

O text-to-video estende a difusão ao longo do tempo, o que acrescenta a restrição difícil de manter os quadros consistentes entre si. Duração do clipe, plausibilidade física e consistência de personagem são os limites atuais. A área anda rápido o bastante para que qualquer afirmação específica de capacidade envelheça em questão de meses. Na prática: Uma cena de produto de dez segundos gerada em vez de filmada.