Unidade 10 / 10

Aplicação ponta a ponta: avaliação, validação, ética e limites

Ganhos:

  • Capacidade de configurar um pequeno conjunto de testes (eval) que avalia um modelo com seus próprios dados
  • Incorpore verificação humana, limites e política de uso responsável no fluxo de trabalho
  • Reconhecer riscos de alucinação, privacidade e éticos e implementar medidas de mitigação

Você escolheu o modelo certo; O trabalho está concluído? Não, o verdadeiro trabalho começa agora. Colocar um modelo em seu negócio se resume a testá-lo em relação aos seus próprios dados, validar seus resultados e enquadrá-los de forma responsável. Esta unidade final transforma todo o módulo em um aplicativo de ponta a ponta: você aprenderá como configurar um pequeno conjunto de testes (avaliação), incorporar a verificação humana ao fluxo de trabalho, gerenciar riscos de alucinação e privacidade e traçar limites éticos. Assim que a unidade estiver concluída, você estará equipado não apenas para selecionar um modelo, mas também para comissioná-lo com confiança.

Avaliação (Eval): Teste com seus próprios dados

Agora você sabe que apenas seus dados reais, e não os anúncios, podem dizer se um modelo se adapta ao seu negócio. A forma de medir isso é configurar um conjunto de avaliação (eval): uma pequena coleção de amostras do seu trabalho para as quais a resposta correta é conhecida.

Uma avaliação simples é configurada assim:

  1. Colete de 10 a 30 amostras reais. Escolha insumos típicos do seu trabalho (misture difícil e fácil).
  2. Determine a "saída correta/esperada" para cada exemplo. O que um especialista responderia?
  3. Execute os candidatos através dos mesmos exemplos. Teste os modelos que você está comparando um por um com o mesmo conjunto.
  4. Pontue os resultados. Em quantos exemplos isso é verdade? Onde ele errou? Os erros são aceitáveis?
  5. Compare e escolha. Escolha não a pontuação geral mais alta, mas aquela que for mais confiável nos exemplos mais críticos para você.
Dica: não confie cegamente nas tabelas de classificação. Um modelo pode ficar em primeiro lugar a nível global, mas ter um desempenho pior do que o modelo que ocupa o segundo lugar nos seus textos jurídicos turcos específicos. Sua própria avaliação de 20 amostras vale mais do que centenas de testes públicos.

Alucinação: o risco mais insidioso do modelo

Uma alucinação ocorre quando o modelo produz informações que não são realmente verdadeiras, em uma linguagem confiável. Em vez de dizer “não sei”, o modelo pode produzir uma peça legislativa inexistente, uma estatística inventada ou uma data falsa; Além disso, ele faz isso com uma linguagem extremamente convincente. Este é o aspecto mais perigoso da IA ​​porque o erro se disfarça de verdade.

Você não pode eliminar completamente a alucinação, mas pode reduzi-la e capturá-la:

  • Baseie-se na fonte: peça ao modelo para gerar respostas a partir dos documentos que você fornece, não de sua própria “memória” (lógica RAG).
  • Fontes de solicitação: Diga: “Ao lado de cada reivindicação, escreva o documento/seção em que ela se baseia”; Se ele não puder fornecer a fonte, desconfie.
  • Fazer com que as pessoas digam que não têm certeza: A instrução “Se você não tiver certeza, escreva 'não está claro'” reduz o ajuste do modelo.
  • Verificação humana: os resultados críticos devem ser verificados por um ser humano.
Cuidado: Nunca use a saída do modelo sem validá-la para decisões legais, médicas ou financeiras. Um “artigo jurídico” ou “informação sobre dose” produzido pelo modelo pode ser completamente fabricado. Nestas áreas, a IA é uma ferramenta preliminar/projecto; Uma pessoa competente sempre tem a última palavra.

Requisito para verificação humana

A inteligência artificial funciona melhor como uma ferramenta que acelera as pessoas, e não as deixa sem trabalho. A configuração correta é a seguinte: produz ou pré-qualifica o rascunho do modelo; o humano analisa, corrige e aprova. O rigor da verificação depende do custo do erro.

Missão

Custo do erro

verificação humana

Rascunho da descrição do produto

baixo

O controle da amostra é suficiente

Resposta por e-mail do cliente

médio

Revisão pré-envio

Análise de risco de contrato

alto

Confirmação de especialista artigo por artigo

Aconselhamento médico/financeiro

muito alto

Verificação completa de especialistas, apenas suporte de IA

Esta tabela estabelece o equilíbrio entre "verificar manualmente cada saída" e "não verificar nada". Embora o controlo por amostragem seja suficiente para trabalhos de baixo custo, todos os resultados devem ser verificados para trabalhos de alto preço.

Uso Ético e Responsável

Embora a seleção do modelo possa parecer uma decisão técnica, existem responsabilidades éticas por trás dela:

  • Transparência: informe seus clientes ou funcionários que você está usando IA em locais apropriados. Um cliente tem o direito de saber se está falando com um ser humano ou com uma IA.
  • Viés: os modelos podem herdar o viés dos dados nos quais são treinados. Monitorize a equidade dos resultados em áreas sensíveis, como recrutamento e avaliação de crédito.
  • Privacidade: incorpore os princípios de proteção de dados que você aprendeu na unidade 8 no fluxo de trabalho; Não envie dados pessoais de forma imprudente.
  • Responsabilidade: Quando ocorre um erro, a defesa “A IA conseguiu” não é suficiente. A responsabilidade é da instituição que utiliza o veículo. Portanto, processos de verificação de documentos.
Dica: escreva uma pequena “política de uso responsável” em seu fluxo de trabalho: quais trabalhos podem usar IA, quais dados não podem ser enviados, quem irá verificá-los e como os erros serão relatados. Este documento de uma página evita grandes problemas no futuro.

Três casos realistas

Caso 1 — Arrependimento sem estabelecer avaliação. Uma equipe de seguros começa a resumir os sinistros sem testar o modelo mais popular. Depois de duas semanas, eles percebem que o modelo comete frequentemente erros em termos técnicos turcos e lê alguns valores incorretamente. Quando eles configuram uma avaliação de 20 amostras e comparam os três modelos, eles mudam para o modelo que não é o mais popular, mas é mais preciso nos textos técnicos turcos. A perda: duas semanas e trabalho de revisão. Lição: avaliar primeiro, implantar depois.

Caso 2 — O processo que capta a alucinação. Um paralegal vê uma referência à “decisão da Suprema Corte” no modelo impresso. Como o processo deles tem uma regra de “verificar todas as referências”, ele procura a decisão e descobre que tal decisão não existe; Ele inventou um modelo. Graças à verificação humana, as informações fabricadas nunca chegam ao cliente. Sem a regra de verificação, a perda de reputação poderia ter sido grave.

Caso 3 — Confiança com transparência. Uma empresa de comércio eletrônico produz respostas de suporte ao cliente com IA, mas adiciona uma nota abaixo de cada resposta: “Esta resposta foi preparada com suporte de inteligência artificial e foi revisada por um de nossos representantes”. Os clientes ficam mais satisfeitos com a resposta rápida e com a confiança de ver um ser humano engajado. A transparência não é uma fraqueza a esconder, mas uma fonte de confiança.

Prompt Fraco / Prompt Forte: Resultado Verificável

Alerta fraco:

Conte-me sobre as cláusulas arriscadas deste contrato.

Pode caber no modelo; nenhuma fonte, nenhum sinal de incerteza.

Alerta poderoso:

Sua função: analista de contratos (a decisão final cabe a um advogado). Tarefa: Destacar cláusulas potencialmente arriscadas no contrato a seguir. Para cada descoberta: (1) número da cláusula e citação literal, (2) por que é arriscado, (3) seu nível de confiança (alto/médio/baixo). Confie apenas nas cláusulas do texto; Não invente nada que não esteja no texto. Se você não tiver certeza, escreva “é necessária a confirmação do advogado”. [contrato]

Um prompt forte vincula cada afirmação à fonte (número do artigo + citação), exige nível de confiança e proíbe a fabricação; Isso torna a alucinação captável.

Modelos copiáveis

1. Cenografia de avaliação:

Projete um conjunto de avaliação para a seguinte tarefa [TASK]. Sugira 15 amostras de entradas (mistas fáceis-médias-difíceis), como o "resultado correto esperado" seria definido para cada uma e determine um critério de pontuação (1-5).

2. Envoltório redutor de alucinações:

Reescreva o seguinte prompt para reduzir a fabricação: "[PROMPT]". Adicione regras para citar fontes, especificando níveis de confiança e "diga-me se não tiver certeza".

3. Projeto do fluxo de verificação:

No fluxo de trabalho a seguir [WORKFLOW] Projete uma etapa de verificação humana para a saída de IA. Determinar quão rigorosa deve ser a verificação com base no custo do erro; escreva quem verificará o quê, quando.

4. Elaborar política de uso responsável:

Elabore uma "política de uso responsável de IA" de uma página para uma equipe em [INDÚSTRIA]. Inclua os seguintes títulos: usos permitidos, dados proibidos, responsabilidade de verificação, relatórios de transparência, relatórios de erros.

Erros comuns

  • Implantando sem avaliação: iniciar o modelo sem testá-lo com seus próprios dados e perceber erros após eles serem refletidos no cliente/trabalho.
  • Baseando-se na alucinação: Usar a linguagem confiante do modelo como verdade sem verificar as referências.
  • Ignorando a verificação humana: Deixando os resultados desmarcados em decisões de alto custo; Apoiando-se na defesa “AI fez isso”.
  • Evitar a transparência: ocultar o uso da IA; experimentando perda de confiança quando isso ocorre.
  • Ignorar a ética e o preconceito: Utilizar decisões sensíveis (contratação, crédito) sem monitorar a justiça dos resultados.

Em resumo

  • Antes de implantar um modelo, configure um pequeno conjunto de avaliações com seus próprios dados e teste os candidatos; as classificações gerais não representam o seu negócio.
  • A alucinação é a produção confiante de linguagem falsa pelo modelo; Capturado por atribuição de origem, nível de confiança e verificação humana.
  • O rigor da verificação humana é ajustado de acordo com o custo do erro; Em áreas críticas a IA é apenas suporte, a decisão é humana.
  • Transparência, controle de preconceitos, confidencialidade e responsabilização; são os quatro pilares do uso responsável da IA. A política de uma página evita grandes riscos.

Tarefa de aplicativo

Configure um conjunto de avaliação de 15 exemplos com o modelo 1 nesta unidade (design do conjunto de avaliação) para o(s) modelo(s) candidato(s) selecionado(s) ao longo do módulo e compare pelo menos dois modelos com esse conjunto. Em seguida, projete como o resultado será verificado por humanos com o modelo 3 (fluxo de validação) e esboce uma política de uma página para sua equipe com o modelo 4 (política de uso responsável). Esses três resultados transformam todo o módulo em um plano de implantação viável.

lista de verificação

  • [] Com meus próprios dados, posso configurar um pequeno conjunto de avaliações e comparar modelos.
  • [ ] Consigo reconhecer alucinações e aplicar medidas mitigadoras e de prisão.
  • [] Posso ajustar o rigor da verificação humana com base no custo do erro.
  • [ ] Posso incorporar princípios de transparência, parcialidade, confidencialidade e responsabilidade no fluxo de trabalho.
  • [] Posso redigir uma política de uso responsável de IA de uma página.

Exame do Módulo

1. Qual é a diferença entre um “fornecedor” de IA e uma “família modelo”?

  • A) O fornecedor é a empresa que desenvolve o modelo, e a família modelo é o grupo modelo dessa empresa sob uma marca ✔
  • B) Eles são exatamente a mesma coisa e são usados de forma intercambiável
  • C) Provedor é o preço do modelo, família do modelo é a velocidade do modelo.
  • D) Família do modelo refere-se à empresa, fornecedor refere-se a uma única versão do modelo

Descrição: O fornecedor é a empresa que desenvolveu o modelo (ex.: Anthropic); Família modelo é o grupo modelo que aquela empresa reúne sob uma marca (por exemplo, Claude). A versão do modelo é uma versão específica dentro da família.

2. Como podem os “pesos” de um modelo ser definidos com maior precisão?

  • A) É o número de tokens que o modelo pode produzir por minuto
  • B) São os bilhões de parâmetros numéricos que o modelo aprende durante o treinamento e armazena suas informações. ✔
  • C) É a assinatura mensal do modelo
  • D) É o número de idiomas suportados pelo modelo

Descrição: Pesos são bilhões de parâmetros numéricos que o modelo aprende durante o treinamento; É onde está armazenado “tudo o que o modelo sabe”. A distinção de peso fechado/explícito depende se esses parâmetros podem ser baixados e executados.

3. Qual afirmação é verdadeira sobre 'peso aberto' e 'código aberto'?

  • A) São exatamente os mesmos conceitos e ambos oferecem uso comercial ilimitado
  • B) O peso aberto sempre torna os dados de treinamento públicos também
  • C) Não é a mesma coisa; Na ponderação aberta, normalmente apenas os parâmetros são compartilhados e os termos da licença podem limitar o uso comercial ✔
  • D) Modelos de código aberto não podem ser baixados, modelos de peso aberto podem ser baixados

Explicação: Na ponderação aberta, apenas os parâmetros do modelo são compartilhados; os dados e processos de treinamento muitas vezes não são divulgados e algumas licenças limitam o uso comercial. Portanto, 'peso aberto' não é exatamente o mesmo que 'código aberto'.

4. Qual das alternativas a seguir é a característica do modelo mais decisiva para uma equipe jurídica que lê e analisa contratos longos?

  • A) Ter o preço simbólico mais baixo
  • B) Ter capacidade de processamento visual (multimodal)
  • C) Ter uma licença de peso aberta
  • D) Ter uma ampla janela de contexto ✔

Explicação: O modelo precisa de uma grande janela de contexto para processar documentos longos como um todo; A janela de contexto é a quantidade total de tokens que o modelo pode ter em mente por vez.

5. O que é verdade sobre o preço de tokens para modelos de peso fechado?

  • A) O token de saída geralmente é significativamente mais caro que o token de entrada ✔
  • B) A entrada e a saída têm sempre exatamente o mesmo preço
  • C) Cobrada apenas uma taxa mensal fixa, o valor de uso é irrelevante
  • D) O token de entrada é sempre muitas vezes mais caro que o de saída

Explicação: O preço é calculado por token, e o token de saída que o modelo produz geralmente é várias vezes mais caro do que o token de entrada que você envia. Portanto, impressões longas e desnecessárias aumentam rapidamente os custos.

6. Qual recurso de um modelo é essencial para uma equipe de contabilidade que deseja extrair automaticamente dados de imagens de faturas?

  • A) Janela de contexto mais ampla possível
  • B) Multimodalidade (capacidade de processamento visual) ✔
  • C) Licença de peso aberta
  • D) O mais alto nível de raciocínio

Explicação: Para compreender o conteúdo visual, o modelo deve ser capaz de processar imagens e também texto, ou seja, deve ser multimodal. Multimodalidade é a capacidade do modelo de lidar com vários tipos de dados, como texto, imagens e, às vezes, áudio.

7. Qual é a escolha mais lógica para uma tarefa simples e de grande volume (por exemplo, classificação positiva/negativa de milhares de avaliações)?

  • A) Sempre o modelo de raciocínio mais forte e mais caro
  • B) Um modelo que funciona apenas em peso aberto e em servidor próprio
  • C) Um modelo leve e de baixo custo, pois a tarefa é simples e o volume é alto ✔
  • D) O modelo com a janela de contexto mais ampla

Descrição: Um modelo leve e de baixo custo resolve tarefas simples e de alto volume; Usar o modelo mais poderoso e caro cria custos desnecessários aqui. A abordagem correta é combinar a dificuldade da tarefa com a camada do modelo.

8. O que desencadeia o envio de texto contendo dados pessoais para um fornecedor de IA estrangeiro em termos de KVKK?

  • A) Não cria qualquer responsabilidade legal
  • B) Só importa se o fornecedor estiver na UE, em nenhum outro caso
  • C) É estritamente proibido em todas as circunstâncias, independentemente de os dados serem anônimos ou não
  • D) A transferência de dados para o exterior é considerada e está sujeita às condições especiais da KVKK ✔

Explicação: A operação de dados nos servidores de um fornecedor no estrangeiro é considerada 'transferência de dados para o estrangeiro' e está sujeita às condições especiais da KVKK sobre este assunto (tais como consentimento explícito, decisão de adequação, garantias adequadas).

9. O que faz o modo de “raciocínio” de um modelo e como afeta o custo?

  • A) Aumenta a precisão em problemas complexos, mas aumenta o custo e o atraso à medida que gera mais tokens ✔
  • B) Sempre libera o modelo
  • C) Apenas aumenta o número de idiomas suportados pelo modelo
  • D) Sempre encurte as respostas e reduza o custo

Descrição: O modo de raciocínio permite que o modelo 'pense' passo a passo antes de dar a resposta; Aumenta a precisão em problemas complexos e de várias etapas, mas também aumenta o custo e o atraso porque gera mais tokens.

10. Qual é a abordagem mais confiável ao avaliar (avaliar) um modelo para o seu próprio negócio?

  • A) Basta escolher o modelo mais popular e usá-lo sem testar
  • B) Configure um pequeno conjunto de testes de suas próprias tarefas reais e compare modelos com ele ✔
  • C) Basta olhar para a pontuação de benchmark mencionada nos anúncios
  • D) Aceitar automaticamente o modelo com a janela de contexto mais alta como o melhor

Explicação: em vez de confiar cegamente nas tabelas de classificação, criar um pequeno conjunto de testes de suas próprias tarefas reais e comparar os modelos desse conjunto revelará aquele que realmente se adapta ao seu negócio.

11. Como o conhecimento de que a saída do modelo pode conter “alucinações” deve moldar o seu fluxo de trabalho?

  • A) O resultado deve sempre ser considerado correto e publicado diretamente
  • B) A alucinação só é vista em modelos gratuitos, não em modelos pagos
  • C) Em decisões críticas, a saída deve ser verificada por um humano e as fontes devem ser confirmadas ✔
  • D) A alucinação pode ser completamente eliminada simplesmente mudando o modelo

Explicação: Uma alucinação ocorre quando o modelo produz informações que não são realmente verdadeiras, em uma linguagem confiável. Devido a este risco, a verificação dos resultados por um ser humano deve ser exigida, especialmente para decisões legais, médicas e financeiras.

12. Qual é a lógica básica da abordagem de “carteira modelo” adotada pelas instituições maduras?

  • A) Garantir a simplicidade, fazendo com que cada trabalho seja realizado por um modelo único e mais caro.
  • B) Usar apenas o modelo mais barato e ignorar completamente a qualidade
  • C) Não utilize nenhum modelo e faça todo o trabalho manualmente
  • D) Otimizando custos e reduzindo a dependência de um único fornecedor utilizando diferentes modelos de acordo com a tarefa ✔

Descrição: O portfólio de modelos utiliza diferentes modelos de acordo com a tarefa: modelo barato para trabalhos simples e volumosos, modelo poderoso para trabalhos complexos, modelo aberto/regional para dados confidenciais. Isto otimiza custos e reduz a dependência de um único fornecedor.

13. Por que o país de origem e a política de retenção de dados podem ser um critério para a seleção do modelo?

  • A) Porque impacta diretamente os requisitos regulatórios, de soberania de dados e de privacidade ✔
  • B) Somente porque determina a velocidade de resposta do modelo
  • C) Porque determina os formatos de arquivo suportados pelo modelo
  • D) Por não ter efeito prático, é apenas um detalhe de marketing

Descrição: País onde está localizado o desenvolvedor do modelo e onde/quantos dados estão armazenados; É decisivo em termos de regulamentação legal, soberania de dados e privacidade. Por exemplo, para uma organização que pretenda hospedar na UE, um fornecedor regional ou uma opção de armazenamento zero torna-se importante.

14. O que melhor explica por que é enganoso procurar um “melhor modelo único” numa tarefa?

  • A) Todos os modelos têm exatamente os mesmos recursos
  • B) Os modelos são fortes em tamanhos diferentes, então o 'melhor' depende da necessidade do trabalho ✔
  • C) O modelo mais caro é automaticamente o melhor em todas as tarefas
  • D) A seleção do modelo deve ser feita de forma totalmente aleatória

Descrição: Os modelos são fortes em diferentes dimensões como velocidade, custo, contexto, multimodalidade, privacidade e raciocínio. Um modelo que é líder numa dimensão pode ser fraco noutra; então 'melhor' sempre depende dos requisitos do trabalho.