Ganhos:
- Capacidade de configurar um pequeno conjunto de testes (eval) que avalia um modelo com seus próprios dados
- Incorpore verificação humana, limites e política de uso responsável no fluxo de trabalho
- Reconhecer riscos de alucinação, privacidade e éticos e implementar medidas de mitigação
Você escolheu o modelo certo; O trabalho está concluído? Não, o verdadeiro trabalho começa agora. Colocar um modelo em seu negócio se resume a testá-lo em relação aos seus próprios dados, validar seus resultados e enquadrá-los de forma responsável. Esta unidade final transforma todo o módulo em um aplicativo de ponta a ponta: você aprenderá como configurar um pequeno conjunto de testes (avaliação), incorporar a verificação humana ao fluxo de trabalho, gerenciar riscos de alucinação e privacidade e traçar limites éticos. Assim que a unidade estiver concluída, você estará equipado não apenas para selecionar um modelo, mas também para comissioná-lo com confiança.
Avaliação (Eval): Teste com seus próprios dados
Agora você sabe que apenas seus dados reais, e não os anúncios, podem dizer se um modelo se adapta ao seu negócio. A forma de medir isso é configurar um conjunto de avaliação (eval): uma pequena coleção de amostras do seu trabalho para as quais a resposta correta é conhecida.
Uma avaliação simples é configurada assim:
- Colete de 10 a 30 amostras reais. Escolha insumos típicos do seu trabalho (misture difícil e fácil).
- Determine a "saída correta/esperada" para cada exemplo. O que um especialista responderia?
- Execute os candidatos através dos mesmos exemplos. Teste os modelos que você está comparando um por um com o mesmo conjunto.
- Pontue os resultados. Em quantos exemplos isso é verdade? Onde ele errou? Os erros são aceitáveis?
- Compare e escolha. Escolha não a pontuação geral mais alta, mas aquela que for mais confiável nos exemplos mais críticos para você.
Dica: não confie cegamente nas tabelas de classificação. Um modelo pode ficar em primeiro lugar a nível global, mas ter um desempenho pior do que o modelo que ocupa o segundo lugar nos seus textos jurídicos turcos específicos. Sua própria avaliação de 20 amostras vale mais do que centenas de testes públicos.
Alucinação: o risco mais insidioso do modelo
Uma alucinação ocorre quando o modelo produz informações que não são realmente verdadeiras, em uma linguagem confiável. Em vez de dizer “não sei”, o modelo pode produzir uma peça legislativa inexistente, uma estatística inventada ou uma data falsa; Além disso, ele faz isso com uma linguagem extremamente convincente. Este é o aspecto mais perigoso da IA porque o erro se disfarça de verdade.
Você não pode eliminar completamente a alucinação, mas pode reduzi-la e capturá-la:
- Baseie-se na fonte: peça ao modelo para gerar respostas a partir dos documentos que você fornece, não de sua própria “memória” (lógica RAG).
- Fontes de solicitação: Diga: “Ao lado de cada reivindicação, escreva o documento/seção em que ela se baseia”; Se ele não puder fornecer a fonte, desconfie.
- Fazer com que as pessoas digam que não têm certeza: A instrução “Se você não tiver certeza, escreva 'não está claro'” reduz o ajuste do modelo.
- Verificação humana: os resultados críticos devem ser verificados por um ser humano.
Cuidado: Nunca use a saída do modelo sem validá-la para decisões legais, médicas ou financeiras. Um “artigo jurídico” ou “informação sobre dose” produzido pelo modelo pode ser completamente fabricado. Nestas áreas, a IA é uma ferramenta preliminar/projecto; Uma pessoa competente sempre tem a última palavra.
Requisito para verificação humana
A inteligência artificial funciona melhor como uma ferramenta que acelera as pessoas, e não as deixa sem trabalho. A configuração correta é a seguinte: produz ou pré-qualifica o rascunho do modelo; o humano analisa, corrige e aprova. O rigor da verificação depende do custo do erro.
Missão
Custo do erro
verificação humana
Rascunho da descrição do produto
baixo
O controle da amostra é suficiente
Resposta por e-mail do cliente
médio
Revisão pré-envio
Análise de risco de contrato
alto
Confirmação de especialista artigo por artigo
Aconselhamento médico/financeiro
muito alto
Verificação completa de especialistas, apenas suporte de IA
Esta tabela estabelece o equilíbrio entre "verificar manualmente cada saída" e "não verificar nada". Embora o controlo por amostragem seja suficiente para trabalhos de baixo custo, todos os resultados devem ser verificados para trabalhos de alto preço.
Uso Ético e Responsável
Embora a seleção do modelo possa parecer uma decisão técnica, existem responsabilidades éticas por trás dela:
- Transparência: informe seus clientes ou funcionários que você está usando IA em locais apropriados. Um cliente tem o direito de saber se está falando com um ser humano ou com uma IA.
- Viés: os modelos podem herdar o viés dos dados nos quais são treinados. Monitorize a equidade dos resultados em áreas sensíveis, como recrutamento e avaliação de crédito.
- Privacidade: incorpore os princípios de proteção de dados que você aprendeu na unidade 8 no fluxo de trabalho; Não envie dados pessoais de forma imprudente.
- Responsabilidade: Quando ocorre um erro, a defesa “A IA conseguiu” não é suficiente. A responsabilidade é da instituição que utiliza o veículo. Portanto, processos de verificação de documentos.
Dica: escreva uma pequena “política de uso responsável” em seu fluxo de trabalho: quais trabalhos podem usar IA, quais dados não podem ser enviados, quem irá verificá-los e como os erros serão relatados. Este documento de uma página evita grandes problemas no futuro.
Três casos realistas
Caso 1 — Arrependimento sem estabelecer avaliação. Uma equipe de seguros começa a resumir os sinistros sem testar o modelo mais popular. Depois de duas semanas, eles percebem que o modelo comete frequentemente erros em termos técnicos turcos e lê alguns valores incorretamente. Quando eles configuram uma avaliação de 20 amostras e comparam os três modelos, eles mudam para o modelo que não é o mais popular, mas é mais preciso nos textos técnicos turcos. A perda: duas semanas e trabalho de revisão. Lição: avaliar primeiro, implantar depois.
Caso 2 — O processo que capta a alucinação. Um paralegal vê uma referência à “decisão da Suprema Corte” no modelo impresso. Como o processo deles tem uma regra de “verificar todas as referências”, ele procura a decisão e descobre que tal decisão não existe; Ele inventou um modelo. Graças à verificação humana, as informações fabricadas nunca chegam ao cliente. Sem a regra de verificação, a perda de reputação poderia ter sido grave.
Caso 3 — Confiança com transparência. Uma empresa de comércio eletrônico produz respostas de suporte ao cliente com IA, mas adiciona uma nota abaixo de cada resposta: “Esta resposta foi preparada com suporte de inteligência artificial e foi revisada por um de nossos representantes”. Os clientes ficam mais satisfeitos com a resposta rápida e com a confiança de ver um ser humano engajado. A transparência não é uma fraqueza a esconder, mas uma fonte de confiança.
Prompt Fraco / Prompt Forte: Resultado Verificável
Alerta fraco:
Conte-me sobre as cláusulas arriscadas deste contrato.
Pode caber no modelo; nenhuma fonte, nenhum sinal de incerteza.
Alerta poderoso:
Sua função: analista de contratos (a decisão final cabe a um advogado). Tarefa: Destacar cláusulas potencialmente arriscadas no contrato a seguir. Para cada descoberta: (1) número da cláusula e citação literal, (2) por que é arriscado, (3) seu nível de confiança (alto/médio/baixo). Confie apenas nas cláusulas do texto; Não invente nada que não esteja no texto. Se você não tiver certeza, escreva “é necessária a confirmação do advogado”. [contrato]
Um prompt forte vincula cada afirmação à fonte (número do artigo + citação), exige nível de confiança e proíbe a fabricação; Isso torna a alucinação captável.
Modelos copiáveis
1. Cenografia de avaliação:
Projete um conjunto de avaliação para a seguinte tarefa [TASK]. Sugira 15 amostras de entradas (mistas fáceis-médias-difíceis), como o "resultado correto esperado" seria definido para cada uma e determine um critério de pontuação (1-5).
2. Envoltório redutor de alucinações:
Reescreva o seguinte prompt para reduzir a fabricação: "[PROMPT]". Adicione regras para citar fontes, especificando níveis de confiança e "diga-me se não tiver certeza".
3. Projeto do fluxo de verificação:
No fluxo de trabalho a seguir [WORKFLOW] Projete uma etapa de verificação humana para a saída de IA. Determinar quão rigorosa deve ser a verificação com base no custo do erro; escreva quem verificará o quê, quando.
4. Elaborar política de uso responsável:
Elabore uma "política de uso responsável de IA" de uma página para uma equipe em [INDÚSTRIA]. Inclua os seguintes títulos: usos permitidos, dados proibidos, responsabilidade de verificação, relatórios de transparência, relatórios de erros.
Erros comuns
- Implantando sem avaliação: iniciar o modelo sem testá-lo com seus próprios dados e perceber erros após eles serem refletidos no cliente/trabalho.
- Baseando-se na alucinação: Usar a linguagem confiante do modelo como verdade sem verificar as referências.
- Ignorando a verificação humana: Deixando os resultados desmarcados em decisões de alto custo; Apoiando-se na defesa “AI fez isso”.
- Evitar a transparência: ocultar o uso da IA; experimentando perda de confiança quando isso ocorre.
- Ignorar a ética e o preconceito: Utilizar decisões sensíveis (contratação, crédito) sem monitorar a justiça dos resultados.
Em resumo
- Antes de implantar um modelo, configure um pequeno conjunto de avaliações com seus próprios dados e teste os candidatos; as classificações gerais não representam o seu negócio.
- A alucinação é a produção confiante de linguagem falsa pelo modelo; Capturado por atribuição de origem, nível de confiança e verificação humana.
- O rigor da verificação humana é ajustado de acordo com o custo do erro; Em áreas críticas a IA é apenas suporte, a decisão é humana.
- Transparência, controle de preconceitos, confidencialidade e responsabilização; são os quatro pilares do uso responsável da IA. A política de uma página evita grandes riscos.
Tarefa de aplicativo
Configure um conjunto de avaliação de 15 exemplos com o modelo 1 nesta unidade (design do conjunto de avaliação) para o(s) modelo(s) candidato(s) selecionado(s) ao longo do módulo e compare pelo menos dois modelos com esse conjunto. Em seguida, projete como o resultado será verificado por humanos com o modelo 3 (fluxo de validação) e esboce uma política de uma página para sua equipe com o modelo 4 (política de uso responsável). Esses três resultados transformam todo o módulo em um plano de implantação viável.
lista de verificação
- [] Com meus próprios dados, posso configurar um pequeno conjunto de avaliações e comparar modelos.
- [ ] Consigo reconhecer alucinações e aplicar medidas mitigadoras e de prisão.
- [] Posso ajustar o rigor da verificação humana com base no custo do erro.
- [ ] Posso incorporar princípios de transparência, parcialidade, confidencialidade e responsabilidade no fluxo de trabalho.
- [] Posso redigir uma política de uso responsável de IA de uma página.
Exame do Módulo
1. Qual é a diferença entre um “fornecedor” de IA e uma “família modelo”?
- A) O fornecedor é a empresa que desenvolve o modelo, e a família modelo é o grupo modelo dessa empresa sob uma marca ✔
- B) Eles são exatamente a mesma coisa e são usados de forma intercambiável
- C) Provedor é o preço do modelo, família do modelo é a velocidade do modelo.
- D) Família do modelo refere-se à empresa, fornecedor refere-se a uma única versão do modelo
Descrição: O fornecedor é a empresa que desenvolveu o modelo (ex.: Anthropic); Família modelo é o grupo modelo que aquela empresa reúne sob uma marca (por exemplo, Claude). A versão do modelo é uma versão específica dentro da família.
2. Como podem os “pesos” de um modelo ser definidos com maior precisão?
- A) É o número de tokens que o modelo pode produzir por minuto
- B) São os bilhões de parâmetros numéricos que o modelo aprende durante o treinamento e armazena suas informações. ✔
- C) É a assinatura mensal do modelo
- D) É o número de idiomas suportados pelo modelo
Descrição: Pesos são bilhões de parâmetros numéricos que o modelo aprende durante o treinamento; É onde está armazenado “tudo o que o modelo sabe”. A distinção de peso fechado/explícito depende se esses parâmetros podem ser baixados e executados.
3. Qual afirmação é verdadeira sobre 'peso aberto' e 'código aberto'?
- A) São exatamente os mesmos conceitos e ambos oferecem uso comercial ilimitado
- B) O peso aberto sempre torna os dados de treinamento públicos também
- C) Não é a mesma coisa; Na ponderação aberta, normalmente apenas os parâmetros são compartilhados e os termos da licença podem limitar o uso comercial ✔
- D) Modelos de código aberto não podem ser baixados, modelos de peso aberto podem ser baixados
Explicação: Na ponderação aberta, apenas os parâmetros do modelo são compartilhados; os dados e processos de treinamento muitas vezes não são divulgados e algumas licenças limitam o uso comercial. Portanto, 'peso aberto' não é exatamente o mesmo que 'código aberto'.
4. Qual das alternativas a seguir é a característica do modelo mais decisiva para uma equipe jurídica que lê e analisa contratos longos?
- A) Ter o preço simbólico mais baixo
- B) Ter capacidade de processamento visual (multimodal)
- C) Ter uma licença de peso aberta
- D) Ter uma ampla janela de contexto ✔
Explicação: O modelo precisa de uma grande janela de contexto para processar documentos longos como um todo; A janela de contexto é a quantidade total de tokens que o modelo pode ter em mente por vez.
5. O que é verdade sobre o preço de tokens para modelos de peso fechado?
- A) O token de saída geralmente é significativamente mais caro que o token de entrada ✔
- B) A entrada e a saída têm sempre exatamente o mesmo preço
- C) Cobrada apenas uma taxa mensal fixa, o valor de uso é irrelevante
- D) O token de entrada é sempre muitas vezes mais caro que o de saída
Explicação: O preço é calculado por token, e o token de saída que o modelo produz geralmente é várias vezes mais caro do que o token de entrada que você envia. Portanto, impressões longas e desnecessárias aumentam rapidamente os custos.
6. Qual recurso de um modelo é essencial para uma equipe de contabilidade que deseja extrair automaticamente dados de imagens de faturas?
- A) Janela de contexto mais ampla possível
- B) Multimodalidade (capacidade de processamento visual) ✔
- C) Licença de peso aberta
- D) O mais alto nível de raciocínio
Explicação: Para compreender o conteúdo visual, o modelo deve ser capaz de processar imagens e também texto, ou seja, deve ser multimodal. Multimodalidade é a capacidade do modelo de lidar com vários tipos de dados, como texto, imagens e, às vezes, áudio.
7. Qual é a escolha mais lógica para uma tarefa simples e de grande volume (por exemplo, classificação positiva/negativa de milhares de avaliações)?
- A) Sempre o modelo de raciocínio mais forte e mais caro
- B) Um modelo que funciona apenas em peso aberto e em servidor próprio
- C) Um modelo leve e de baixo custo, pois a tarefa é simples e o volume é alto ✔
- D) O modelo com a janela de contexto mais ampla
Descrição: Um modelo leve e de baixo custo resolve tarefas simples e de alto volume; Usar o modelo mais poderoso e caro cria custos desnecessários aqui. A abordagem correta é combinar a dificuldade da tarefa com a camada do modelo.
8. O que desencadeia o envio de texto contendo dados pessoais para um fornecedor de IA estrangeiro em termos de KVKK?
- A) Não cria qualquer responsabilidade legal
- B) Só importa se o fornecedor estiver na UE, em nenhum outro caso
- C) É estritamente proibido em todas as circunstâncias, independentemente de os dados serem anônimos ou não
- D) A transferência de dados para o exterior é considerada e está sujeita às condições especiais da KVKK ✔
Explicação: A operação de dados nos servidores de um fornecedor no estrangeiro é considerada 'transferência de dados para o estrangeiro' e está sujeita às condições especiais da KVKK sobre este assunto (tais como consentimento explícito, decisão de adequação, garantias adequadas).
9. O que faz o modo de “raciocínio” de um modelo e como afeta o custo?
- A) Aumenta a precisão em problemas complexos, mas aumenta o custo e o atraso à medida que gera mais tokens ✔
- B) Sempre libera o modelo
- C) Apenas aumenta o número de idiomas suportados pelo modelo
- D) Sempre encurte as respostas e reduza o custo
Descrição: O modo de raciocínio permite que o modelo 'pense' passo a passo antes de dar a resposta; Aumenta a precisão em problemas complexos e de várias etapas, mas também aumenta o custo e o atraso porque gera mais tokens.
10. Qual é a abordagem mais confiável ao avaliar (avaliar) um modelo para o seu próprio negócio?
- A) Basta escolher o modelo mais popular e usá-lo sem testar
- B) Configure um pequeno conjunto de testes de suas próprias tarefas reais e compare modelos com ele ✔
- C) Basta olhar para a pontuação de benchmark mencionada nos anúncios
- D) Aceitar automaticamente o modelo com a janela de contexto mais alta como o melhor
Explicação: em vez de confiar cegamente nas tabelas de classificação, criar um pequeno conjunto de testes de suas próprias tarefas reais e comparar os modelos desse conjunto revelará aquele que realmente se adapta ao seu negócio.
11. Como o conhecimento de que a saída do modelo pode conter “alucinações” deve moldar o seu fluxo de trabalho?
- A) O resultado deve sempre ser considerado correto e publicado diretamente
- B) A alucinação só é vista em modelos gratuitos, não em modelos pagos
- C) Em decisões críticas, a saída deve ser verificada por um humano e as fontes devem ser confirmadas ✔
- D) A alucinação pode ser completamente eliminada simplesmente mudando o modelo
Explicação: Uma alucinação ocorre quando o modelo produz informações que não são realmente verdadeiras, em uma linguagem confiável. Devido a este risco, a verificação dos resultados por um ser humano deve ser exigida, especialmente para decisões legais, médicas e financeiras.
12. Qual é a lógica básica da abordagem de “carteira modelo” adotada pelas instituições maduras?
- A) Garantir a simplicidade, fazendo com que cada trabalho seja realizado por um modelo único e mais caro.
- B) Usar apenas o modelo mais barato e ignorar completamente a qualidade
- C) Não utilize nenhum modelo e faça todo o trabalho manualmente
- D) Otimizando custos e reduzindo a dependência de um único fornecedor utilizando diferentes modelos de acordo com a tarefa ✔
Descrição: O portfólio de modelos utiliza diferentes modelos de acordo com a tarefa: modelo barato para trabalhos simples e volumosos, modelo poderoso para trabalhos complexos, modelo aberto/regional para dados confidenciais. Isto otimiza custos e reduz a dependência de um único fornecedor.
13. Por que o país de origem e a política de retenção de dados podem ser um critério para a seleção do modelo?
- A) Porque impacta diretamente os requisitos regulatórios, de soberania de dados e de privacidade ✔
- B) Somente porque determina a velocidade de resposta do modelo
- C) Porque determina os formatos de arquivo suportados pelo modelo
- D) Por não ter efeito prático, é apenas um detalhe de marketing
Descrição: País onde está localizado o desenvolvedor do modelo e onde/quantos dados estão armazenados; É decisivo em termos de regulamentação legal, soberania de dados e privacidade. Por exemplo, para uma organização que pretenda hospedar na UE, um fornecedor regional ou uma opção de armazenamento zero torna-se importante.
14. O que melhor explica por que é enganoso procurar um “melhor modelo único” numa tarefa?
- A) Todos os modelos têm exatamente os mesmos recursos
- B) Os modelos são fortes em tamanhos diferentes, então o 'melhor' depende da necessidade do trabalho ✔
- C) O modelo mais caro é automaticamente o melhor em todas as tarefas
- D) A seleção do modelo deve ser feita de forma totalmente aleatória
Descrição: Os modelos são fortes em diferentes dimensões como velocidade, custo, contexto, multimodalidade, privacidade e raciocínio. Um modelo que é líder numa dimensão pode ser fraco noutra; então 'melhor' sempre depende dos requisitos do trabalho.