Saltar para o conteúdo
  • Serviços
  • Blog
  • Investigação
  • Dandara StudioBeta
ENPT
Marcar conversa

Software, IA e automação para equipas que querem avançar mais depressa.

hello@orbiht.com

Serviços

  • Desenvolvimento web
  • Desenvolvimento móvel
  • Desenvolvimento desktop
  • Automação de processos
  • Sistemas de IA à medida
  • Design de produto e UI/UX

Empresa

  • Como funciona
  • Blog
  • Investigação
  • Perguntas frequentes
  • Contacto

Produto

  • Dandara Studio Beta

© 2026 Orbiht. Todos os direitos reservados.

Termos de UtilizaçãoPolítica de Privacidade
Voltar à investigação
Artigo

Um método simples para avaliar assistentes com LLM em produção

Um ciclo de avaliação prático e barato que as equipas de produto pequenas podem correr a cada nova versão de uma funcionalidade de IA.

Orbiht AI Lab5 de agosto de 2026 · 1 min de leitura

Nesta página

  • Motivação
  • O ciclo
  • Exemplo de critérios
  • Conclusão
Partilhar

Resumo

Propomos um método de avaliação simples para equipas que lançam assistentes baseados em LLM sem uma equipa dedicada de ML. Combina um conjunto selecionado de perguntas, avaliação por critérios e feedback de produção num ciclo que corre a cada versão.

Principais conclusões

  • Um pequeno conjunto selecionado de perguntas reais apanha a maioria das regressões.
  • Avaliar por critérios é mais estável do que atribuir uma nota única.
  • O feedback de polegar para cima/para baixo em produção é a melhor fonte de novos casos de teste.

Motivação

A maioria das equipas lança funcionalidades de IA depois de testar meia dúzia de prompts "a olho". Funciona até deixar de funcionar — uma mudança de modelo ou um ajuste no prompt estraga, sem aviso, respostas em que os utilizadores confiavam.

O ciclo

  1. Recolher — junta perguntas reais dos utilizadores e as respostas que gostarias de ver.
  2. Avaliar — pontua cada resposta com critérios simples: correta, fundamentada, útil, segura.
  3. Comparar — testa cada alteração contra o conjunto e compara com a versão anterior.
  4. Aprender — transforma o feedback de produção em novos casos de teste.

Exemplo de critérios

CritérioPergunta
CorretaA resposta está factualmente certa?
FundamentadaApoia-se nas fontes recuperadas?
ÚtilResolve o problema do utilizador?
SeguraEvita ações ou afirmações que não deveria fazer?

Conclusão

A avaliação não precisa de ser cara para ser útil. Precisa de ser consistente.

  • #ai
  • #llm
  • #evaluation
Partilhar

Comentários 0

Modo de demonstração — os comentários ficam guardados apenas neste navegador. Adiciona as chaves do Firebase ao .env para ativar o início de sessão com Google.

A carregar comentários…

Continua a ler

Relatório
1 de setembro de 20261 min de leitura

O estado da automação em equipas pequenas e médias

Onde é que as equipas em crescimento perdem tempo, que processos automatizam primeiro e o que distingue os projetos que vingam dos que ficam parados.

Ler mais →
Estudo de caso
20 de julho de 20261 min de leitura

Um código, três plataformas: web, móvel e desktop ao mesmo tempo

Como uma API, um design system e uma biblioteca de componentes partilhados permitiram a uma equipa pequena lançar na web, no iOS, no Android e no desktop.

Ler mais →