TLM Playground
TLM Playground é o centro de documentação da Cleanlab para o Trustworthy Language Model (TLM), uma API de geração de modelos que avalia em tempo real a confiabilidade de qualquer resposta de LLM. Cada resposta recebe uma pontuação de confiabilidade entre 0 e 1, sinalizando alucinações e erros de raciocínio antes que cheguem aos usuários. Instale o cliente Python com pip install cleanlab-tlm, defina uma CLEANLAB_TLM_API_KEY e chame TLM.prompt() para gerar respostas pontuadas ou get_trustworthiness_score() para auditar saídas da sua pilha existente.
A maioria dos detectores de alucinação foca na fidelidade ao contexto recuperado. Métricas como RAGAS verificam se uma resposta corresponde aos documentos fonte, mas não detectam erros factuais quando o contexto é escasso ou confuso. O TLM usa estimativa de incerteza do modelo em vez de prompting LLM-como-juiz, e a Cleanlab publica benchmarks mostrando precisão 3x maior que RAGAS em fluxos de trabalho RAG. Não requer dados rotulados no seu domínio, o que evita o problema de deriva que compromete avaliadores personalizados.
Engenheiros de ML e IA que constroem pipelines RAG, chatbots e sistemas agentes usam o TLM para bloquear saídas de baixa confiança, encaminhá-las para humanos ou substituir por respostas alternativas. A API cobre saídas estruturadas, chamadas de ferramentas, rótulos de classificação e conversas de múltiplas rodadas, não apenas completions de texto simples.
Cada resposta retorna uma pontuação de confiabilidade de 0 a 1 calculada via estimativa de incerteza
get_trustworthiness_score() avalia saídas de qualquer LLM sem alterar seu código de inferência
TLM.prompt() retorna uma resposta e uma pontuação em uma única chamada de API, usando por padrão o gpt-4.1-mini como modelo base
Benchmarks relatam 27% menos respostas incorretas do GPT-4o e detecção de erro RAG 3x melhor do que RAGAS
Predefinições de qualidade de baixa a alta, além do TLM Lite, permitem equilibrar latência e custo com profundidade de pontuação
TrustworthyRAG Evals avalia fundamentação, abstinência e suficiência de contexto junto à confiabilidade
Pontua respostas de qualquer LLM sem necessidade de treinamento customizado ou conjuntos de dados rotulados.
Suporta linguagem natural, saídas estruturadas, chamadas de ferramentas e decisões de classificação.
A API Python oferece fluxos de trabalho tanto de geração com pontuação quanto somente de pontuação.
Predefinições de qualidade e TLM Lite ajudam a reduzir a latência e custo após os testes iniciais.
As configurações padrão do TLM priorizam ampla confiabilidade em vez de baixa latência e podem ser caras.
Detalhes de preços por token são visíveis apenas na página de faturamento da sua conta Cleanlab.
As pontuações de confiança podem precisar de ajustes personalizados nos critérios de avaliação para corresponder aos padrões de qualidade específicos da equipe.
O TLM Playground é gratuito?
Sim. O TLM Playground inclui tokens gratuitos quando você cria uma conta Cleanlab e obtém uma chave de API. Após usar esses créditos, você continua em um plano pay-per-token. Veja as tarifas atuais na sua conta Cleanlab em Uso e Cobrança.
Como começo a usar o TLM Playground?
O TLM Playground começa com pip install cleanlab-tlm, configurando a variável de ambiente CLEANLAB_TLM_API_KEY e chamando TLM().prompt() ou get_trustworthiness_score(). O tutorial rápido em help.cleanlab.ai explica ambos os métodos passo a passo.
O TLM Playground pode avaliar respostas do meu próprio LLM?
Sim. O TLM Playground avalia saídas de qualquer LLM usando get_trustworthiness_score() com seu prompt e resposta. Você mantém seu código de inferência existente e adiciona a avaliação de confiança sem precisar re-treinar seus dados.
Quais aplicações de LLM o TLM Playground suporta?
O TLM Playground cobre RAG, chatbots, agentes, sumarização, extração de dados, saídas estruturadas, chamadas de ferramentas, classificação, rotulagem de dados e fluxos de trabalho de avaliação de LLM. Ele avalia qualquer tipo de saída do modelo, não apenas respostas em texto simples.
O TLM Playground oferece implantação privada?
Sim. O TLM Playground suporta implantação empresarial em VPC via Cleanlab para que todos os dados permaneçam na sua infraestrutura privada. Contate o time de vendas da Cleanlab para opções de implantação privada, descontos por volume e integrações personalizadas de LLM.
Como reduzir latência e custo no TLM Playground?
O TLM Playground permite configurar quality_preset para base ou low, escolher modelos base mais rápidos como gpt-4.1-nano, usar o TLM Lite para fluxos de trabalho só de pontuação, ou transmitir respostas do seu LLM e avaliá-las depois com get_trustworthiness_score().

