TLM Playground

TLM Playground

TLM Playground 是 Cleanlab 为可信语言模型(TLM)提供的文档中心。TLM 是一个模型生成 API,能够实时评估任何大型语言模型(LLM)响应的可靠性。每个答案都会获得一个介于 0 到 1 之间的可信度评分,在错误生成和推理错误到达用户之前进行标记。通过 pip install cleanlab-tlm 安装 Python 客户端,设置 CLEANLAB_TLM_API_KEY,然后调用 TLM.prompt() 生成带评分的响应,或调用 get_trustworthiness_score() 审核您现有系统的输出。

大多数幻觉检测器侧重于与检索上下文的一致性。像 RAGAS 这样的指标检查答案是否与源文档匹配,但在上下文稀少或混乱时容易遗漏事实错误。TLM 使用模型不确定性估计,而非以 LLM 作为评判者的提示,Cleanlab 发布的基准测试显示其在 RAG 工作流中的精确度是 RAGAS 的 3 倍。它不需要您领域的标注训练数据,从而避免了导致自定义评估器失效的漂移问题。

构建 RAG 流水线、聊天机器人和代理系统的机器学习与人工智能工程师使用 TLM 来筛选低置信度输出,将其转交人工处理,或替换为备用答案。该 API 支持结构化输出、工具调用、分类标签和多轮对话,而不仅限于纯文本补全。

主要功能:
  1. 每个响应返回一个0到1的可信度分数,通过不确定性估计计算得出

  2. get_trustworthiness_score() 在不改变推理代码的情况下对任何LLM的输出进行评分

  3. TLM.prompt() 在一次API调用中返回响应和评分,默认以gpt-4.1-mini作为基础模型

  4. 基准测试报告显示比RAGAS少27%的错误GPT-4o响应和3倍的RAG错误检测提升

  5. 从低到高的质量预设,加上TLM Lite,让你在延迟和成本与评分深度之间权衡

  6. TrustworthyRAG Evals 评分基础性、回避性和上下文充分性,以及可信度

Pros:
  1. 无需定制训练或标注数据集,即可对任何大型语言模型(LLM)的响应进行评分。

  2. 支持自然语言、结构化输出、工具调用和分类决策。

  3. Python API 提供生成评分与仅评分两种工作流程。

  4. 质量预设和TLM Lite在初期测试后,有助于降低延迟和成本。

Cons:
  1. 默认的TLM设置优先考虑广泛的可靠性,而非低延迟,且可能成本较高。

  2. 每个令牌的定价详情仅在您的Cleanlab账户计费页面中可见。

  3. 信任分数可能需要自定义评估标准的调整,以匹配团队特定的质量标准。

常见问题:

TLM Playground 是免费使用的吗?

是的。注册 Cleanlab 账户并获取 API 密钥后,TLM Playground 会赠送免费代币。用完这些额度后,您将按代币付费。您可以在 Cleanlab 账户的“使用和计费”中查看当前费率。

如何开始使用 TLM Playground?

使用 TLM Playground,首先运行 pip install cleanlab-tlm,设置 CLEANLAB_TLM_API_KEY 环境变量,然后调用 TLM().prompt() 或 get_trustworthiness_score()。help.cleanlab.ai 上的快速入门教程详细介绍了这两种方法。

TLM Playground 能为我自己的 LLM 评分吗?

可以。TLM Playground 使用 get_trustworthiness_score() 对任何 LLM 的输出进行评分,输入您的提示和响应。您可以保留现有推理代码,在此基础上添加可信度评分,无需重新训练数据。

TLM Playground 支持哪些 LLM 应用?

TLM Playground 支持 RAG、聊天机器人、代理、摘要、数据提取、结构化输出、工具调用、分类、数据标注和 LLM 评估工作流。它能评分任何模型输出类型,而不仅限于纯文本响应。

TLM Playground 提供私有部署吗?

提供。TLM Playground 通过 Cleanlab 支持企业 VPC 部署,确保所有数据保留在您的私有基础设施内。有关私有部署选项、批量折扣和定制 LLM 集成,请联系 Cleanlab 销售。

如何降低 TLM Playground 的延迟和成本?

TLM Playground 允许您将 quality_preset 设置为 base 或 low,选择更快的基础模型如 gpt-4.1-nano,使用仅评分的 TLM Lite,或从您的 LLM 流式传输响应后用 get_trustworthiness_score() 评分。

定价:

免费试用和收费混合

标签:

Cleanlab
Trust Scoring
Uncertainty Estimation
Python SDK
Chatbot Safety
Private Deployment
Model Reliability
Trustworthy Language Model

使用的技术:

Google Analytics
Google Tag Manager
GitHub
Tailwind CSS
Next.js
Node.js

评论:

Give your opinion on TLM Playground :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

最佳免费 TLM Playground 替代方案(和付费)

By Rishit