EN

TrustScale 推出 Argus:以实证核查对抗 AI 幻觉,护航企业级安全部署

TrustScale 宣布推出 Argus,一个基于实证证据与确定性验证的 AI 保障平台,旨在检测并纠正大语言模型的幻觉输出。该平台面向企业提供 12 种语言支持,并已开放个人研究预览。

2026-09-036阅读
TrustScale 推出 Argus:以实证核查对抗 AI 幻觉,护航企业级安全部署

AI 幻觉风险持续攀升,企业部署面临信任挑战

随着生成式 AI 的大规模应用,研究证实,大型语言模型(LLM)仍会以高置信度产生幻觉、捏造来源并出现错误。这一现象为正在将 AI 用于智能体自动化、研究、内容创作及决策制定的企业带来了前所未有的风险。

斯坦福大学 RegLab 的研究数据显示,AI 幻觉率因任务类型差异显著,且随复杂度提升而上升。即便是前沿模型对简单查询的响应,平均幻觉率也可高达 20%;而在特定行业场景中,AI 查询响应的幻觉率甚至可达 88%。据估算,幻觉问题每年给企业造成的损失接近 700 亿美元

Argus 平台:以确定性验证取代“AI 检查 AI”

为应对上述挑战,TrustScale 于 2026 年 8 月 5 日宣布正式推出 Argus——一个正在申请专利的 AI 保障平台。与依赖“AI 检查 AI”的常见方案不同,Argus 采用实证证据与确定性验证机制,对 AI 生成内容进行审查,标记缺乏依据的主张,并在错误内容被发布、分享或采信之前,提供基于证据的修正建议。

TrustScale 宣称,Argus 帮助用户核查 AI 生成主张的速度比人工研究快 135 倍,可将幻觉率降低并提升 AI 输出准确率至 98.5%。

“AI 行业花费多年让 AI 变得更聪明,但可信 AI 才是当下更亟待解决的问题。”TrustScale 首席执行官 Lawrence Snapp 表示,“AI 本质上是概率性的,但企业须对 AI 失误带来的成本与风险负责。Argus 通过在用户采信生成式 AI 输出前提供独立证据,有效缓解了这一问题。”

高风险行业暴露“静默失败”隐患

医疗法律学术领域是 AI 幻觉风险的高发地带,用户往往在毫无防备的情况下暴露于错误信息之中。Anthropic 的研究进一步表明,91.3% 的 AI 用户不会对事实与主张进行核查,这为“静默失败”创造了条件,甚至可能直接导致人身伤害。

Argus 通过实时检测幻觉、叠加颜色编码的 TrustScore 高亮,并提供支持或反驳 AI 主张的确定性证据,帮助用户防范意外后果。同时,该平台支持一键式内联修正建议,简化纠错流程。

基于 20 余年经验构建的信任控制平面

Argus 基于 TrustScale Engine 构建,该专有平台融合了超过 20 年的 AI 数据经验,可创建持续性的信任控制平面,在不干扰工作流的前提下辅助用户做出知情决策。

“AI 制造商声称自身更安全、具备自我治理能力或追求真理。但在涉及 AI 时,相互矛盾的证据、多元视角、细微的语言差异以及独立保障至关重要。”Global Data Innovation 首席执行官 Dominique Shelton Leipzig 评论道,“TrustScale 的 Argus 是首个实时、持续的保障平台,它以证据赋能人类,并推动可信 AI 的实现。AI 的风险太高,不能让少数几个大模型来定义你的真相。”

可用性与部署方式

Argus by TrustScale 即日起面向企业提供 12 种语言版本,同时面向个人用户开放研究预览。用户可通过 TrustArgus.ai 访问,或通过 Chrome 扩展程序在任意场景使用。企业版解决方案可部署于私有及公共数据环境,并兼容 ChatGPT、Claude、Gemini、Copilot 和 Grok 等任意 AI 模型。演示申请请访问 www.TrustScale.ai

关于 TrustScale

TrustScale 是一家 AI 训练、评估与保障公司,致力于帮助组织以更高的信心和控制力创建、塑造及使用人工智能。依托超过 20 年、覆盖 200 余种语言的 AI 数据经验,TrustScale 开发了独立的确定性技术,用于检测 AI 错误、依据实证证据评估主张,并确保人在关键决策中的核心地位。其 Argus 平台在公共与私有数据环境中提供实时幻觉检测、TrustScore 评级及基于证据的修正建议。更多信息请访问 TrustScale.ai

6336c8ff7d888b79570537b93f893b896cc267485d4547319d77d3956fa651fd.png