美国国家标准与技术研究院推出新的人工智能评估平台

报告内容
已翻译

国家标准与技术研究院周一启动了一项新计划,允许研究人员访问一个隔离的测试环境,以安全地评估人工智能模型在各种指令下的表现。

人工智能技术评估(AITE)是一个自愿测试工具,专注于人工智能模型的安全分析。它为模型在完成任务时处理的盲数据提供了客观见解,并进行模型能力的评估。值得注意的是,评估数据并不打算作为模型的训练数据。

最初,AITE将专注于使用大型视觉语言模型在三个领域进行图像分析任务:量子科学、基因组学和公共安全。未来将提供更多任务。

AITE的基本目标是提供一个通用的评估标准,以有效评估人工智能模型的能力,并确定模型性能的最新水平。

新闻稿中提到:“NIST提供的基础设施将提供共同的数据、指标和评分,帮助开发者了解其模型的性能。”

与AITE合作的数据提供者和模型提供者需要提交与测试相关的材料。数据提供者被要求提交原始数据集,这些数据集在公开场合无法获取,并提供一个适合该数据的“有意义”的任务。

同样,模型开发者将提交他们的人工智能模型,以便使用这些数据集进行测试。第一次评估将于2026年8月开始。

AITE的成立是特朗普政府在与主要人工智能开发者合作,通过自愿模型提交推进模型安全的战略中的最新一步。

商务部在5月宣布了一项重新谈判的协议,该协议涉及该机构与三家公司——谷歌Deepmind、微软和xAI——通过人工智能标准与创新中心评估其模型。

分类信息
分析域
战略级
主要分类
政军关系
SALUTE 报告
规模
不适用
活动
推出新的人工智能评估程序
地点
单位
美国国家标准与技术研究院(NIST)
时间
星期一
装备
人工智能模型测试环境
摘要

美国国家标准与技术研究院(NIST)推出了人工智能技术评估(AITE)计划,以提供评估人工智能模型的测试平台。该计划专注于量子科学、基因组学和公共安全中的图像分析任务,首次评估定于2026年8月进行。AITE旨在通过与主要人工智能开发者的合作以及提交原始数据集来增强人工智能模型的安全性。

关键事实
  • NIST推出了人工智能技术评估(AITE)计划。
  • AITE提供了评估人工智能模型的测试平台。
  • 该计划专注于量子科学、基因组学和公共安全中的图像分析任务。
  • 首次评估将于2026年8月开始。
  • 该计划是特朗普政府人工智能模型安全战略的一部分。