五角大楼寻求确保人工智能模型按计划工作的系统

报告内容
已翻译

随着五角大楼越来越依赖人工智能,一个问题随之而来:如何确保人工智能模型按预期工作?

最好的方法是在用户接触新人工智能之前进行测试。因此,国防部与国家情报总监办公室正在寻求一种系统,以测试人工智能模型是否符合特定标准。

根据国防创新单位的一份兴趣领域公告,“随着人工智能(AI)能力以惊人的速度发展,政府需要评估基础设施,以便在新模型发布时,能够通过持续评估与任务特定基准保持同步。”

国防部还希望确保人工智能与人类能够良好协作。“评估不仅必须评估人工智能系统是否能够独立执行任务,还必须评估人类与人工智能团队是否能比单独的人类或人工智能取得更好的任务结果,”公告中提到。

国防创新单位设想了一种“测试平台”,具有标准的可插拔架构,可以测试任何由任何承包商开发的人工智能,并提供一致、结构化的评估。这包括研究不同环境中的工作流程,安全审计人工智能代理,并允许人类专家评估“人类工作负载、可用性和在仅人类、仅人工智能和人类-人工智能团队场景中的任务表现。”

该测试平台还应测试人工智能在混乱、信息不足的条件下的功能。该系统必须模拟“在受控、可重复的环境中进行的操作压力和网络降级,”国防创新单位表示。

还将评估敌方人工智能是否能够劫持或混淆友方人工智能模型。该系统必须支持“自动化红队测试,包括执行对抗性提示和攻击模式。”

人工智能将根据多种基准进行评估。这些基准包括“识别在特定任务背景下重要的能力”和将复杂的人工智能能力分解为更小、可测量的任务。结果应清晰,包括建立什么构成人工智能的良好评分,并以“易于理解且可供决策者采取行动的格式”提供。

国防创新单位还特别指出,评估系统必须公平,确保“没有特定架构或供应商的系统性优势。”

截止日期为3月24日。

分类信息
分析域
战略级
主要分类 / 次要分类
政军关系 / 后勤保障
SALUTE 报告
规模
未指定
活动
五角大楼正在寻求一个系统来测试人工智能模型,以确保它们符合规定的标准并能有效与人类团队协作。
地点
单位
美国国防部(DOD)
时间
截止日期为3月24日
装备
人工智能模型评估基础设施测试工具
摘要

美国国防部正在开发一个系统来评估人工智能模型,以确保它们符合操作标准并能有效与人类团队协作。该倡议旨在创建一个测试工具,可以在各种条件下评估人工智能的性能,包括操作压力。提案截止日期定于3月24日。

关键事实
  • 五角大楼正在寻求一个系统来测试人工智能模型,以确保它们符合规定的标准。
  • 评估系统必须评估人类与人工智能协作的有效性。
  • 提案截止日期为3月24日。
  • 该系统应模拟操作压力和网络降级。
  • 评估必须公平,不得偏向特定架构或供应商。