斯坦福大学的研究发现,当处理特定法律查询时,大型语言模型(LLMs)产生与实际事实或确立的法律原则及判例相悖内容的现象——即所谓的"幻觉"——发生率高达69%至88%。
该研究分别对GPT 3.5、Llama 2和PaLM 2模型进行了20万次查询测试。尽管这些生成式人工智能程序据称已通过律师资格考试,但在执行初级律师完成的某些基础任务时却表现失常。例如,在评估两起不同案件先例关联性的任务中,多数大型语言模型(LLM)的表现甚至不如随机猜测。 在回答关于法院核心裁决(或判决要旨)的查询时,模型被发现至少75%的时间会产生幻觉。
使用大型语言模型进行法律研究的风险在以下方面尤为突出:
- 在基层法院或非主要司法管辖区诉讼的当事人
- 寻求详细或复杂法律信息的个人
- 用户基于错误前提提出问题
- 对大型语言模型(LLM)响应可靠性存疑者
这项研究的结果尤其令人担忧,因为数十家法律科技初创企业和律师事务所声称正在利用人工智能提供更优质、更高效的法律服务。然而,鉴于这些测试中表现如此糟糕,任何使用人工智能或大型语言模型的人都应保持高度警惕。法律似乎需要比当前人工智能所能提供的更高的智慧。
针对尖端语言模型的特定法律查询,其产生幻觉的比率介于69%至88%之间。此外,这些模型往往缺乏对自身错误的自我认知,且倾向于强化错误的法律假设与认知。这些发现引发了对大型语言模型在法律场景中可靠性的重大担忧,凸显了将这些人工智能技术审慎、有监督地融入法律实践的重要性。
查看引用文章
作者
相关洞察
2026年8月18日
PTAB审判洞察
应对审查员失误引发的知识产权酌情驳回“险滩”:实务指南
在2025年“自由裁量性驳回决定”激增之前五年就已确定的“Advanced Bionics”规则的第二项要求规定,当此前已向专利局提交过相同或实质上相同的现有技术或论点时,专利局局长应确定“申请人是否已证明专利局存在对被质疑权利要求可专利性具有实质性影响的错误”。
2026年8月17日
福莱观点
美国税务局(SAT)近期关于欺诈性CFDI的公告——您企业面临的迫在眉睫的风险
税务管理局(SAT)继续根据新的加快上门审计程序对纳税人进行审计,通过该程序,该局可确定这些纳税人开具的电子税务发票(CFDI)是否存在欺诈行为。
2026年8月17日
《今日医疗保健法》
社区健康中心(FQHC):护理管理服务在PPS体系之外的“医疗保险”计费格局正不断扩展
联邦合格健康中心(FQHC)主要通过“预付费制度”(PPS)从联邦医疗保险(Medicare)获得报销,该制度按每次就诊支付固定费用,以覆盖患者就诊期间提供的典型医疗必需服务组合。 然而,FQHC 越来越有机会将某些护理管理服务作为 PPS 捆绑服务之外的项目向 Medicare 单独收费。过去十年中,这些服务的稳步扩展是《平价医疗法案》(ACA)颁布以来 Medicare 对 FQHC 报销方式最重大的变化之一。