本文作者创建了一个包含长篇开放式问题和多项选择题的基准测试,用于评估多种大型语言模型在法律推理方面的表现。法律推理需要将演绎和归纳逻辑应用于复杂情境,其中常存在未定义的参数。研究结果表明,这些模型在处理"需要结构化、多步骤法律推理的开放式问题时仍显吃力"。
法律推理是大型语言模型(LLMs)乃至整个人工智能(AI)领域的重要前沿,需要专业领域知识和高级推理能力,例如判例解释、法规分析和法律推论。尽管通用推理取得进展,法律推理在自然语言处理研究中仍面临挑战且评估不足。此外,法律领域具有高风险特性,若未能全面检验模型的能力和局限性,可能导致严重的现实后果……
查看引用文章
我们的分析揭示了大型语言模型在处理选择题(尤其是复杂开放性问题)时存在显著能力差异与局限性:值得注意的是,增加选择题选项数量会持续降低模型准确率。本评估框架提供了一种超越简单准确率指标的可扩展方法,用于衡量法律推理质量,从而为未来研究提供依据,旨在提升大型语言模型在复杂法律任务中的可靠性与稳健性。
作者
相关洞察
2026年8月18日
PTAB审判洞察
应对审查员失误引发的知识产权酌情驳回“险滩”:实务指南
在2025年“自由裁量性驳回决定”激增之前五年就已确定的“Advanced Bionics”规则的第二项要求规定,当此前已向专利局提交过相同或实质上相同的现有技术或论点时,专利局局长应确定“申请人是否已证明专利局存在对被质疑权利要求可专利性具有实质性影响的错误”。
2026年8月17日
福莱观点
美国税务局(SAT)近期关于欺诈性CFDI的公告——您企业面临的迫在眉睫的风险
税务管理局(SAT)继续根据新的加快上门审计程序对纳税人进行审计,通过该程序,该局可确定这些纳税人开具的电子税务发票(CFDI)是否存在欺诈行为。
2026年8月17日
《今日医疗保健法》
社区健康中心(FQHC):护理管理服务在PPS体系之外的“医疗保险”计费格局正不断扩展
联邦合格健康中心(FQHC)主要通过“预付费制度”(PPS)从联邦医疗保险(Medicare)获得报销,该制度按每次就诊支付固定费用,以覆盖患者就诊期间提供的典型医疗必需服务组合。 然而,FQHC 越来越有机会将某些护理管理服务作为 PPS 捆绑服务之外的项目向 Medicare 单独收费。过去十年中,这些服务的稳步扩展是《平价医疗法案》(ACA)颁布以来 Medicare 对 FQHC 报销方式最重大的变化之一。