本文作者创建了一个包含长篇开放式问题和多项选择题的基准测试,用于评估多种大型语言模型在法律推理方面的表现。法律推理需要将演绎和归纳逻辑应用于复杂情境,其中常存在未定义的参数。研究结果表明,这些模型在处理"需要结构化、多步骤法律推理的开放式问题时仍显吃力"。
法律推理是大型语言模型(LLMs)乃至整个人工智能(AI)领域的重要前沿,需要专业领域知识和高级推理能力,例如判例解释、法规分析和法律推论。尽管通用推理取得进展,法律推理在自然语言处理研究中仍面临挑战且评估不足。此外,法律领域具有高风险特性,若未能全面检验模型的能力和局限性,可能导致严重的现实后果……
查看引用文章
我们的分析揭示了大型语言模型在处理选择题(尤其是复杂开放性问题)时存在显著能力差异与局限性:值得注意的是,增加选择题选项数量会持续降低模型准确率。本评估框架提供了一种超越简单准确率指标的可扩展方法,用于衡量法律推理质量,从而为未来研究提供依据,旨在提升大型语言模型在复杂法律任务中的可靠性与稳健性。
作者
相关洞察
2026年8月3日
福莱观点
头条之外:第二季度风险投资活动回顾
谈到今年的风险投资(VC)活动,如果仅看新闻标题,就无法全面了解情况。我们最近曾就并购(M&A)活动的现状讨论过类似的问题,正如CB Insights在其《2026年第二季度风险投资现状》报告中所指出的,当前风险投资行业的整体状况也是如此。
2026年7月31日
科罗拉多州生产者责任延伸制度面临第二起、范围更广的宪法挑战:生产商需知事项
2026年7月30日,全美批发商与分销商协会(NAW)向科罗拉多州联邦地区法院提起诉讼,起诉科罗拉多州公共卫生与环境部(CDPHE)执行主任,要求法院裁定《科罗拉多州全州回收生产者责任计划法案》(以下简称“该法案”)违宪,并禁止其实施。
2026年7月30日
劳动与就业法视角
苹果裁决对解决加班问题给雇主的启示
6月11日,美国加利福尼亚州北区联邦地区法院作出了一项开创性裁决,首次明确针对“在根据《公平劳动标准法》计算加班费时,是否必须将限制性股票单位计入常规工资率”这一问题。