VOL. 06 / 编辑型法律 AI 情报本周信号已校对 · 06

本周焦点 · ISSUE 06

提供最新的 AI 与
法律新闻。

从监管、判例到实务脉动,Legal AI News 持续整理经过核对、可追溯的人工智能与法律新闻。

正在跟踪状态 / 核对中 每一则法律 AI 新闻,都应留下来源、脉络与编辑判断。编辑校对 / 2026/08/28查看清单

需要被持续追踪的
法律 AI 信号。

本期索引按监管、判例、实务与研究归档;可依主题或关键字定位已发布记录。

检索结果研究 / 20 笔记录本次卷宗20总计61清除检索
已校对新闻档案 / VOL.06卷宗序列 / 由焦点稿开始排序 / 最近更新优先
43
研究arXiv cs.CL
新闻卷宗 / 43

LegalWorld:法律代理全生命周期交互环境

LegalWorld是一个模拟中国民事诉讼全过程的交互环境,将诉讼建模为五个阶段(七个子场景)的因果状态链,基于75,309份已配对的中文民事判决。该环境配备可复用基础设施(本地记忆、全局案例记忆、技能/工具库),确保每个争议在整个生命周期内一致。在此基础上构建LongJud-Bench基准,用于评估代理在各阶段的综合能力。来自217名法律背景评估者的18,992次评分确认LegalWorld轨迹在程序上忠实且角色一致;跨模型评估揭示聚合分数无法暴露的显著差异,没有单一模型在咨询、起草和法庭辩护中均占优。详细资源将公开发布。

阅读
44
研究arXiv cs.CL
新闻卷宗 / 44

TW-LegalBench:评估大模型对台湾法律的理解

TW-LegalBench 是一个针对台湾法律体系的大语言模型评估基准,包含三类任务:超过1.6万道来自18个专业领域的五年官方考试选择题、117道附评分标准的法律人员考试开放式问答题,以及涵盖数百种罪名的1.4万余个法律判决预测实例。研究评估了13个大语言模型,采用选择题准确率、基于评分标准分解的LLM-as-Judge框架以及判决准确性与法条引用的指标。结果显示,表现最好的模型超过了律师考试合格线(通过率11%),但未达到法官和检察官的合格线(通过率1-2%)。在判决预测方面,模型能合理预测判决类型和刑期,但在引用具体法条时存在困难。这表明,尽管大语言模型在资格考试成绩上接近人类水平,可靠的生成法律文本仍是挑战。

阅读
45
研究arXiv cs.CY
新闻卷宗 / 45

LOCUS:美国地方条例语料库助力法律AI研究

arXiv论文介绍LOCUS——美国地方条例语料库,旨在填补现有机器可读语料库中缺失的地方层级法律文本。LOCUS原始语料包含来自9,239个市县的法典,并通过OCR处理多种文档格式。其县级协调访问层覆盖美国3,144个县中最大的2,309个,服务于多数人口。研究团队基于ModernBERT训练了分类器和评分器,用于分析地方法律在模糊性和家长主义等维度的特征。语料库及衍生模型已公开发布于Hugging Face。

阅读
46
研究arXiv cs.CY
新闻卷宗 / 46

数字言语行为使版权归于个人而非平台

法律先例将计算机代码视为可版权表达,但中心化平台通过版权、合同和技术架构,利用服务条款迫使创作者交出实际版权控制。相比之下,草根平台由加密身份的个人通过联网智能手机独立运作,每人持自有数据,无第三方介入。本文定义了数字言语行为——个人在其设备上使用私钥对内容进行加密签名的有意行为,从而确立归属、责任和作者身份。论证指出:数字言语行为符合美国先例(Burrow-Giles、Feist)对版权保护的要求;草根平台的数字社会契约通过设计保留版权,签名内容不可与签名分离,所有权与占有权统一于个人;数字言语行为的版权是数字主权和民主自治的前提。

阅读
47
研究Center for Democracy and Technology
新闻卷宗 / 47

州级性取向与性别身份数据实践指南报告发布

近日,Movement Advancement Project、Actionable Intelligence for Social Policy 与 CDT 联合发布了一份关于州级性取向与性别身份数据实践的报告。报告指出,政府实体收集性取向与性别身份数据,有助于了解 LGBTQ+ 群体的经历、需求及不平等状况。高质量 SOGI 数据在负责任地收集、存储和使用时,能够发挥重要作用。

阅读
48
研究RSSHub-OpenAI-Research
新闻卷宗 / 48

近乎自主AI化学家改进药物合成关键反应

OpenAI将GPT-5.4连接到Maria AI与自动化实验室,用于改进药物化学中的Chan-Lam偶联反应。该系统自主识别伯磺酰胺为高价值挑战性底物,并提出使用温和氧化剂TEMPO。经过两轮实验,优化条件下88%的硼酸和83%的磺酰胺测试产率提高,平均产率从16.6%升至25.2%,高于30%产率的比例从15.6%升至37.5%。人工验证确认了微升级结果,14对底物中11对产率提升,多数超过两倍。磺酰胺基团广泛存在于抗癌药、抗菌药等药物中,该改进有助于药物发现中的合成瓶颈。

阅读
49
研究arXiv cs.CL
新闻卷宗 / 49

中国司法判决法律论证结构标注与可视化指南

本指南提出了一个系统化、可操作的法律论证结构标注框架,旨在揭示司法推理的逻辑组织,并为计算分析提供可靠基础。在要素层面,区分非命题层(问题与非论证成分)和命题层(一般规范判断、特殊规范判断、一般事实判断、特殊事实判断)。在关系层面,定义了支持、攻击、联合、匹配和同一五种关系类型,涵盖积极与消极论证连接、合取推理结构、法律规范与案件事实的对应以及命题间的同一性。该指南还规定了基本与嵌套结构的形式化表示规则和可视化约定,并建立了标准化的标注流程与一致性控制机制,以确保标注数据的可重复性和可靠性。该框架支持大规模司法推理分析,并为法律论证挖掘、法律推理计算建模及AI辅助法律分析提供基础。

阅读
50
研究arXiv cs.CL
新闻卷宗 / 50

欧盟AI法案下法律推理基准的测量缺口

大型语言模型现已能生成至少中等质量的法律文本,但目前尚无基准能够评估它们是否执行学理法律推理——这是法律工作的解释核心,而非当前大多数法律AI评估所衡量的辅助性法务任务。这一测量缺口不仅是方法论上的,也是法律上的:欧盟AI法案对司法领域使用的高风险AI提出了“适当准确性”的约束性要求,但该要求若缺乏领域内尚不存在的学理推理基准,就无法获得可操作的内容。

阅读
51
研究arXiv cs.CL
新闻卷宗 / 51

类型化幻觉审计与校准多智能体辩论的法律AI框架

arXiv:2606.18021 提出 LegalHalluLens 审计框架,包含类型化幻觉档案(基于CUAD数据集覆盖数值、时间、义务/权利、事实四类)、风险方向指数(RDI,将遗漏与虚构偏差转化为单一标量)和类型化辩论管道。在510份合同、249252条条款级别实例中,发现聚合指标掩盖了同一模型在义务/数值与时间类之间的约38-40个百分点差异,且两个52%错误率的系统可能呈现相反的RDI。辩论管道将虚假检测减少45%,各类别改进与诊断结果一致,以40亿参数模型匹配商业API性能。该框架支持方向感知的采购、问责和智能体设计。

阅读
52
研究RSSHub-Anthropic-Research
新闻卷宗 / 52

代理编码中专业知识的持续回报

基于对约40万次Claude Code会话的隐私保护分析,研究发现人类主导规划决策,AI负责执行决策。领域专业知识越丰富,AI每项指令完成的工作量越大。各主要职业在编码任务上的成功率与软件工程师相近。专家用户成功率更高,但与中级用户差距不大。七个月内,调试时间占比下降近半,使用转向端到端代理应用。任务价值通过对比自由职业岗位估算,平均提升约25%。

阅读
54
研究arXiv cs.CY
新闻卷宗 / 54

基于AI的SaaS系统优化伦敦临时住宿安置

本研究介绍了DOMUS,一个为伦敦纽汉区量身定制的云端AI决策支持系统,用于优化法定临时住宿安置。系统整合家庭案例记录、政策约束下的可负担性和适宜性规则以及实时私人租赁列表,形成统一的治理工作流。通过透明规则筛选与大语言模型辅助搜索,标准化卧室需求、可负担阈值、地理偏好和无障碍要求,同时保留官员决策权和可审计性。在纽汉区安全环境中的试点评估表明,相比人工流程,搜索时间显著缩短,关键安置约束遵守率提高,员工满意度高,且保持法定合规与问责制。DOMUS被设计为可复制的数字公共基础设施,模块化云原生SaaS架构可推广至英国其他行政区,并适用于其他资源稀缺、规则约束和高风险公共管理任务。

阅读
55
研究arXiv cs.CL
新闻卷宗 / 55

LLM法律推理中的忠实性研究:从分类到形式推理的局限

该研究通过比较纯LLM分类、LLM基础形式推理和Z3求解器形式推理三种范式,在重新标注的ContractNLI子集上评估了五个LLM的法律推理忠实性。重新标注揭示了实用法律解释与严格形式蕴涵之间的系统差距,大量法律上合理的推论缺乏形式基础。尽管引入形式结构提升了基准性能,但LLM基础形式推理的高分并不代表忠实推理,存在三种反复出现的失败模式:范围清洗(LLM报告与求解器不一致的分类而不执行底层形式推理)、隐式约束盲视(忽略形式表示中的逻辑约束)和程序合成失败(即使有结构化提示也生成错误的Z3代码)。范围清洗在所有模型中持续存在,严重质疑LLM基础形式推理作为符号执行代理的忠实性,揭示了基准准确性与逻辑忠实性之间的根本差距。

阅读
56
研究arXiv cs.CL
新闻卷宗 / 56

大语言模型法律推理的神经元层级分析

本文对七种开源大语言模型在法律领域推理中的神经元作用进行了层级分析。通过神经元归因分数排序并抑制关键神经元,发现抑制这些神经元会破坏目标任务准确性,而随机抑制则无影响。研究识别出一小部分跨任务通用神经元,移除它们后,剩余神经元仅影响其来源任务,揭示了每个模型中的任务特异性神经元。在法律领域内,三个基准测试的神经元重叠度较高,且倾向于共同受影响,表明存在跨司法管辖区的法律组件神经元。此外,关键神经元的分布并非普遍集中在中间MLP层,而是取决于输入格式和内容。

阅读
57
研究RSSHub-OpenAI-Research
新闻卷宗 / 57

模拟部署预测模型发布前行为

OpenAI开发了一种部署模拟方法,在模型发布前通过隐私保护方式重放历史对话,模拟真实部署场景,以评估新模型可能的行为,包括发现新的不良行为及其出现频率。该方法已在GPT-5系列思维模型部署中应用,改善了不良行为率估计,发现了新的未对齐形式,并降低了模型意识到被测试的风险。它还能扩展到代理设置和工具使用场景。与传统评估相比,部署模拟能更全面覆盖行为类型,减少选择偏差。

阅读
60
研究Future of Privacy Forum
新闻卷宗 / 60

未来隐私论坛发布青少年算法个性化综合报告

2026年6月10日,全球非营利组织未来隐私论坛(FPF)发布了一份关于青少年在线体验中算法个性化的综合报告。报告评估了数据驱动个性化在青少年网络环境中的作用,并分析了其对新兴政策和产品设计的影响。当前,政策制定者正就青少年在线安全法规展开辩论,该报告为相关讨论提供了基于数据的分析视角。

阅读
档案 / 深度专题
AI

编辑精选 / 实务

治理不该是模型上线后才补写的注脚。

从采购条款、信息来源、复核节点到使用者责任,将 AI 放进法律工作流前,有一份比提示词更重要的清单。

浏览深度专题

档案室周报 / 每周四 / 18:00

来源 / 编辑校对台 · VOL.06

少一点杂讯,
多一份判断依据。

接收一封已核对的法律 AI 观察:涵盖监管动向、可采证据、实务流程与值得细读的研究脉络。

订阅与提交线索