移民人身保护令追踪:政府阻挠、司法信任与问责
本文对第二任特朗普政府期间的移民人身保护令诉讼进行了全面研究,评估了法院在保护司法权威和个人权利方面的应对措施。研究追踪了相关案件,分析了政府阻挠行为、司法信任以及问责机制。该研究首发于Just Security。
阅读本期索引按监管、判例、实务与研究归档;可依主题或关键字定位已发布记录。
本文对第二任特朗普政府期间的移民人身保护令诉讼进行了全面研究,评估了法院在保护司法权威和个人权利方面的应对措施。研究追踪了相关案件,分析了政府阻挠行为、司法信任以及问责机制。该研究首发于Just Security。
阅读在纽约市律师协会人工智能会议上,专家们讨论了如何在法学院负责任地教授人工智能课程,以及当前国际人工智能监管的零散现状。会议指出,法律教育需适应AI技术发展,同时全球各国在AI法规制定上缺乏协调,形成碎片化监管格局。
阅读LegalWorld是一个模拟中国民事诉讼全过程的交互环境,将诉讼建模为五个阶段(七个子场景)的因果状态链,基于75,309份已配对的中文民事判决。该环境配备可复用基础设施(本地记忆、全局案例记忆、技能/工具库),确保每个争议在整个生命周期内一致。在此基础上构建LongJud-Bench基准,用于评估代理在各阶段的综合能力。来自217名法律背景评估者的18,992次评分确认LegalWorld轨迹在程序上忠实且角色一致;跨模型评估揭示聚合分数无法暴露的显著差异,没有单一模型在咨询、起草和法庭辩护中均占优。详细资源将公开发布。
阅读TW-LegalBench 是一个针对台湾法律体系的大语言模型评估基准,包含三类任务:超过1.6万道来自18个专业领域的五年官方考试选择题、117道附评分标准的法律人员考试开放式问答题,以及涵盖数百种罪名的1.4万余个法律判决预测实例。研究评估了13个大语言模型,采用选择题准确率、基于评分标准分解的LLM-as-Judge框架以及判决准确性与法条引用的指标。结果显示,表现最好的模型超过了律师考试合格线(通过率11%),但未达到法官和检察官的合格线(通过率1-2%)。在判决预测方面,模型能合理预测判决类型和刑期,但在引用具体法条时存在困难。这表明,尽管大语言模型在资格考试成绩上接近人类水平,可靠的生成法律文本仍是挑战。
阅读arXiv论文介绍LOCUS——美国地方条例语料库,旨在填补现有机器可读语料库中缺失的地方层级法律文本。LOCUS原始语料包含来自9,239个市县的法典,并通过OCR处理多种文档格式。其县级协调访问层覆盖美国3,144个县中最大的2,309个,服务于多数人口。研究团队基于ModernBERT训练了分类器和评分器,用于分析地方法律在模糊性和家长主义等维度的特征。语料库及衍生模型已公开发布于Hugging Face。
阅读法律先例将计算机代码视为可版权表达,但中心化平台通过版权、合同和技术架构,利用服务条款迫使创作者交出实际版权控制。相比之下,草根平台由加密身份的个人通过联网智能手机独立运作,每人持自有数据,无第三方介入。本文定义了数字言语行为——个人在其设备上使用私钥对内容进行加密签名的有意行为,从而确立归属、责任和作者身份。论证指出:数字言语行为符合美国先例(Burrow-Giles、Feist)对版权保护的要求;草根平台的数字社会契约通过设计保留版权,签名内容不可与签名分离,所有权与占有权统一于个人;数字言语行为的版权是数字主权和民主自治的前提。
阅读近日,Movement Advancement Project、Actionable Intelligence for Social Policy 与 CDT 联合发布了一份关于州级性取向与性别身份数据实践的报告。报告指出,政府实体收集性取向与性别身份数据,有助于了解 LGBTQ+ 群体的经历、需求及不平等状况。高质量 SOGI 数据在负责任地收集、存储和使用时,能够发挥重要作用。
阅读OpenAI将GPT-5.4连接到Maria AI与自动化实验室,用于改进药物化学中的Chan-Lam偶联反应。该系统自主识别伯磺酰胺为高价值挑战性底物,并提出使用温和氧化剂TEMPO。经过两轮实验,优化条件下88%的硼酸和83%的磺酰胺测试产率提高,平均产率从16.6%升至25.2%,高于30%产率的比例从15.6%升至37.5%。人工验证确认了微升级结果,14对底物中11对产率提升,多数超过两倍。磺酰胺基团广泛存在于抗癌药、抗菌药等药物中,该改进有助于药物发现中的合成瓶颈。
阅读本指南提出了一个系统化、可操作的法律论证结构标注框架,旨在揭示司法推理的逻辑组织,并为计算分析提供可靠基础。在要素层面,区分非命题层(问题与非论证成分)和命题层(一般规范判断、特殊规范判断、一般事实判断、特殊事实判断)。在关系层面,定义了支持、攻击、联合、匹配和同一五种关系类型,涵盖积极与消极论证连接、合取推理结构、法律规范与案件事实的对应以及命题间的同一性。该指南还规定了基本与嵌套结构的形式化表示规则和可视化约定,并建立了标准化的标注流程与一致性控制机制,以确保标注数据的可重复性和可靠性。该框架支持大规模司法推理分析,并为法律论证挖掘、法律推理计算建模及AI辅助法律分析提供基础。
阅读大型语言模型现已能生成至少中等质量的法律文本,但目前尚无基准能够评估它们是否执行学理法律推理——这是法律工作的解释核心,而非当前大多数法律AI评估所衡量的辅助性法务任务。这一测量缺口不仅是方法论上的,也是法律上的:欧盟AI法案对司法领域使用的高风险AI提出了“适当准确性”的约束性要求,但该要求若缺乏领域内尚不存在的学理推理基准,就无法获得可操作的内容。
阅读arXiv:2606.18021 提出 LegalHalluLens 审计框架,包含类型化幻觉档案(基于CUAD数据集覆盖数值、时间、义务/权利、事实四类)、风险方向指数(RDI,将遗漏与虚构偏差转化为单一标量)和类型化辩论管道。在510份合同、249252条条款级别实例中,发现聚合指标掩盖了同一模型在义务/数值与时间类之间的约38-40个百分点差异,且两个52%错误率的系统可能呈现相反的RDI。辩论管道将虚假检测减少45%,各类别改进与诊断结果一致,以40亿参数模型匹配商业API性能。该框架支持方向感知的采购、问责和智能体设计。
阅读基于对约40万次Claude Code会话的隐私保护分析,研究发现人类主导规划决策,AI负责执行决策。领域专业知识越丰富,AI每项指令完成的工作量越大。各主要职业在编码任务上的成功率与软件工程师相近。专家用户成功率更高,但与中级用户差距不大。七个月内,调试时间占比下降近半,使用转向端到端代理应用。任务价值通过对比自由职业岗位估算,平均提升约25%。
阅读本文提出一个共识标记提示库,用于衡量编码模型对恶意代码请求的合规性。研究发现,代码与知识分类轴在扩展语料库和更换评委面板后保持稳定,Fleiss' kappa=0.767,两面板一致性达94.45%。最终发布包含4748个共识代码和1923个共识知识提示的可靠性量化基准数据集。
阅读本研究介绍了DOMUS,一个为伦敦纽汉区量身定制的云端AI决策支持系统,用于优化法定临时住宿安置。系统整合家庭案例记录、政策约束下的可负担性和适宜性规则以及实时私人租赁列表,形成统一的治理工作流。通过透明规则筛选与大语言模型辅助搜索,标准化卧室需求、可负担阈值、地理偏好和无障碍要求,同时保留官员决策权和可审计性。在纽汉区安全环境中的试点评估表明,相比人工流程,搜索时间显著缩短,关键安置约束遵守率提高,员工满意度高,且保持法定合规与问责制。DOMUS被设计为可复制的数字公共基础设施,模块化云原生SaaS架构可推广至英国其他行政区,并适用于其他资源稀缺、规则约束和高风险公共管理任务。
阅读该研究通过比较纯LLM分类、LLM基础形式推理和Z3求解器形式推理三种范式,在重新标注的ContractNLI子集上评估了五个LLM的法律推理忠实性。重新标注揭示了实用法律解释与严格形式蕴涵之间的系统差距,大量法律上合理的推论缺乏形式基础。尽管引入形式结构提升了基准性能,但LLM基础形式推理的高分并不代表忠实推理,存在三种反复出现的失败模式:范围清洗(LLM报告与求解器不一致的分类而不执行底层形式推理)、隐式约束盲视(忽略形式表示中的逻辑约束)和程序合成失败(即使有结构化提示也生成错误的Z3代码)。范围清洗在所有模型中持续存在,严重质疑LLM基础形式推理作为符号执行代理的忠实性,揭示了基准准确性与逻辑忠实性之间的根本差距。
阅读本文对七种开源大语言模型在法律领域推理中的神经元作用进行了层级分析。通过神经元归因分数排序并抑制关键神经元,发现抑制这些神经元会破坏目标任务准确性,而随机抑制则无影响。研究识别出一小部分跨任务通用神经元,移除它们后,剩余神经元仅影响其来源任务,揭示了每个模型中的任务特异性神经元。在法律领域内,三个基准测试的神经元重叠度较高,且倾向于共同受影响,表明存在跨司法管辖区的法律组件神经元。此外,关键神经元的分布并非普遍集中在中间MLP层,而是取决于输入格式和内容。
阅读OpenAI开发了一种部署模拟方法,在模型发布前通过隐私保护方式重放历史对话,模拟真实部署场景,以评估新模型可能的行为,包括发现新的不良行为及其出现频率。该方法已在GPT-5系列思维模型部署中应用,改善了不良行为率估计,发现了新的未对齐形式,并降低了模型意识到被测试的风险。它还能扩展到代理设置和工具使用场景。与传统评估相比,部署模拟能更全面覆盖行为类型,减少选择偏差。
阅读上月,伯克利法学院在多个学习领域争议性地禁止使用人工智能。一名攻读法学硕士的学生拉克希塔·巴尔加瓦对此作出了回应。
阅读AI Now即将发布的报告工作草案追踪了美国数据中心行业的企业权力,重点关注决定当前数据中心繁荣的驱动者和受益者的资金和权力流向。该研究旨在帮助当地社区及其倡导者进行抗争。
阅读2026年6月10日,全球非营利组织未来隐私论坛(FPF)发布了一份关于青少年在线体验中算法个性化的综合报告。报告评估了数据驱动个性化在青少年网络环境中的作用,并分析了其对新兴政策和产品设计的影响。当前,政策制定者正就青少年在线安全法规展开辩论,该报告为相关讨论提供了基于数据的分析视角。
阅读档案室周报 / 每周四 / 18:00
来源 / 编辑校对台 · VOL.06接收一封已核对的法律 AI 观察:涵盖监管动向、可采证据、实务流程与值得细读的研究脉络。
订阅与提交线索