Uber每年要谈数千份合同。交易、供应商入驻、产品上线,全卡在法务审核这一环。审核慢一天,业务就多等一天。
但Uber团队发现,这份看起来高度专业的工作里,藏着大量结构性模式:相似条款反复出现,红线修改可以复用,法律立场长期稳定。这跟代码审查、客服回复这些已经被AI渗透的领域是同构的,只是领域知识壁垒更高。
![]()
他们做出来的东西,最终拿到了2026年ALM Legalweek“年度最具创新力法务部”奖项。内部分享的两个数字:平均合同审核时间下降20%+,AI生成决策准确率91%。
但这条路不是一步走通的。从第一版到第四版,Uber踩过的坑和改过的架构,几乎是一部教科书级的“从RAG到Agent”演进史。
三条哲学,决定了后面所有技术选型
在讲四次迭代之前,得先说清楚三条贯穿始终的产品哲学。后面每一个技术决策,都能回溯到它们。
- 在律师工作的地方交付。做成Microsoft Word插件,而不是让律师去用一个新工具。采纳成本越低,用起来的人越多。
- 增强而非替代律师判断。AI只给建议——accept、reject、modify,外加理由注释,决策权始终在人手里。
- 用真实反馈持续迭代。这一条直接催生了第二版的核心架构。
第一版:朴素RAG,失败
第一版的想法很直接:把谈判playbook灌进RAG管道,让模型检索相关条款来辅助决策。
结果撞上三个典型失败模式。
语义检索失准。用来做嵌入的“关键句”和实际需要检索的内容对不上,query和document的粒度错位了。
语气失控。生成的注释要么过度防御,要么过度让步。在法律文书里,语气本身就是立场,不是修辞问题。
无法泛化。没见过的谈判场景,直接失效。
这一版的教训是:playbook里的静态知识,和律师实际谈判中的动态偏好之间,存在巨大鸿沟。文档不等于决策数据。
第二版:从“学文档”改成“学决策”
第二版是整个项目的转折点。团队放弃“从文档学”,改为“从决策学”。
系统开始捕获每一次真实谈判的完整轨迹:对方原始措辞、律师划的红线、期望动作、律师写的注释、最终修改文本。这些粒度极细的对齐数据,让系统能把“对方意图”直接映射到“本方律师偏好的应对语言”。
运行时的流程是:相似度检索加元数据过滤,取出约20个候选,再由LLM二次精筛,最后生成决策与注释。
里面有两个精巧的工程细节。
一个是指数衰减加权,半衰期设为365天。优先采信近一年的决策,天然对抗策略漂移——对方的立场和内部政策都会随时间演变。
另一个是正负样本均衡的few-shot。agree和disagree的案例成对呈现,让模型学到的是判别边界,而不是单边模仿。
关键结论是:不需要任何手动微调,检索加上下文学习就能让系统持续进化。
第三版:语气分层,把prompt交给律师
第三版单独加了一个LLM调用做语气调制。技术上有意思的是“proactive and pessimistic”的一次性反思:预先假设生成的注释有质量问题,让模型一次性自检修正。效果等同于反思循环,但只花一次调用的token和延迟。
更大的突破在组织层面。三段式prompt——目标、偏好风格、开场白示例——的所有权直接交给了律师。
Uber的结论很客观:塑造输出格式的prompt,应该由领域专家管理,而不是工程师替律师定义“什么叫专业语气”。
第四版:从建议者升级为起草者
第四版对MODIFY决策引入了agentic workflow:参考历史反馈和规则库,起草反提案文本,杜绝幻觉条款。到这一步,系统从“建议者”升级成了“起草者”。
配套的还有一个规则库,作为确定性兜底。由律师维护:选中常被修改的模板条款,附上规则——Uber立场、可退让的底线、示例回复。检索到的修改句做语义匹配,高置信度命中就直接注入上下文,最后还有一道LLM校验步骤对齐立场。
规则库的价值在于:第一天就能给出高置信度结果,不像反馈库需要冷启动积累,同时保证跨业务线的立场一致。
回头看这四版,路径其实很清晰:第一版想用静态文档解决动态问题,失败;第二版转向真实决策数据,找到转折点;第三版解决语气和所有权问题;第四版把AI从给建议推进到写草稿。每一步都不是推翻重来,而是补上前一版暴露的那块短板。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.