当通用大模型在文本、代码、图像上攻城略地时,真正决定AI能否吃下制造业的,往往是那一毫米的公差。
香港大学联合忆生科技提出的Pointer-CAD v2,给出了一个值得整个行业细看的答案:通过"先规划、后构建"(Plan-Then-Construct)范式,将参数推理与几何构建彻底解耦,从源头消除量化误差。其15亿参数模型在顶点、边、面三级几何精度上全面超越GPT-5.2、Gemini 3 Pro等顶尖通用大模型,平均领先超过21%;7B版本的"可修复模型率"达95.23%,意味着几乎所有生成结果都能直接进入真实CAD工作流。该工作已入选ECCV 2026,代码已开源。
参数量相差超过百倍,精度却反被超越——这个结果背后,藏着一条关于"AI如何落地垂直行业"的重要线索。
![]()
论文题目:
Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision
论文链接:
https://arxiv.org/abs/2606.29301
项目主页:
https://github.com/Snitro/Pointer-CAD-v2
一、工业软件:AI落地制造业
绕不开的"源头环节"
制造业数字化的链条上,CAD是第一环:产品从图纸到加工,仿真、工艺、制造全部以CAD模型为源头数据。这是一个对精度近乎零容忍的领域——毫米级的数值偏差,在渲染里无人在意,在生产线上就是报废件。
近年来基于大语言模型的CAD生成将建模过程建模为序列预测问题,取得了可观进展,但一个关键矛盾始终悬而未决:现有方法和评测协议只强调视觉相似度,却忽视了精确的几何参数与正确的度量尺度。
论文中的例子很直观:用户要求生成长方体(1cm×1cm底面、高0.7cm)上叠放一个边长0.3cm的正方体。主流的命令序列方法为了简化自回归预测,需要把连续的数值参数量化到有限的离散数值集合中;论文以2-bit量化为例做说明(量化粒度可按需选择,2-bit仅为本例的示意设定):数值只剩0.33、0.67等选项,0.7cm的真实高度只能被"四舍五入"成0.67。形状上看几乎一样,工业语境下却足以让零件报废。
更棘手的是,现有评测指标还会进一步掩盖问题:Chamfer Distance(CD)和IoU等形状级指标在归一化后计算,两个尺寸存在细微差异的模型,IoU可能都高达0.96。方法在"将就",指标也在"将就"——这正是许多"AI+工业"故事讲不下去的共同原因:技术上差最后一毫米,商业上就差整个市场。
![]()
二、两条路线,各有各的坎
当前LLM驱动的CAD生成大致分为两条路线:
•命令序列表示:用专门的token词表描述参数化操作(sketch-extrude对、倒角、圆角等),token效率高,但参数与操作共享同一tokenized空间,连续几何量必须量化进有限词表,参数保真度先天受损;
•代码表示:在CadQuery、FreeCAD等脚本环境中生成可执行代码,天然支持高精度参数,但生成单个模型的token开销约为命令序列的4倍,训练与推理效率大打折扣。
该团队此前的Pointer-CAD(v1,CVPR 2026)通过指针机制支持对中间B-rep几何实体的显式引用,扩展了命令序列的表示能力,但精确的尺寸控制仍未解决——在其他不受约束的几何配置中,小的数值偏差依然会出现。
![]()
三、Plan-Then-Construct:
先把参数想清楚,再动手建模
Pointer-CAD v2的核心思路,是把"数值推理"和"几何构建"这两个认知负荷完全不同的任务拆开,各交给最合适的表示空间。
3.1 维度感知的设计计划
在每个生成步骤中,模型首先在文本域产出一份结构化设计计划。所有几何参数以符号形式书写:长度标记为L、角度标记为A,每个参数绑定明确单位(如 、 ),支持算术运算与对先前定义参数的引用(如 )。这种表示在度量尺度上准确、无量化,为后续构建提供了显式约束。
![]()
3.2 参数字典与指针检索
计划中的参数被抽取出来,按长度、角度分为两个参数字典,统一单位后经保符号对数归一化、指数递增频率带的傅里叶编码、门控MLP投影并施加RoPE位置编码,形成参数嵌入集合。
在构建阶段生成命令序列时,每当需要一个数值参数,模型不再从量化词表中"猜"一个离散值,而是预测一个共享嵌入空间中的查询向量,与参数嵌入计算余弦相似度,直接"指"向字典中的某个参数并原样取用——数值经过多少次生成都不再失真,维度一致性由此得到保证。
3.3 三头解码架构
在自回归解码端,Pointer-CAD v2将v1的单头联合解码拆分为三个专用头:Label Head负责预测命令标签token,Value Head负责数值参数嵌入的检索,Pointer Head负责对既有B-rep中面、边等几何实体的引用。计划token与命令token在同一次前向中由两个模态专用解码头顺序生成,一个控制token分隔两种模态,既协同又解耦。
四、新数据集+新标尺:让精度"无处遁形"
要训练和检验参数级精度,光有方法不够,还需要对的数据和对的尺子。
数据方面,团队基于Recap-OmniCAD与Recap-OmniCAD+(后者额外包含倒角与圆角操作),用Qwen3为每个CAD模型标注结构化设计计划,经语法纠错、程序化参数完整性校验与人工抽检后,构建了OmniCAD-Plan(20.2万个有效模型)与OmniCAD-Plan+(20.9万个有效模型)两个计划级监督数据集。
![]()
评测方面,团队提出三级几何精度指标,将评价从"粗粒度结构相似"推向"细粒度参数对齐":
•顶点精度(Vertex Accuracy):预测顶点与GT最近点的欧氏距离在容差内才算匹配;
•边精度(Edge Accuracy):不仅端点要定位正确,底层几何参数(圆弧的圆心与半径、圆的法向等)也须在容差内对齐;
•面精度(Face Accuracy):所有边界边被正确识别,且原始体类型(平面/圆柱/圆锥/球/圆环)与GT一致。
容差设定为GT包围盒最小边长的千分之一,且所有模型在原始位置与尺度下评测、不做归一化——这就迫使模型必须真正理解文本指令中的度量尺度。此外还引入了可修复模型率RMR@3:错误面不超过3个(约对应一次sketch或extrude的小失误)的模型占比,衡量生成结果在真实CAD工作流中的可用性。
五、实验:小模型的大胜仗 5.1 对比专用CAD生成方法
在OmniCAD-Plan测试集上,1.5B规模的Pointer-CAD v2全面领先两类专用基线:
![]()
相比CADmium-1.5B,Pointer-CAD v2三级指标平均提升13.49%。差距最悬殊的是圆弧精度:CADmium-1.5B仅5.61%,Pointer-CAD v2达到68.53%——代码方法虽然数值自由,却常出现结构错误(漏建、错建部件);v1形状合理但尺寸有偏差;v2则兼得结构完整与尺寸精确。
在包含倒角、圆角的更复杂数据集OmniCAD-Plan+上优势进一步拉大;且随着模型规模从0.5B增至7B,领先幅度从13.12%扩大到15.36%,7B模型的RMR@3达到95.23%。
![]()
5.2 对比通用大模型
团队从测试集抽样2000个模型,让各通用大模型直接生成CadQuery代码评测:
![]()
通用模型中表现最好的Gemini 3 Pro,三级指标平均仍落后Pointer-CAD v2-1.5B达21.30%(OmniCAD-Plan+上为21.54%)。平均CD同样说明问题:Pointer-CAD v2-1.5B为0.91,GPT-5.2为12.01。
5.3 消融实验
对指针机制的消融显示:将参数引用退化为直接回归+最近值匹配(w/o Ref.),平均精度骤降26.54%;去掉计划阶段、直接从原始提示抽取参数(w/o Plan),下降12.96%。而去掉频率编码和归一化仅分别带来1.15%和0.48%的小幅下降——说明真正关键的在于"显式的参数推理+计划级的参数引用"这一设计。
六、三点行业启示
以下为编者视角的解读,供创业者与产业人士参考:
其一,垂直AI的护城河,是"表示+数据+评测"的全栈重构,而不是参数规模。Pointer-CAD v2同时重做了表示方法(参数与构建解耦)、数据范式(20万级计划级监督)与评价标准(三级参数保真度指标),15亿参数反超千亿级通用模型逾21%。对创业团队而言,这意味着在通用大模型的能力边界之外,仍有大量"改写游戏规则"而非"跟随刷榜"的空间。
其二,评测标准本身即是行业话语权。现有CD/IoU指标掩盖了工业场景最在乎的参数保真度;谁定义了"什么叫生成对了",谁就掌握了垂直市场的准入门槛。三级几何精度指标若被广泛采纳,可能成为AI生成CAD的事实基准——这类"从0到1定义评价体系"的工作,往往比单纯的模型领先更具长期价值。
其三,参数化与可编辑性,指向设计迭代的自动化。由于所有几何参数显式定义在计划中,修改一个参数即可同步更新整个模型并保持相对比例——设计师可以用"改参数"而非"改模型"的方式迭代。将这一特性放进工业研发流程看:设计变体、方案比选、参数寻优,都存在被AI重构工作流的可能。工业软件的智能化,正从"辅助画图"走向"参与决策"。
七、局限与展望
团队也坦诚展示了失败案例:在极精细特征(小孔、细长圆柱)上偶有失误,部分错误源于计划阶段的参数误差沿Plan-Then-Construct链路传播。这也是该范式的特点——计划的质量直接决定了构建的上限。
八、结语
Pointer-CAD v2把"AI生成CAD"从看图说话的相似度游戏,拉回到了工业制造真正在乎的参数与公差上。当"AI+工业"的叙事越来越拥挤,这类把领域先验做进表示结构、把评价标准拉回产业真实需求的工作,或许才是垂直场景真正跑通商业化前夜的模样。
Illustration From IconScout By IconScout Store
9月28日晚@美国匹兹堡
「IROS 2026 群星闪耀 精英晚宴」
免费报名,期待线下见面!
北京时间9月25日(周五) 12:00截止报名
-The End-
本周上新!
扫码观看!
“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
yimingzhang@thejiangmen.com
或添加工作人员微信(aceyiming)投稿,沟通投稿详情
关于我“门”
将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
![]()
点击右上角,把文章分享到朋友圈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.