1. 一句话生成CAD模型从新概念变成新工作方式1.1 我为什么会关注text-to-cad这两年我最常刷到的一个方向就是输入一句话AI给你生成一个CAD模型。项目名直接叫text-to-cad火得很。一开始我以为又是那种演示视频——视频里看着很惊艳真上手就垮掉。直到我拿自己日常画过的零件去试了一轮才意识到这东西早就不是玩具了。我平时做非标自动化设备的工装设计接触最多的就是支架、底座、钣金件这类零件。这类零件有个共同特点结构不复杂但尺寸要求精确孔位、圆角、翻边一个都不能差。传统CAD画法其实不慢真正磨人的是方案阶段的来回改。客户说这里加两个孔板厚改成5毫米四个角都倒圆角每一句改起来都要动草图约束改着改着就烦了。text-to-cad解决的就是这类场景用自然语言描述需求模型直接生成可用的三维模型。它面向两类人一类是没学过CAD、但需要快速表达设计想法的人另一类是像我这样会画图、但希望把重复性草图工作交给AI的老手。把重复的事情交出去把精力留在尺寸校核和工艺判断上这才是它真正的价值。1.2 它解决的是两类人的两类痛点先说第一类人没有CAD基础却经常要说清楚一个东西长什么样的人。比如做采购的、做销售的、做售前方案的他们想给客户看一个外形概念找设计部门排期要等三天。现在用text-to-cad工具输入一个长方形的铝型材支架长400毫米宽300毫米四角有安装孔十几秒就能看到一个三维模型截个图发群里就能沟通。虽然不能直接加工但沟通效率提升了不止一个量级。第二类人就是我们这些天天泡在CAD里的人。我们需要的不是从零画出模型而是把已经明确的设计意图快速变成草图。比如我已经知道这个支架尺寸是80乘60乘3四个角R8圆角底部避空2毫米——这些信息如果靠手动建模至少十分钟但写成文字让模型生成可能一分钟都不用。生成完我检查一遍尺寸没问题就进装配有问题就在参数里改。我关注text-to-cad还因为它直接把设计表达和建模操作这两件事拆开了。以前这两件事是绑在一起的你想表达一个想法必须学会建模操作。现在自然语言把表达门槛拆掉了建模操作由模型完成。这个变化对行业的冲击比单纯出图速度快一点要大得多。1.3 和热词背后那群CAD用户的关系顺手看了一眼相关搜索里那些高频词很有意思cad下载、cad安装、cad shx字体大全、cad如何彻底卸载、cad图纸合并、cad转pdf、python批量对cad修改……这些词说明大量用户还停留在把CAD跑起来、把图转出去的阶段。但这恰恰说明text-to-cad为什么值得所有人关注。它不是一个孤立的新软件而是长在现有CAD生态上的一层新能力。无论你用的是AutoCAD、中望CAD还是免费的DXF工具最终交付的图纸、打印、合并、导出流程还是那一套。text-to-cad负责的是前面那一段更快地把脑中的设计变成几何数据。后面的图纸深化、出图、工艺标注依然要靠你手里的CAD功底。所以在后面几个部分里我不光讲生成模型本身还会把生成之后遇到的那些老问题一起讲了转PDF、合并图纸、字体缺失、批量修改、布局打印。这些都是我自己踩过的坑也是把AI生成的模型真正落到交付链条上必经的路。2. 原理拆解CAD模型是怎么被训练出来的2.1 把建模操作翻译成图纸语言想训练一个模型去生成CAD第一个要解决的问题是CAD模型怎么表示成计算机能学习的格式常见的三维模型表示方法是网格和点云比如扫描仪扫出来的STL文件就是一大堆三角面片。但网格不是CAD。CAD模型讲究的是参数化特征——你画了一条线、拉伸了一个实体、挖了一个孔每一步操作都有明确的几何参数。网格里没有孔这个概念它只有一堆顶点和面的位置。研究团队解决这个问题的思路很有意思把建模过程当成一种语言来处理。就像一句话是由单词组成的一个CAD模型也可以拆解成一系列建模命令的序列。比如画一个最简单的方块可以表示成[SKETCH] 绘制闭合外轮廓 → [LINE] 起点(0,0) → 终点(50,0) → [LINE] 终点(50,30) → [LINE] 终点(0,30) → [LINE] 闭合 → [EXTRUDE] 拉伸方向Z轴 → 拉伸深度 10这条命令序列本质上和我画了一个50毫米长、30毫米宽的长方形向上拉伸了10毫米是一回事。模型要做的就是学习这种命令序列的排列规律然后根据文字要求造句——造出来的句子就是一段建模操作序列。这里有个关键选择为什么偏偏用草图加拉伸这种操作因为统计下来现实世界的机械零件里绝大多数都是先画二维草图再通过拉伸、旋转、扫掠生成三维实体。这套表示方法覆盖了大部分实际零件同时序列化之后非常适合现有的大模型架构来处理。选择训练数据的时候研究团队从公开的CAD模型库里整理了十七万多个模型把它们全部用这套草图加拉伸的操作序列表示形成了一个标准化的数据集。你去看相关论文里那些生成样例形状看起来五花八门底层用的都是同一套语法。让计算机理解这套语法还有一个细节叫量化。坐标数值是连续的小数比如3.14159毫米但在模型训练里连续数值很难直接处理。处理方式是把数值离散化——类似把一张照片压缩成像素网格。假设量化步长是0.5毫米那所有坐标都会被取整到最近的格点上。半径6毫米的圆就变成了一个约12个格点直径的规则形状。量化步长越细几何精度越高但模型需要处理的序列就越长训练成本也越高。所以工业级应用里各家都在精度和成本之间找平衡。2.2 自回归生成与约束采样命令序列表示好之后训练目标就变得很直接给模型一段文字描述让它逐token地预测下一个建模操作。这个机制叫自回归生成和手机输入法打字的原理很像。输入法的联想模型是看到你打了前几个字预测下一个字text-to-cad就是看到你描述的需求预测下一个建模命令。这个过程有一个非常反直觉的地方模型生成的结果带有随机性。同样的提示词生成两次结果会有差异。因为每一步预测都是算出一个概率分布然后从这个分布里采样不是每次挑概率最高的那个。这有点像让人凭记忆复述一段台词同一个人的两次复述也不可能一字不差。随机性让模型能生成多种不同的设计方案但也带来了后面会讲到的稳定性问题。要让模型理解文字和几何之间的对应关系训练数据里就得同时包含文字描述和几何命令序列。很多数据集里的模型只有几何信息没有文字说明所以研究者还会额外用模型给几何模型自动写描述或者让大语言模型帮忙生成多样化的文本标注。这个过程类似配字幕几何是画面文字是字幕训练目标就是让模型学会画面和字幕的对齐关系。有了对齐关系之后还缺一个重要的能力对话交互。用户说这个支架再加两个孔模型得知道这个指的是之前生成的那个模型。这就要做指令微调——在基础生成能力之上用大量用户指令对应修改操作的数据再训练一轮让模型学会在多轮对话里保持上下文一致。2.3 用来评判生成质量的标准生成模型最怕的就是看起来像实际不能用。所以这几年出现了专门的评测基准拿一组标准化的文本提示词去考不同模型再对比生成结果和真实模型的差异。评测通常分为几个维度第一是几何结构合法性。生成的草图能不能闭合拉伸方向是不是合理有没有出现自相交的面这是最基本的门槛——如果轮廓没闭合后面的拉伸操作就是空谈模型在生成时多了一个该闭合时就闭合的约束。第二是尺寸和比例的准确性。你要求板厚8毫米它生成出7.2毫米算不算错在概念设计阶段可以容忍但到了非标加工阶段这种误差可能直接导致报废。目前大部分商业工具给出的都是语义正确、尺寸接近的结果真正精确到毫米级还需要用户进入CAD里重标尺寸。第三是形状多样性和可用性。同样的文字模型能不能给出几个不同的变体这些变体有没有工程可行性一个能生成五种结构方案的模型比只能生成一种漂亮外形的模型有价值得多。理解了这套原理你就能看懂市面上那些工具的差异了有的擅长概念外形因为它用了大量文字到渲染图的预训练数据有的强调结构合理性因为它在序列生成时加了更多几何约束。没有哪个是全能选手选择工具之前先想清楚你是要好看的外形还是能改的尺寸。3. 现有工具横向对比没有银弹但有可用的3.1 主流方案速览真正上手之前我先横向对比了一下当前能接触到的工具方案。这条赛道变化很快我没有把所有工具都列全挑几个有代表性的覆盖了商业产品、开源项目和学术原型足够帮你建立选型判断。工具/项目输入方式输出格式可编辑性适合谁ZooText-to-CAD产品线文字描述支持图片参考STEP、STL部分场景可导出原生格式中性格式进CAD后需重新参数化做方案概念、需要审视图形的用户DreamCAD文字描述三维网格模型草拟几何科研原型仅作展示参考关注模型生成效果的研究者CADmium文字描述加参数设置DXF、STL浏览器中运行开源输出DXF后可用CAD打开编辑教学场景、轻量草图、入门学习传统CAD内嵌AI辅助草图识别、文字指令、约束建议原生格式高保留完整特征树已使用特定CAD平台的深度用户大语言模型加脚本让ChatGPT类模型写DXF/DWG处理脚本取决于脚本逻辑极高但需要编程能力熟悉CAD二次开发的自动化玩家这个是当前时间点的真实情况。真正我日常每天都在用的是传统CAD内嵌AI辅助和通用大模型加脚本这两类。前者处理草图约束非常顺手后者帮我省掉大量重复性的图纸批处理工作。3.2 我觉得值得认真用的顺序如果你是零基础想先感受一下text-to-cad长什么样我建议从Zoo这类商业产品开始。它把交互做得最简单——打开网页输入描述等结果旋转看模型导出文件。全程不需要你懂CAD任何术语这也是它用户量增长这么快的原因。但要记住一条它生成的是概念模型不是完工图纸。你拿它出的图去给客户看外形、谈方案没问题直接拿去加工大概率要出问题。如果你是有基础的CAD用户想把它接进自己的真实工作流我反而建议你先玩开源那套比如CADmium或者直接用Python处理DXF。原因很简单商业工具输出的是STEP中性文件进到SolidWorks、Fusion、中望CAD这些平台之后特征树是空的就是一个死模型。你想改个孔距没法双击特征修改只能自己重建。开源方案至少你能看到几何数据配合脚本批量处理反而更灵活。如果你已经在某个CAD平台上有大量积累那就盯紧你正在用的那款软件的AI功能。AutoCAD、Fusion这些平台都在往AI辅助方向走他们最大的优势就是模型生成之后直接带参数特征改起来顺手得多。缺点是你被绑定在自家生态里换平台就得换工具。最后真诚建议一句不要因为某条新闻说某模型在基准测试上得了第一就立刻决定全面切换。评测基准测的是生成质量不是你日常工作的完整链条。判断一个工具能不能用唯一靠谱的标准是拿你上个月画过的三个真实零件去试看看从文字到模型再到你所在CAD平台二次修改整个流程走下来要多久。低于半小时值得长期用超过半天还是老老实实自己建模。4. 实操用一个支架模型跑通全程4.1 先描述清楚你需要什么在text-to-cad场景里提示词写得好不好决定了生成结果的天花板。我试过几百次之后总结出一个通用描述框架主体形状 → 关键尺寸 → 辅助特征 → 工艺细节。用中文想清楚再翻成英文提示词因为这类模型训练语料里英文占绝对主流。比如我想生成一个用于设备底座的铝支架主体形状底部是长方形平板两侧有竖直的翻边关键尺寸底板长80毫米宽60毫米板厚3毫米辅助特征四个角各一个直径6毫米的安装孔孔心距边10毫米工艺细节四个棱边倒R5圆角翻边高度20毫米翻译成英文提示词就是An aluminum mounting bracket. Base plate 80 mm long, 60 mm wide, 3 mm thick. Two vertical flanges on the left and right sides, flange height 20 mm. Four through holes of diameter 6 mm, located 10 mm from each corner. Fillet radius 5 mm on all edges.你会发现这个描述和给人工建模同事交代需求时说的话几乎一样。这就是text-to-cad最大的优势不需要你知道具体用什么命令只需要你说清楚你要什么。4.2 从提示词到STEP文件我以Zoo为例走一遍完整流程其他工具也大同小异。第一步把上面那段提示词粘贴进输入框。如果有参考草图可以同时上传一张俯视图的线框截图模型会结合文字和图片一起理解。有参考图的情况下生成结果的外形符合度会高不少尤其是异形件。第二步点击生成等待十几秒到半分钟。平台通常会返回2到3个候选方案你可以在三维预览里旋转、缩放检查。重点看三处安装孔有没有生成出来翻边的方向对不对整体比例是否接近80比60的基准第三步选一个最接近需求的候选导出STEP文件。STEP是工业领域最通用的中性三维格式SolidWorks、Fusion、CATIA、中望CAD都能打开。导出的时候留意一下单位设置如果模型默认是英寸导入之前就要换算不然尺寸全错。第四步打开你的CAD软件导入STEP文件。此刻你看到的就是一个实体模型外形基本正确但还没有特征树。在Fusion里这个导入实体会被识别成网格或基础实体。接下来你要做的不是直接拿去用而是把它当成参考用你们公司标准的三维模板重建一遍关键特征。这个过程听起来麻烦实际上比从零建模快得多。因为模型的轮廓和比例已经正确了你只需要重新做一次拉伸打孔倒角大概花三分钟总耗时比手动建模省掉一大半。4.3 导入Fusion之后的收尾动作模型导进来之后有几个动作是必须做的跳过任何一个都会在后续装配里出问题先做尺寸复测。用测量工具检查底板的长宽和板厚和设计值比对。批量生成时尺寸偏差经常出现百次生成里总会有几次离谱的结果比如孔距变成了8毫米而不是10毫米。复测这一步不能省。然后做特征重建。我一般的做法是在底板上新建草图利用导入实体的轮廓投影生成新的草图曲线然后把孔、圆角、翻边这些特征一次性加回来。虽然麻烦但重建后的模型干净、有参数、可修改后面就算客户再提改动也接得住。最后做命名规范处理。把零件名改成公司编码规则设置好材质属性、密度、颜色。这一步容易被忽略但如果没有做好后期出BOM表的时候你会花二十分钟在表格里一个个手动补。AI已经帮你省了建模时间不要在管理规范上再浪费回去。5. 踩坑实录模型生成出来不等于能落地5.1 小特征凭空消失我第一批测试生成里最常出现的问题就是孔没了或者圆角丢失。明明提示词里写得很清楚结果模型输出的实体上就找不到那几个直径6毫米的孔。后来我想明白原因了。自回归模型生成命令序列时每个位置的token都有一定概率被遗漏或者被简化。对模型来说直径6毫米的圆在整个命令序列里只是几个token属于低频信息而拉伸一个矩形底座这种高频结构模型学得非常牢固。低频小特征就容易被采样环节丢掉。这就像打电话请人帮忙代买三样东西对方大概率能记住买袋米但容易把顺便带一管牙膏给忘了。应对方法有两个。一个是提示词里把孔的数量和位置写得越明确越好最好加上四个角各一个孔而不是笼统地说有几个安装孔。另一个是生成后务必在CAD里做截面检查沿着孔的位置切一刀看看孔是否真的贯穿了底板。我在Fusion里长期用一个截面分析命令几秒钟就能确认。5.2 尺寸和单位不可控这是所有文本生成工具都绕不开的痛点。模型训练数据来自不同来源不同作者建模时单位习惯不一样有的模型内部用的是英寸有的是毫米。虽然大多数主流工具对外输出时会做单位转换但偶尔会出现一个自动判断单位的失误你要求80毫米它理解成80英寸结果生成一个两米多的庞然大物。我踩过一次真实的坑给客户做的设备底座生成时模型显示正常导入中望CAD之后尺寸变成了原来的25.4倍。幸好我在装配前做了尺寸复测不然整个装配图的尺寸就全乱了。从此我定了一条规矩任何AI生成的模型导入后的第一步必须是测量主尺寸长了短了立刻退回去重新生成绝不带着疑问往下走。5.3 特征树丢失到了传统CAD变成死模型这是目前text-to-cad工具与传统CAD融合时最大的一个结构性矛盾。商业工具导出STEP文件后实体可以导入但你在原平台看到的那些建模历史、参数特征全部不跟着走。结果就是模型的外形完全正确但你的CAD软件里没有参数可改改任何一个特征都意味着推翻那个实体重新建。我带学生做毕设时就碰过这个情况。学生用text-to-cad生成了一台小型传送带机架看着很完美导入Fusion开始做装配干涉检查发现有一根加强筋和立柱干涉。按以前的思路双击加强筋特征改一下位置就行现在是死实体只能把整根加强筋删掉重建。所以我的建议是把text-to-cad定位成概念生成器不是参数建模器。用它来确定外形、比例和布局然后进CAD里重建参数特征。真正要反复迭代优化的零件我还是建议在原生环境里手动建模省得来回倒腾。5.4 提示词的语言偏好如果你只用中文提示词生成很快会发现一个问题生成结果虽然能看懂但总差了那么点意思——可能是圆角处理得生硬也可能是孔位排列不合理。原因是这类模型的训练语料以英文为主英文提示词能激活的特征空间更大、更精确。我的实践是先用中文把需求想明白再翻译成英文输入。注意别用机器翻译那种长长的整句翻译成短促的名词短语最好。比如铝合金安装支架底板开四个通孔翻边高20毫米比我要一个用于安装设备的铝合金支架它的底板上有四个孔两侧需要折边效果稳定得多。我这里不是说不支持中文就不能用。而是说在模型没有专门优化中文之前你稍微花三十秒把提示词翻成英文生成质量会稳定很多。等中文本土化模型成熟这个问题会缓解。5.5 模型质量和渲染美观的区别还有一条特别容易误导新手宣传图里的模型非常光滑纹理、材质、光影都美轮美奂但你实际导出STEP后看到的是布满三角网格的几何体棱边可能有小锯齿圆角面不够顺滑。这不代表生成失败只是渲染图和参数几何是两码事。判断一个模型能不能用不要看渲染效果要看它进到CAD软件里之后草图轮廓是否闭合、拉伸方向是否合理、实体是否可以继续做布尔运算。我见过有人因为宣传图漂亮就以为平台很厉害结果导出模型一塌糊涂。记住一句话做机械设计几何准确比外表好看重要一百倍。6. 把text-to-cad放进真实工作流批量修改、出图、打印6.1 AI出草图、Python来批量修改text-to-cad生成的草图和模型往往只是万里长征第一步。接下来还有大量的收尾工作改图层、改颜色、批量换字体、统计孔数量、导出多个DXF文件。这些如果用CAD一个个手动改AI帮你省下的时间又全还回去了。我的做法是让Python来啃这些重复劳动。我常用的是ezdxf这个库专门处理DXF格式。举个例子假设text-to-cad生成了一批DXF草图我要把所有圆放到孔图层并把文字统一改成公司标准字体脚本长这样import ezdxf doc ezdxf.readfile(ai_output.dxf) msp doc.modelspace() # 把所有圆放到“孔”图层 for circle in msp.query(CIRCLE): circle.dxf.layer 孔 # 把所有单行文字改成公司标准字体 for text in msp.query(TEXT): text.dxf.style gbcbig doc.saveas(final.dxf)这只是最基础的例子。更进一步你可以用脚本批量统计一个DXF文件里有多少个圆、多少个块引用自动生成一个清单或者对一批文件批量执行同一套替换规则再或者把多个DXF文件合并到一个文件里。这些工作用AI生成初稿、用脚本做批处理效率直接翻倍。需要注意的是处理DWG格式比DXF麻烦得多因为DWG是闭源二进制格式。实际项目里如果协作方发来的是DWG我一般先在CAD里另存为DXF再交给脚本处理。别纠结格式顺手转换一下不丢精度。6.2 转PDF、图纸合并、布局视口这些老问题text-to-cad生成的内容最终还是要走传统出图流程而这几个操作是我见过提问频率最高的也最容易在AI加成之后被忽略。转PDF我的标准操作是模型空间按1比1画图然后CtrlP打开打印对话框打印机选Microsoft Print to PDF或DWG To PDF.pc3打印范围选窗口框选要输出的区域勾选布满图纸比例选1比1。注意很多人转出来的PDF尺寸不对多半是打印范围选成了图形界限而不是窗口。图纸合并多张图要合成一张时不要直接复制粘贴因为不同图纸的图层、标注样式会打架。正确的做法是外部参照XREF或者设计中心拖入。合并之前先统一单位制和图框大小不然合完你会面对一堆对不齐的标注。布局视口完整的出图规范是模型空间只画1比1的几何模型在布局里新建视口视口比例设为1比1、1比2或1比5然后冻结视口里不需要显示的图层。这样一套图可以出多个视角打印的时候只需要选好图框。text-to-cad生成的模型导入之后没有图层规划这个说法所有几何都在默认图层上所以我强烈建议进CAD后第一件事就是分图层。另外说一句字体问题很多人在搜索cad shx字体大全因为打开外面发来的图纸时全是问号。根本原因不是缺少字体而是你的CAD字体样式里没有匹配的SHX文件。最省事的做法是准备一套公司统一使用的字体文件放到CAD的Fonts目录下再在字体样式里指定替代字体。别追求大全统一才是关键。6.3 谁适合现在就开始用最后说点实在的。经过这段时间的使用我认为现在适合立即引入text-to-cad的岗位有三类第一类是售前方案和概念设计。给客户做方案展示时先用text-to-cad生成三个不同结构的概念模型截图放PPT里让客户圈定方向再出正式图。这一步能把方案周期压缩一半。第二类是非标自动化选型和前期布局。设备平台、钣金框架、气动元件安装板这类零件用文字描述很快就能得到外形参考方便做空间预排布。第三类是教学和内部培训。让新人先用text-to-cad理解一个零件由哪些特征构成再对照生成的实体学建模步骤比自己摸索快得多。不适合用text-to-cad的是高精度模具、大型结构件这类对公差和受力有严格要求的设计。那些零件一个特征错误就可能导致整张图纸作废让模型生成再人工重建费的时间比自己画还多。工具是拿来提效的不是拿来折腾的。我个人这一年多下来的体会是text-to-cad真正值钱的地方不是生成一个能直接加工的三维模型而是把模糊的设计意图快速变成一个可以讨论的几何实体。你要做的不是丢掉CAD基本功去依赖AI而是把省下来的时间花在尺寸校核、工艺判断和那些AI还做不好的事情上。先拿它做概念验证和方案沟通比什么都实在。