基于 LLM 的服装吊牌关键字段智能提取实践

📅 2026/8/12 16:51:52
基于 LLM 的服装吊牌关键字段智能提取实践
在服装零售与供应链管理中吊牌信息如尺码、面料成分、货号、洗涤说明等的准确、高效录入是核心环节。传统 OCR 技术仅能输出原始文本难以直接获取结构化、可用的关键字段信息仍需大量人工介入进行筛选与整理。本文探讨了利用大语言模型LLM对 OCR 识别后的服装吊牌文本进行结构化解析实现关键字段自动提取的实践方案。我们将对比 Qwen、GLM、DeepSeek 等多款主流模型在该特定场景下的性能表现与适配差异为相关领域的智能化升级提供参考。1. 吊牌文本识别服装吊牌是连接生产、仓储、销售与消费者的重要信息载体。其上的信息通常包含产品标识类货号、品名、品牌。规格属性类尺码、颜色、面料成分及含量。合规与说明类执行标准、安全类别、洗涤维护图标、产地、价格。传统的信息录入流程依赖于人工阅读吊牌并手动输入系统效率低下且易出错。OCR光学字符识别技术的引入解决了“图像转文字”的问题但其输出是未经结构化的纯文本流例如货号A2024T001 品名男士休闲衬衫 尺码175/96A 面料棉 100% 洗涤说明请勿漂白对于计算机系统而言它仍然是一段“字符串”无法直接作为“货号A2024T001”、“面料成分棉 100%”等结构化字段进行存储和调用。核心挑战在于从非标准化、布局多样、可能存在噪声的文本中准确识别并提取出预定义的关键字段。这正是大语言模型LLM所擅长的任务理解自然语言语义并根据指令进行信息抽取和结构化输出。2. 技术方案设计2.1 整体流程我们的智能提取系统流程如下图所示“原始服装吊牌图像”“OCR 引擎识别”“原始识别文本”“文本预处理去噪、分行、合并”“构造 LLM 解析指令与提示词”“LLM 多模型调用”“Qwen”“GLM”“DeepSeek”“结构化 JSON 输出”“结果后处理与校验”“最终结构化数据”2.2 关键步骤详解OCR 识别采用高精度 OCR 服务如 PaddleOCR、Tesseract 商业版获取吊牌文本需兼顾中英文、数字及特殊符号的识别率。文本预处理去噪过滤 OCR 可能产生的乱码、无关字符。分行与合并根据换行符、标点初步划分语义块合并因排版断裂的字段如“面料棉 100%”可能被识别成两行。LLM 提示词Prompt工程这是决定提取准确性的核心。一个有效的 Prompt 应包含角色定义你是一个专业的服装信息提取专家。任务描述从给定文本中提取指定关键字段。字段定义与示例清晰列出每个目标字段如size,material,article_number的含义和格式要求并给出正反例。输出格式约束严格要求以 JSON 格式输出并处理字段缺失情况如输出null或空字符串。文本输入放入预处理后的 OCR 文本。多模型调用与解析并行或串行调用选定的多个 LLM API传入构造好的 Prompt接收其返回的文本。结果后处理格式校验确保输出为合法 JSON。逻辑校验例如面料成分百分比之和应为 100%。多模型结果仲裁当使用多个模型时可采用投票法或置信度加权法确定最终字段值。3. 模型对比实验我们选取了 Qwen2.5-7B-Instruct、GLM-4-9B 和 DeepSeek-V3 作为对比模型在自行构建的 500 张服装吊牌测试集上进行了实验。评估指标包括字段提取的精确率Precision、召回率Recall和F1 分数同时考量了响应速度与成本。模型平均精确率平均召回率平均 F1平均响应时间关键特点与场景适配分析Qwen2.5-7B94.2%92.8%93.5%约 1.2 秒综合性能均衡。对中文服装术语理解准确指令跟随能力强输出格式稳定。在面料成分、洗涤说明等复杂文本解析上表现优异。性价比高适合作为主力模型。GLM-4-9B92.5%93.1%92.8%约 1.5 秒召回率略优。在货号、尺码等明确字段的提取上非常稳健不易遗漏。但对一些非标准表述如“主料棉”的泛化能力稍弱。响应稍慢但稳定性好。DeepSeek-V395.1%91.5%93.3%约 0.8 秒速度与精确率领先。响应最快在字段明确、格式规范的吊牌上精确率最高。但对长文本、多行复杂描述的召回率相对波动需要更精细的 Prompt 引导。成本可能具有优势。适配差异总结追求高精度与稳定格式Qwen 是可靠选择。担心字段遗漏GLM 的召回表现值得考虑。对响应速度有极致要求DeepSeek 优势明显。处理极其复杂、非标吊牌可能需要结合 Qwen 的理解能力和更复杂的后处理逻辑。4. 实践代码示例以下是一个使用 Qwen API 进行单次提取的简化 Python 示例。importjsonimportrequestsfromtypingimportDict,Anydefextract_clothing_info_via_llm(ocr_text:str,api_key:str)-Dict[str,Any]: 使用 Qwen API 从吊牌 OCR 文本中提取关键信息。 # 构造系统提示词system_prompt你是一个服装信息提取专家。请从用户提供的服装吊牌文本中准确提取以下关键字段 - article_number (货号): 商品唯一编号通常是字母数字组合。 - product_name (品名): 服装名称。 - size (尺码): 如 S, M, L, 或 170/88A 等。 - material (面料成分): 如 棉 100% 或 聚酯纤维 80%, 棉 20%。 - washing_care (洗涤说明): 文本描述。 - brand (品牌): 品牌名称。 - price (价格): 数字可能带单位。 如果某个字段在文本中未找到则将其值设为 null。 请严格以 JSON 对象格式输出不要有任何额外的解释或标记。 # 用户输入为预处理后的 OCR 文本user_inputf请从以下文本中提取信息\n\n{ocr_text}\n# 调用 Qwen API (示例使用 DashScope)urlhttps://dashscope.aliyuncs.com/api/v1/services/aigc/text-generation/generationheaders{Authorization:fBearer{api_key},Content-Type:application/json}data{model:qwen2.5-7b-instruct,input:{messages:[{role:system,content:system_prompt},{role:user,content:user_input}]},parameters:{result_format:message# 确保返回纯文本消息}}try:responserequests.post(url,jsondata,headersheaders,timeout10)resultresponse.json()# 提取模型返回的文本内容llm_outputresult[output][choices][0][message][content]# 尝试从返回文本中解析 JSON# 有时模型会在 JSON 外加一层 Markdown 代码块或说明ifjsoninllm_output:json_strllm_output.split(json)[1].split()[0].strip()elifinllm_output:json_strllm_output.split()[1].strip()else:json_strllm_output.strip()extracted_infojson.loads(json_str)returnextracted_infoexcept(requests.exceptions.RequestException,KeyError,json.JSONDecodeError)ase:print(f提取失败:{e})# 返回一个包含空值的默认结构return{article_number:None,product_name:None,size:None,material:None,washing_care:None,brand:None,price:None}# 示例调用if__name____main__:# 模拟 OCR 识别结果sample_ocr_text 货号SW2456 品名男士经典牛津纺衬衫 尺码175/96A (XL) 面料成分棉 100% 洗涤说明最高洗涤温度40℃不可漂白悬挂晾干低温熨烫。 品牌简约风尚 零售价399 api_keyyour_qwen_api_key_here# 请替换为实际 API Keyinfoextract_clothing_info_via_llm(sample_ocr_text,api_key)print(提取的结构化信息)print(json.dumps(info,ensure_asciiFalse,indent2))5. 发展方向本文验证了利用 LLM 对服装吊牌 OCR 文本进行智能结构化提取的可行性。通过精心设计的 Prompt 工程Qwen、GLM、DeepSeek 等模型在该任务上均能达到 90% 以上的 F1 分数远超传统规则或简单正则匹配的方法显著减少了人工成本。未来优化方向领域微调Fine-tuning使用大量标注的吊牌数据对基础模型进行微调可进一步提升对专业术语和特殊格式的理解。多模态输入直接结合图像视觉特征与文本信息让模型“看到”吊牌版式有助于解决纯文本中的歧义如区分“品牌”和“制造商”。流水线优化将 LLM 提取与规则引擎、知识图谱相结合构建混合智能系统在保证准确性的同时控制成本。模型路由根据吊牌复杂程度、字段重要性动态选择最合适的模型如简单吊牌用快速模型复杂吊牌用高精度模型。随着模型性能的持续提升与成本的下降LLM 驱动的智能信息提取将成为服装乃至整个零售行业数字化升级的关键技术组件。