1998-2025年上市公司数据资产化词频统计面板数据

📅 2026/8/27 16:41:59
1998-2025年上市公司数据资产化词频统计面板数据
在数字经济时代数据资产已经取代传统要素成为企业构筑并维持核心竞争力的战略性资源。然而数据资产并未直接体现在财务报表的资产科目中如何对企业的数据资产化水平进行量化一直是实证研究面临的难题。本文介绍的数据集采用文本分析法回答了这一问题以《中国工业经济》何瑛2024的研究设计为基础构建“数据资产”文本词典从上市公司年报中提取关键词用词频高低来刻画企业数据资产化的程度。具体做法上研究团队以“信息”“网络”“数字”“数据”四个词作为种子词汇通过构建相似词词集的方式向外扩展最终在年报文本中识别并统计出221个数据资产相关词频。再按照数据资产的具体用途差异将指标进一步区分为自用型数据资产企业内部开发利用与交易型数据资产对外流通交易两大类。该指标体系从企业文本披露的视角反映了企业对数据资源开发利用、数据资产管理以及数据要素价值实现的重视程度可为考察数据资产化对企业创新、全要素生产率、企业价值、融资约束及高质量发展的影响提供微观量化基础。一、数据集基本信息二、数据整理流程整个面板数据的构建过程可以概括为以下几个环节• 搜集1998—2025年全部上市公司年报将非结构化的报告文本整理为面板数据• 统计年报全文的文本长度并分别统计其中中文部分与英文部分的长度• 构建数字化术语词典并将扩充词汇导入Python的jieba分词库• 去除停用词后逐一统计各明细词汇的出现数目• 加总得到数据资产化词频总和同时保留各明细词频形成最终的指标体系。三、指标体系构成除股票代码、公司简称、年报标题、年份、行业名称、行业代码等基础识别变量以及全文文本总长度、仅中英文文本总长度等控制变量外数据集还包含数据资产总词频、数据资产词频加1取对数、自用型数据资产总词频、交易型数据资产总词频四个汇总指标。221个明细词频指标按种子词归类整理如下四、数据概览从时间维度看披露数据资产相关词汇的企业数量逐年递增词频均值亦呈上升态势直观反映出上市公司数据资产化意识的持续增强。数据集同时提供Excel版本与Stata版本两种格式便于不同软件环境的用户直接调用数据资产化—历年企业数目数据资产化—历年企业数目上市公司数据资产化词频统计数据Excel版本上市公司数据资产化词频统计数据Excel版本上市公司数据资产化词频统计数据Stata版本上市公司数据资产化词频统计数据Stata版本五、使用建议•变量构造实证中通常采用“数据资产词频加1取对数”作为核心解释变量该变量已预先计算好可直接使用•稳健性检验可分别以自用型、交易型数据资产词频替换总词频进行回归或以文本总长度对词频进行标准化处理缓解“长文本天然词频高”的偏误•匹配扩展面板按股票代码-年份组织可与CSMAR、Wind等数据库中的财务指标、创新专利数据直接合并•研究场景适合考察数据资产化与企业融资约束缓解专精特新中小企业、企业价值重估、数字化转型绩效等议题。引用格式[1]何瑛,陈丽丽,杜亚光.数据资产化能否缓解“专精特新”中小企业融资约束[J].中国工业经济,2024,(08):154-173.顶部专栏分享更多内容专栏合集经管社科数据集合与整理来源 Paper 数据分析