研究数据高级数据
年报词频统计分析软件
数据摘要
包含“指定词频分析”和“词频总量分析”两套Windows工具,可批量统计自定义关键词及文本字符总量,输出Excel结果。附使用说明、示例、Stata结果整理代码、参考Python代码和2000—2022年报TXT资料包。
基本信息
| 数据频率 | 按输入文本批量统计 |
|---|---|
| 年份范围 | 软件工具;附2000-2022年报文本 |
| 观测层级 | 单个 TXT 文件 |
| 当前预览样本量 | 2 套工具;附53,605个年报TXT文件(含2个空文件) |
| 文件格式 | Windows 软件 / TXT / Excel / Stata / Python |
| 文件包大小 | 5.98 GiB(四个ZIP合计) |
| 包含内容 | Windows工具、PDF说明、示例TXT、Excel/Stata示例、Stata整理代码、参考Python代码、年报TXT |
| 所属分类 |
测算方法
1. 解压并完整保留程序目录。包内提供Windows .exe程序,未提供macOS原生版本;使用前可先用配套示例核验运行环境与统计口径。
2. 指定词频分析:将待分析TXT放入input_txt目录,在待统计字词.xls中从第2行起录入关键词,选择与文件一致的编码,依次加载文本、加载词表并执行批量统计。
3. 词频总量分析:将TXT放入input_txt,加载导入文件后执行批量统计,运行结束生成Excel结果。字符总数与关键词出现次数属于不同统计口径,不能混用。
4. 按包内说明,将结果表复制到新的Excel表并使用“仅数值”粘贴,再按实际路径和字段修改附带Stata整理代码。文件名中的披露年份与报告年份可能不同,整理时需核对。
5. 附2000—2022年报TXT压缩包,内含53,605个TXT文件,其中2个为空文件;附Python年报代码仅供参考,未承诺当前接口可直接运行。
6. 四个ZIP包合计约5.98 GiB,附带年报TXT解压后约24.31 GiB。软件适配和输出效果需先用少量实际文本验证。
以下字段、样本量及样本仅对应当前展示的数据表,不代表资料包全部文件。查看文件结构
字段列表共 7 个字段
| 字段 | 含义 / 说明 | 类型 |
|---|---|---|
关键词统计列 | 自定义词表统计结果 · 由待统计字词.xls中录入的词表决定 | 数值 |
字符总数 | 全文字符数量 · 见词频总量结果示例 | 数值 |
中文字符 | 中文字符数量 · 见词频总量结果示例 | 数值 |
英文字符 | 英文字符数量 · 见词频总量结果示例 | 数值 |
数字字符 | 数字字符数量 · 见词频总量结果示例 | 数值 |
其他字符 | 其他字符数量 · 见词频总量结果示例 | 数值 |
证券代码、年份 | 整理后的匹配信息 · 需按实际文件名修改整理规则 | 文本/年度 |
