研究数据高级数据

年报词频统计分析软件

覆盖年份 软件工具;附2000-2022年报文本数据格式 Windows 软件 / TXT / Excel / Stata / Python更新日期

数据摘要

包含“指定词频分析”和“词频总量分析”两套Windows工具,可批量统计自定义关键词及文本字符总量,输出Excel结果。附使用说明、示例、Stata结果整理代码、参考Python代码和2000—2022年报TXT资料包。

基本信息

数据频率按输入文本批量统计
年份范围软件工具;附2000-2022年报文本
观测层级单个 TXT 文件
当前预览样本量2 套工具;附53,605个年报TXT文件(含2个空文件)
文件格式Windows 软件 / TXT / Excel / Stata / Python
文件包大小5.98 GiB(四个ZIP合计)
包含内容Windows工具、PDF说明、示例TXT、Excel/Stata示例、Stata整理代码、参考Python代码、年报TXT
所属分类

测算方法

1. 解压并完整保留程序目录。包内提供Windows .exe程序,未提供macOS原生版本;使用前可先用配套示例核验运行环境与统计口径。 2. 指定词频分析:将待分析TXT放入input_txt目录,在待统计字词.xls中从第2行起录入关键词,选择与文件一致的编码,依次加载文本、加载词表并执行批量统计。 3. 词频总量分析:将TXT放入input_txt,加载导入文件后执行批量统计,运行结束生成Excel结果。字符总数与关键词出现次数属于不同统计口径,不能混用。 4. 按包内说明,将结果表复制到新的Excel表并使用“仅数值”粘贴,再按实际路径和字段修改附带Stata整理代码。文件名中的披露年份与报告年份可能不同,整理时需核对。 5. 附2000—2022年报TXT压缩包,内含53,605个TXT文件,其中2个为空文件;附Python年报代码仅供参考,未承诺当前接口可直接运行。 6. 四个ZIP包合计约5.98 GiB,附带年报TXT解压后约24.31 GiB。软件适配和输出效果需先用少量实际文本验证。

以下字段、样本量及样本仅对应当前展示的数据表,不代表资料包全部文件。查看文件结构

字段列表共 7 个字段

字段含义 / 说明类型
关键词统计列自定义词表统计结果 · 由待统计字词.xls中录入的词表决定数值
字符总数全文字符数量 · 见词频总量结果示例数值
中文字符中文字符数量 · 见词频总量结果示例数值
英文字符英文字符数量 · 见词频总量结果示例数值
数字字符数字字符数量 · 见词频总量结果示例数值
其他字符其他字符数量 · 见词频总量结果示例数值
证券代码、年份整理后的匹配信息 · 需按实际文件名修改整理规则文本/年度