面向文本研究的本地桌面工具:从 Excel 或电子书导入文本,完成预处理、词频、情感、主题与网络分析,并导出图表、结果表和研究报告。
使用 Python + PySide6,当前应用版本为 2.0.0。
- 项目工作台:创建和打开项目,保存输入数据、分析结果与运行记录。
- 数据导入与预处理:Excel 工作表和字段映射,中文、英文、俄文等文本预处理,自定义停用词和分词词典。
- 词频分析:高频词、词云和二元词组;支持直接读取 TXT、Markdown、EPUB 和 PDF 电子书。
- 情感分析:SnowNLP、VADER 等方法;支持配置本地分类模型及可选情感词典。
- 主题分析:LDA 主题模型、主题数对比和交互式主题可视化。
- 网络与舆情分析:词项共现、网络指标、聚类、分类和舆情分析。
- 结果与报告:统一查看历史结果,导出 Excel、CSV、图表、HTML 和 Word 报告。
- Windows 10 / 11。
- Python 3.10–3.12;依赖兼容性以所安装的第三方包为准。
- 首次安装需要联网下载依赖;部分模型功能还需自行准备模型。
下载源码并解压,双击 一键运行.bat。
脚本会查找 Python、创建 .venv、检查并安装依赖,再打开桌面窗口。若提示未找到 Python,请先安装 Python 并添加到 PATH。
在源码根目录打开 PowerShell:
python -m venv .venv
.\.venv\Scripts\python.exe -m pip install --upgrade pip
.\.venv\Scripts\python.exe -m pip install -r requirements.txt
.\.venv\Scripts\python.exe main.py项目可以放在任意有写入权限的目录,无需原开发电脑的盘符或文件夹。
- 在“项目工作台”创建项目并选择保存目录。
- 在“首页 / 数据导入”选择 Excel,确认工作表与文本列。
- 选择“词频分析与词云图”等分析模块,设置参数后运行。
- 在“结果中心”和“报告中心”查看、导出结果。
如需快速试用,可在词频页面选择“直接分析电子书”,打开 examples/demo_text.txt。该文件是虚构演示文本,适合检查导入和分词,不适合验证情感分类质量或训练主题模型。
源码包不附带预训练模型和大型第三方词典。基本词频分析及不依赖外部词典的方法可按上述步骤使用。
- DUTIR / 大连理工情感词典、HowNet 方法需要自行提供相应文件,见 情感词典配置。
- BERT、Transformer、ERNIE 等方法需要额外的推理后端和适配任务的模型,请在设置中心配置本地路径。
- 英文 NLP 的部分方法需要 NLTK 等工具的数据资源;缺失时按界面提示安装。
分析结果取决于文本、方法和参数。模型分数与自动推荐结果应结合研究任务核验。
app/ 桌面界面、分析逻辑、项目管理和报告导出
assets/ 停用词与词典模板
examples/ 虚构演示文本
tests/ 窗口启动、项目管理、报告导出测试
scripts/ PyInstaller 打包脚本
installer/ Inno Setup 安装脚本
main.py 程序入口
安装依赖后,在源码根目录执行:
.\.venv\Scripts\python.exe -m pytest -q当前自动化测试覆盖窗口启动、项目创建/打开和 Word/Excel 报告导出,不代表所有算法和可选模型都已验证。
在源码根目录执行:
powershell -ExecutionPolicy Bypass -File scripts\build_pyinstaller.ps1输出位于 dist/ResearchAnalyse/。installer/Analyse.iss 可用于进一步制作安装程序。源码整理检查不包含新电脑安装或 EXE 安装包验收。
本目录是单独整理的源码发布副本,包含 .gitignore;个人研究数据、分析结果、虚拟环境、第三方仓库副本和旧成品包均不在源码包内。
依赖与可选资源说明见 THIRD_PARTY_NOTICES.md。本副本尚未指定开源许可证,维护者可在确定授权方式后添加 LICENSE。