
做诗词号、文案号、知识类内容的,最头疼的不是没灵感,是手边没有一个能随时翻、能随时检索的诗词库。百度搜一句诗,出来的页面广告一堆,复制还带一堆格式;买本诗集,想找”月亮”或者”离别”这类主题又得一页页翻。这个包就是把这些麻烦一次解决掉。
9 万多条诗词,全是结构化数据
里面一共 91,345 条正文,覆盖全唐诗 57,607 首、宋词 21,053 首、元曲 11,057 首,另外还有诗经、楚辞、论语、大学中庸孟子这些先秦经典,以及纳兰性德诗集、曹操诗集、花间集、幽梦影、水墨唐诗和十三种蒙学读本。所有内容都是 JSON 格式,直接就能被程序读取,不用再做清洗和切分。
不是 txt 拼凑,每条都有完整字段
和网上随便下载的诗集文本不一样,这里每一条都是结构化对象,有标题、有作者、有朝代、有正文段落,用程序读出来就能直接入数据库。做检索工具的话,按作者建索引、按正文做全文搜索都很顺,不用再写一堆正则去从长文本里抠字段。宋词和元曲会多出词牌、曲牌这类字段,同样是标准 JSON。
这几种用法最直接
做小程序或者诗词类应用,把 JSON 导进数据库,按作者和关键词检索,几天就能搭出一个能用的诗词查询工具。做内容号的话,写个脚本按作者或者意象批量拉诗句,一天就能攒出一批选题,比翻书快得多。想练数据处理的,这个体量刚好够练 SQL 分组统计和词频分析,比用随机造的测试数据有意思。
拿来就能用,不用装环境
包里的目录已经按”全唐诗、宋词、元曲、诗经、楚辞、论语、四书五经、蒙学经典、五代诗词、纳兰性德、曹操诗集、幽梦影、水墨唐诗”分好类,每一类下面就是对应的数据文件。不需要装任何软件,记事本能打开,Excel 和 Python 也能直接读,压缩包解压出来就能看到全部内容。
资源基于开源项目 chinese-poetry 整理,MIT 协议,允许免费商用、修改和再分发,包里附了完整协议原文。所有诗词原文都属于公有领域文献,本身没有版权限制,做成工具、做成内容、二次开发都不会有授权问题。






















暂无评论内容