网易首页 > 网易号 > 正文 申请入驻

用Python来理一理红楼梦里的那些关系

0
分享至

教程、案例源码、学习资料、读者群

请访问:python666.cn

大家好,欢迎来到 Crossin的编程教室 !

今天,我们一起用 Python 来理一理红楼梦里的那些关系。

不要问我为啥是红楼梦,而不是水浒三国或西游,因为我也坚定地认为,红楼才是无可争议的中国古典小说只巅峰,且不接受反驳!而红楼梦也是我多次反复品读的为数不多的小说,对它的感情也是最深的。

好了,不酸了,开干。

数据准备

  1. 红楼梦 TXT 文件一份

  2. 金陵十二钗 + 贾宝玉 人物名称列表


人物列表内容如下:

宝玉 nr
黛玉 nr
宝钗 nr
湘云 nr
凤姐 nr
李纨 nr
元春 nr
迎春 nr
探春 nr
惜春 nr
妙玉 nr
巧姐 nr
秦氏 nr

这份列表,同时也是为了做分词时使用,后面的 nr 就是人名的意思。

数据处理 读取数据并加载词典with open("红楼梦.txt", encoding='gb18030') as f:
honglou = f.readlines()
jieba.load_userdict("renwu_forcut")
renwu_data = pd.read_csv("renwu_forcut", header=-1)
mylist = [k[0].split(" ")[0] for k in renwu_data.values.tolist()]

这样,我们就把红楼梦读取到了 honglou 这个变量当中,同时也通过 load_userdict 将我们自定义的词典加载到了 jieba 库中。

对文本进行分词处理并提取tmpNames = []
names = {}
relationships = {}
for h in honglou:
h.replace("贾妃", "元春")
h.replace("李宫裁", "李纨")
poss = pseg.cut(h)
tmpNames.append([])
for w in poss:
if w.flag != 'nr' or len(w.word) != 2 or w.word not in mylist:
continue
tmpNames[-1].append(w.word)
if names.get(w.word) is None:
names[w.word] = 0
relationships[w.word] = {}
names[w.word] += 1

  • 首先,因为文中"贾妃", "元春","李宫裁", "李纨" 混用严重,所以这里直接做替换处理。

  • 然后使用 jieba 库提供的 pseg 工具来做分词处理,会返回每个分词的词性。

  • 之后做判断,只有符合要求且在我们提供的字典列表里的分词,才会保留。

  • 一个人每出现一次,就会增加一,方便后面画关系图时,人物 node 大小的确定。

  • 对于存在于我们自定义词典的人名,保存到一个临时变量当中 tmpNames。

处理人物关系for name in tmpNames:
for name1 in name:
for name2 in name:
if name1 == name2:
continue
if relationships[name1].get(name2) is None:
relationships[name1][name2] = 1
else:
relationships[name1][name2] += 1

对于出现在同一个段落中的人物,我们认为他们是关系紧密的,每同时出现一次,关系增加1.

保存到文件with open("relationship.csv", "w", encoding='utf-8') as f:
f.write("Source,Target,Weight\n")
for name, edges in relationships.items():
for v, w in edges.items():
f.write(name + "," + v + "," + str(w) + "\n")

with open("NameNode.csv", "w", encoding='utf-8') as f:
f.write("ID,Label,Weight\n")
for name, times in names.items():
f.write(name + "," + name + "," + str(times) + "\n")

  • 文件1:人物关系表,包含首先出现的人物、之后出现的人物和一同出现次数

  • 文件2:人物比重表,包含该人物总体出现次数,出现次数越多,认为所占比重越大。

制作关系图表

使用 pyecharts 作图

def deal_graph():
relationship_data = pd.read_csv('relationship.csv')
namenode_data = pd.read_csv('NameNode.csv')
relationship_data_list = relationship_data.values.tolist()
namenode_data_list = namenode_data.values.tolist()

nodes = []
for node in namenode_data_list:
if node[0] == "宝玉":
node[2] = node[2]/3
nodes.append({"name": node[0], "symbolSize": node[2]/30})
links = []
for link in relationship_data_list:
links.append({"source": link[0], "target": link[1], "value": link[2]})

g = (
Graph()
.add("", nodes, links, repulsion=8000)
.set_global_opts(title_opts=opts.TitleOpts(title="红楼人物关系"))
)
return g

  • 首先把两个文件读取成列表形式

  • 对于“宝玉”,由于其占比过大,如果统一进行缩放,会导致其他人物的 node 过小,展示不美观,所以这里先做了一次缩放

最后得出的关系图

所有代码已经上传至 Github:
https://github.com/zhouwei713/data_analysis/tree/master/honglou
最后,我还准备了一份更加全面的红楼人物字典,可以在代码仓库中找到-“renwu_total”,感兴趣的小伙伴也可以尝试下,制作一个全人物的关系图。

作者:萝卜大杂烩

来源:萝卜大杂烩

Crossin的第2本书 《码上行动:利用Python与ChatGPT高效搞定Excel数据分析》 已经上市了 。

本书从 Python 和 Excel 结合使用的角度讲解处理分析数据的思路、方法与实战应用。不论是希望从事数据分析岗位的学习者,还是其他职业的办公人员,都可以通过本书的学习掌握 Python 分析数据的技能。书中创新性地将 ChatGPT 引入到教学当中,用 ChatGPT 答疑并提供实训代码,并介绍了使用 ChatGPT 辅助学习的一些实用技巧,给学习者带来全新的学习方式。

公众号的读者朋友们购买后可在后台联系我,加入读者交流群,Crossin会为你开启陪读模式,解答你在阅读本书时的一切疑问。

感谢转发点赞的各位~

如需了解付费精品课程教学答疑服务

请在Crossin的编程教室内回复:666

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
黄一鸣怀孕照曝光,王思聪曾带她买婴儿用品,后反悔要求打掉孩子

黄一鸣怀孕照曝光,王思聪曾带她买婴儿用品,后反悔要求打掉孩子

辣条小剧场
2024-06-14 23:49:28
广西超越四川成为第一,艾滋病川渝重灾区,切记不要随便找小姐!

广西超越四川成为第一,艾滋病川渝重灾区,切记不要随便找小姐!

滑稽斑马呀
2024-06-14 15:45:50
C罗抵达德国,西装杀太帅!率葡萄牙全队亮相,有主教练风范了

C罗抵达德国,西装杀太帅!率葡萄牙全队亮相,有主教练风范了

梦与体育
2024-06-14 10:07:29
“今年真不好报”,张雪峰透露报考变化:生物被抛弃,工科变化大

“今年真不好报”,张雪峰透露报考变化:生物被抛弃,工科变化大

熙熙说教
2024-06-14 15:29:17
笑了!怀斯曼5年2亿顶薪大合同?这可是勇士的建队核心……

笑了!怀斯曼5年2亿顶薪大合同?这可是勇士的建队核心……

篮球实战宝典
2024-06-14 15:07:22
中石化“巨贪”:寒门出身,造成207亿巨大亏损,曾让弟弟帮忙背锅

中石化“巨贪”:寒门出身,造成207亿巨大亏损,曾让弟弟帮忙背锅

天闻地知
2024-06-14 14:08:36
一个月涨价近20%!深圳这10个小区成交价悄悄上涨,领头的竟是……

一个月涨价近20%!深圳这10个小区成交价悄悄上涨,领头的竟是……

深圳买房计划
2024-06-14 22:07:24
拿不到冠军游回南京,比基尼美女领鼓输了跪祠堂,真正的贵族运动

拿不到冠军游回南京,比基尼美女领鼓输了跪祠堂,真正的贵族运动

数字视线
2024-06-13 10:46:29
高考结束家长拆了放在孩子卧室6年的监控,网友:满满的窒息感,专家:培养自信更重要

高考结束家长拆了放在孩子卧室6年的监控,网友:满满的窒息感,专家:培养自信更重要

极目新闻
2024-06-14 10:52:19
相当炸裂!18岁女生高考完就订婚,网友:不等成绩出来再考虑?

相当炸裂!18岁女生高考完就订婚,网友:不等成绩出来再考虑?

四象八卦
2024-06-14 18:19:44
赵丽颖古早黑历史曝光,惊人往事让人不敢相信,疑似没文化还当三

赵丽颖古早黑历史曝光,惊人往事让人不敢相信,疑似没文化还当三

花哥扒娱乐
2024-04-18 22:17:33
昆明“大器史局长”婚内出轨!小三:床上,他带我去天堂!

昆明“大器史局长”婚内出轨!小三:床上,他带我去天堂!

文刀万
2024-04-09 10:58:09
45岁女子白天与50岁情人上床,晚上与52岁情人上床,索要20万被杀

45岁女子白天与50岁情人上床,晚上与52岁情人上床,索要20万被杀

胖胖侃咖
2024-04-26 08:00:09
玫瑰的故事:刚刚发生关系白晓荷就求复合!黄振华最终选择苏更生

玫瑰的故事:刚刚发生关系白晓荷就求复合!黄振华最终选择苏更生

露珠聊影视
2024-06-14 12:31:59
世联赛最新积分榜,中国女排反超奥运冠军,淘汰赛有可能碰巴西

世联赛最新积分榜,中国女排反超奥运冠军,淘汰赛有可能碰巴西

极度说球
2024-06-15 00:39:21
下半年,财神点名,迎来事业和财运大丰收的三星座

下半年,财神点名,迎来事业和财运大丰收的三星座

小晴星座说
2024-06-14 17:40:36
日本最强顶级预言家,2024最新预言公开!这天台湾将发生翻天巨变

日本最强顶级预言家,2024最新预言公开!这天台湾将发生翻天巨变

小哥很OK
2024-06-12 11:37:53
普京表示:不攻击北约、不使用核武并愿意谈判!难道要服软了?

普京表示:不攻击北约、不使用核武并愿意谈判!难道要服软了?

翻开历史和现实
2024-06-13 22:56:43
不达目的不罢休!前有运营不佳的安六高铁,现贵州又建设盘兴高铁

不达目的不罢休!前有运营不佳的安六高铁,现贵州又建设盘兴高铁

普陀动物世界
2024-06-14 23:05:51
“槟榔之乡”万宁:八成槟榔树染病,产业也快“黄”了

“槟榔之乡”万宁:八成槟榔树染病,产业也快“黄”了

第一财经资讯
2024-06-13 21:17:10
2024-06-15 07:46:44
Crossin的编程教室
Crossin的编程教室
简单有趣的python入门
390文章数 702关注度
往期回顾 全部

科技要闻

马斯克重获信任 豪言特斯拉市值超10个苹果

头条要闻

17岁"天才少女"火了 有高校欢迎其报考:硕士再去浙大

头条要闻

17岁"天才少女"火了 有高校欢迎其报考:硕士再去浙大

体育要闻

我们为什么还爱欧洲杯?

娱乐要闻

江宏杰秀儿女刺青,不怕刺激福原爱?

财经要闻

“石油美元”协议走向终结 影响几何?

汽车要闻

提供100/240kW双电机版本车型 乐道L60实车曝光

态度原创

教育
亲子
家居
数码
公开课

教育要闻

中专老师王闰秋全力帮助姜萍参加竞赛,想帮孩子过上另一种人生 一个不太得志的数学研究生,回到家乡的普通...

亲子要闻

孩子成长期千万别忽视!脊柱侧弯可能致孩子焦虑,骨科专家教您一个动作 帮孩子自测,“多关注孩子 早发现...

家居要闻

空谷来音 朴素留白的侘寂之美

数码要闻

台电预热 11 英寸平板电脑新品:90Hz 高刷、联发科 G99 处理器

公开课

近视只是视力差?小心并发症

无障碍浏览 进入关怀版