网易首页 > 网易号 > 正文 申请入驻

如果有一千万数据,怎么用Java快速查询?

0
分享至


前言

  • 面试官:来说说,一千万的数据,你是怎么查询的?

  • B哥:直接分页查询,使用limit分页。

  • 面试官:有实操过吗?

  • B哥:肯定有呀

此刻献上一首《凉凉》

也许有些人没遇过上千万数据量的表,也不清楚查询上千万数据量的时候会发生什么。

今天就来带大家实操一下,这次是基于mysql 5.7.26做测试


准备数据

没有一千万的数据怎么办?

创建呗

代码创建一千万?那是不可能的,太慢了,可能真的要跑一天。可以采用数据库脚本执行速度快很多。


创建表

CREATE TABLE `user_operation_log` (
`id` int(11) NOT AUTO_INCREMENT,
`user_id` varchar(64) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`ip` varchar(20) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`op_data` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr1` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr2` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr3` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr4` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr5` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr6` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr7` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr8` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr9` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr10` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr11` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
`attr12` varchar(255) CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci DEFAULT ,
PRIMARY KEY (`id`) USING BTREE
) ENGINE = InnoDB AUTO_INCREMENT = 1 CHARACTER SET = utf8mb4 COLLATE = utf8mb4_general_ci ROW_FORMAT = Dynamic;

创建数据脚本

采用批量插入,效率会快很多,而且每1000条数就commit,数据量太大,也会导致批量插入效率慢

DELIMITER ;;
CREATE PROCEDURE batch_insert_log
BEGIN
DECLARE i INT DEFAULT 1;
DECLARE userId INT DEFAULT 10000000;
set@execsql = 'INSERT INTO `test`.`user_operation_log`(`user_id`, `ip`, `op_data`, `attr1`, `attr2`, `attr3`, `attr4`, `attr5`, `attr6`, `attr7`, `attr8`, `attr9`, `attr10`, `attr11`, `attr12`) VALUES';
set@execData = '';
WHILE i
set@attr = "'测试很长很长很长很长很长很长很长很长很长很长很长很长很长很长很长很长很长的属性'";
set@execData = concat(@execData, "(", userId + i, ", '10.0.69.175', '用户登录操作'", ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ",", @attr, ")");
ifi % 1000 = 0
then
set@stmtSql = concat(@execSql, @execData,";");
prepare stmt from @stmtSql;
execute stmt;
DEALLOCATE prepare stmt;
commit;
set@execData = "";
else
set@execData = concat(@execData, ",");
endif;
SET i=i+1;
END WHILE;


END;;
DELIMITER ;

开始测试

哥的电脑配置比较低:win10 标压渣渣i5 读写约500MB的SSD

由于配置低,本次测试只准备了3148000条数据,占用了磁盘5G(还没建索引的情况下),跑了38min,电脑配置好的同学,可以插入多点数据测试

SELECT count(1) FROM `user_operation_log`

返回结果:3148000

三次查询时间分别为:

  • 14060 ms

  • 13755 ms

  • 13447 ms


普通分页查询

MySQL 支持 LIMIT 语句来选取指定的条数数据, Oracle 可以使用 ROWNUM 来选取。

MySQL分页查询语法如下:

SELECT * FROM table LIMIT [offset,] rows | rows OFFSET offset
  • 第一个参数指定第一个返回记录行的偏移量

  • 第二个参数指定返回记录行的最大数目

下面我们开始测试查询结果:

SELECT * FROM `user_operation_log` LIMIT 10000, 10

查询3次时间分别为:

  • 59 ms

  • 49 ms

  • 50 ms

这样看起来速度还行,不过是本地数据库,速度自然快点。

换个角度来测试


相同偏移量,不同数据量

SELECT * FROM `user_operation_log` LIMIT 10000, 10
SELECT * FROM `user_operation_log` LIMIT 10000, 100
SELECT * FROM `user_operation_log` LIMIT 10000, 1000
SELECT * FROM `user_operation_log` LIMIT 10000, 10000
SELECT * FROM `user_operation_log` LIMIT 10000, 100000
SELECT * FROM `user_operation_log` LIMIT 10000, 1000000

查询时间如下:



图片

从上面结果可以得出结束:数据量越大,花费时间越长


相同数据量,不同偏移量

SELECT * FROM `user_operation_log` LIMIT 100, 100
SELECT * FROM `user_operation_log` LIMIT 1000, 100
SELECT * FROM `user_operation_log` LIMIT 10000, 100
SELECT * FROM `user_operation_log` LIMIT 100000, 100
SELECT * FROM `user_operation_log` LIMIT 1000000, 100

图片

从上面结果可以得出结束:偏移量越大,花费时间越长

SELECT * FROM `user_operation_log` LIMIT 100, 100
SELECT id, attr FROM `user_operation_log` LIMIT 100, 100

如何优化

既然我们经过上面一番的折腾,也得出了结论,针对上面两个问题:偏移大、数据量大,我们分别着手优化


优化偏移量大问题 采用子查询方式

我们可以先定位偏移位置的 id,然后再查询数据

SELECT * FROM `user_operation_log` LIMIT 1000000, 10SELECT id FROM `user_operation_log` LIMIT 1000000, 1SELECT * FROM `user_operation_log` WHERE id >= (SELECT id FROM `user_operation_log` LIMIT 1000000, 1) LIMIT 10

查询结果如下:


从上面结果得出结论:

  • 第一条花费的时间最大,第三条比第一条稍微好点

  • 子查询使用索引速度更快

缺点:只适用于id递增的情况

id非递增的情况可以使用以下写法,但这种缺点是分页查询只能放在子查询里面

注意:某些 mysql 版本不支持在 in 子句中使用 limit,所以采用了多个嵌套select

SELECT * FROM `user_operation_log` WHERE id IN (SELECT t.id FROM (SELECT id FROM `user_operation_log` LIMIT 1000000, 10) AS t)

采用 id 限定方式

这种方法要求更高些,id必须是连续递增,而且还得计算id的范围,然后使用 between,sql如下

SELECT * FROM `user_operation_log` WHERE id between 1000000 AND 1000100 LIMIT 100


SELECT * FROM `user_operation_log` WHERE id >= 1000000 LIMIT 100

查询结果如下:


图片

从结果可以看出这种方式非常快

注意:这里的 LIMIT 是限制了条数,没有采用偏移量


优化数据量大问题

返回结果的数据量也会直接影响速度

SELECT * FROM `user_operation_log` LIMIT 1, 1000000

SELECT id FROM `user_operation_log` LIMIT 1, 1000000

SELECT id, user_id, ip, op_data, attr1, attr2, attr3, attr4, attr5, attr6, attr7, attr8, attr9, attr10, attr11, attr12 FROM `user_operation_log` LIMIT 1, 1000000

查询结果如下:


图片

从结果可以看出减少不需要的列,查询效率也可以得到明显提升

第一条和第三条查询速度差不多,这时候你肯定会吐槽,那我还写那么多字段干啥呢,直接 * 不就完事了

注意本人的 MySQL 服务器和客户端是在_同一台机器_上,所以查询数据相差不多,有条件的同学可以测测客户端与MySQL分开


SELECT * 它不香吗?

在这里顺便补充一下为什么要禁止 SELECT * 。难道简单无脑,它不香吗?

主要两点:

  • 用 "SELECT * " 数据库需要解析更多的对象、字段、权限、属性等相关内容,在 SQL 语句复杂,硬解析较多的情况下,会对数据库造成沉重的负担。

  • 增大网络开销,* 有时会误带上如log、IconMD5之类的无用且大文本字段,数据传输size会几何增涨。特别是MySQL和应用程序不在同一台机器,这种开销非常明显。


结束

最后还是希望大家自己去实操一下,肯定还可以收获更多,欢迎留言!!

创建脚本我给你正好了,你还在等什么!!!

链接: https://juejin.cn/post/6863668253898735629

(版权归原作者所有,侵删)

- EOF -

点击标题可跳转

看完本文有收获?请转发分享给更多人

关注「Java后端编程」,提升Java技能

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
独家 | 中国保利集团一把手就位

独家 | 中国保利集团一把手就位

大嘴説
2026-01-20 10:00:05
硬核警告!敢给台海送军火?直接“没收”。天降帮手,操作太顶了

硬核警告!敢给台海送军火?直接“没收”。天降帮手,操作太顶了

阿凫爱吐槽
2026-01-20 06:36:27
一个残忍预感:将来50后60后不在了,恐怕三代人的祭祖方式全变了

一个残忍预感:将来50后60后不在了,恐怕三代人的祭祖方式全变了

三农雷哥
2026-01-12 19:04:47
小宵虎南,三宫椿,白釈迦遺,川越仁子,樱空桃 日本美女明星动态

小宵虎南,三宫椿,白釈迦遺,川越仁子,樱空桃 日本美女明星动态

鹿鹿156
2026-01-09 09:47:05
追梦:文班有天赋成为NBA的门面,但他的欧洲国籍成为了阻碍

追梦:文班有天赋成为NBA的门面,但他的欧洲国籍成为了阻碍

懂球帝
2026-01-20 11:58:10
经纪人不再容忍,公开梁小龙去世真相!港媒吃人血馒头,网友炸锅

经纪人不再容忍,公开梁小龙去世真相!港媒吃人血馒头,网友炸锅

娱说瑜悦
2026-01-19 16:50:34
南京启动扫雪防冻Ⅱ级响应,累计出动人员4.1万余人次

南京启动扫雪防冻Ⅱ级响应,累计出动人员4.1万余人次

现代快报
2026-01-20 10:05:08
6000亿电白扔戈壁!国家砸4万亿救场,新能源终于不浪费了

6000亿电白扔戈壁!国家砸4万亿救场,新能源终于不浪费了

涵豆说娱
2026-01-20 13:49:41
高峰也没想到,他当年抛弃的儿子,如今开始给那英争光了

高峰也没想到,他当年抛弃的儿子,如今开始给那英争光了

趣文说娱
2026-01-04 16:34:24
央视都夸,看完《镖人》预告,我想说:武侠片的门要被吴京踹开了

央视都夸,看完《镖人》预告,我想说:武侠片的门要被吴京踹开了

八卦南风
2026-01-19 14:25:20
曼联2-0曼城:还记得赛季第一轮的曼联吗?

曼联2-0曼城:还记得赛季第一轮的曼联吗?

写球的牧子
2026-01-20 11:29:40
英王室风云再起,威廉隐忍多年就为这一刻,卡米拉是真的慌了!

英王室风云再起,威廉隐忍多年就为这一刻,卡米拉是真的慌了!

花小猫的美食日常
2026-01-20 10:30:25
纪实:南京杀妻案吉星鹏被判处死刑,临刑前全身抽搐流泪不止

纪实:南京杀妻案吉星鹏被判处死刑,临刑前全身抽搐流泪不止

谈史论天地
2026-01-14 12:55:03
方硕被交易?1换2方案曝光,下家3选1,豪门或出手

方硕被交易?1换2方案曝光,下家3选1,豪门或出手

乐聊球
2026-01-19 10:17:33
劳动性所得统一征税!国家新明确:未来五年,税收将迎来8大变化

劳动性所得统一征税!国家新明确:未来五年,税收将迎来8大变化

学税
2024-07-23 15:25:30
连夜送医,曾凡博伤情曝光,表情痛苦,已经肿胀,或正式退出

连夜送医,曾凡博伤情曝光,表情痛苦,已经肿胀,或正式退出

乐聊球
2026-01-19 09:33:02
意大利拒绝派兵格陵兰:左疯的国际笑话被戳穿

意大利拒绝派兵格陵兰:左疯的国际笑话被戳穿

斌闻天下
2026-01-20 07:10:03
快船110-106奇才!无解的不是6连胜,是哈登赛后表态,一点成关键

快船110-106奇才!无解的不是6连胜,是哈登赛后表态,一点成关键

鱼崖大话篮球
2026-01-20 08:12:08
父亲再婚后,没给过抚养费,42岁我买房,银行来信:您名下还有个账户

父亲再婚后,没给过抚养费,42岁我买房,银行来信:您名下还有个账户

黄家湖的忧伤
2025-12-24 16:43:36
2月财气冲天,3生肖迎贵人旺财运,多吉多利

2月财气冲天,3生肖迎贵人旺财运,多吉多利

人閒情事
2026-01-20 12:58:44
2026-01-20 14:27:00
呼呼历史论
呼呼历史论
分享有趣的历史
252文章数 16056关注度
往期回顾 全部

科技要闻

去年预亏60亿后再投百亿 两大车企紧抱华为

头条要闻

克罗地亚总统劝特朗普"考虑"斯瓦尔巴群岛 挪威急跳脚

头条要闻

克罗地亚总统劝特朗普"考虑"斯瓦尔巴群岛 挪威急跳脚

体育要闻

新的时代!东契奇生涯首夺全明星票王 此前10年詹姆斯7次夺魁

娱乐要闻

贝克汉姆长子发文决裂:全家都在演戏

财经要闻

2026年,7个趋势正在爆发

汽车要闻

奇瑞张贵兵:墨甲不做秀技术的企业 只做痛点终结者

态度原创

艺术
旅游
健康
教育
时尚

艺术要闻

书法圈人士秒认墙上14字,普通人能懂吗?

旅游要闻

红墙白雪蜡梅香,明孝陵定格中式美学“天花板”

血常规3项异常,是身体警报!

教育要闻

经常做3件事,孩子的记忆力远超同龄人

码住抄作业!春节见人不翻车就靠这8样!

无障碍浏览 进入关怀版