文章速览
方案定位:华大围绕“普惠高质量基因组组装”升级整体方案,以CycloneSEQ S1长读长、DNBSEQ短读长和自研CycAsm软件为核心,覆盖从测序到交付的完整流程。
质量标准:S1体系将HG002原始数据Q值由17.3提升至21.1,并带动组装QV由56提升至62,为长短联合组装建立更高质量基准。
规模验证:291个真实样本(基于S0体系)完成统一流程组装,Contig N50中位数44.92 Mb、组装QV中位数48.85,验证队列级稳定交付能力。
合作开放:2026年8月开放首批项目试用与合作申请。
CycloneSEQ G400-ER S1体系刚刚上市,下一项应用升级已经接上——基因组混合组装方案CycAsm已完成S1适配,把S1的Q20数据质量带到分析和交付端,也让高质量组装的门槛和成本进一步降低。
CycAsm将长读长的连续性和短读长的准确度结合起来,再通过标准化流程进入队列项目。此前,CycAsm已基于CycloneSEQ长读长测序数据完成真实队列批量测试与优化;本次适配则围绕S1数据质量和错误特征优化参数,使体系升级落到交付质量上。
从S1升级到高质量组装新标准
方案核心:CycAsm 把S1数据质量转化为组装质量
CycAsm是这套方案的核心软件。流程分为三步:先用CycloneSEQ S1长读长搭建基因组骨架,再引入DNBSEQ短读长校正局部碱基,最后进行单倍型感知的协同Polish(自研工具)。这样可以在保持连续性的同时,提高碱基准确性,并减少分型错误。
![]()
CycAsm长短联合组装与协同Polish流程示意
更高质量,也更低成本:S1原始reads质量提升后,在达到常规样本QV>50目标的同时,减少数据投入和整体组装成本。对队列项目来说,这会直接降低高质量组装的使用门槛。
从S1升级到高质量组装新标准,这套方案把S1的底层升级转化为可标准化、可规模化交付的组装能力,推动高质量基因组组装从“可做”走向“可及”。
对队列研究而言,更重要的变化是:高质量个体基因组可以在可控成本下批量获得,为泛基因组构建、疾病研究和复杂变异解析提供更稳定的数据基础。
S1体系升级,
如何转化为高质量组装结果?
体系升级是否有效,最终要看组装结果。CycAsm完成S1适配后,我们先用HG002标准品做同口径对比,确认S1数据质量提升能否传导到最终组装。
![]()
基于HG002标准品的S0/S1体系组装结果对比
结果显示,在统一分析口径下,S1原始数据Q值由17.3提升至21.1,组装QV 由56提升至62。S1的提升没有停留在原始reads,而是继续传导到组装骨架和碱基准确性上。
从S0到S1,测序端的进步已经体现为可交付的组装质量提升。
复杂区域解析:S1提高组装上限
Y染色体中的回文、串联重复、片段重复和Yq12异染色质,以及着丝粒核心的HOR(高阶重复序列),都是人基因组中最难组装的高度重复区域。完整Y染色体直到2023年才被系统补全,HOR也一直是T2T完整基因组组装的关键难点。
常规项目可以直接使用长短联合方案;如果目标是T2T或单Contig解析,可以叠加S1的超长读长模式。
基于CycloneSEQ最新超长测序数据,HG002 T2T样本组装Contig N50达135Mb,仅余13个Gap,并完成Y染色体与HOR区域解析。
![]()
HG002标准品T2T组装结果
![]()
HOR区域与Y染色体精准解析
从一个人到一批人:
队列级稳定交付如何验证?
高质量组装要服务队列研究,除了标准品指标,还需要在真实样本和批量流程中保持稳定。
除HG002单样本验证外,CycAsm还在CIMA真实队列(基于S1升级前的数据)完成291个样本批量组装。所有样本采用统一流程处理:平均 CycloneSEQ长读长数据量131.74Gb,平均测序深度43.9×,并结合 DNBSEQ 短读长完成统一组装和质量评估。这批样本主要用于验证统一流程在真实队列中的批量处理能力和结果稳定性。
![]()
CIMA真实队列样本组装结果总览
在S0体系下,队列结果如下:
![]()
CIMA队列组装QV与Contig N50分布
(n=291;Contig N50中位数 44.92 Mb,组装QV中位数 48.85)
真实样本 vs 标准品:真实样本覆盖度不均、杂合度更高、复杂区域比例更大,因此相同口径下,组装QV通常略低于HG002等标准品;
S0 vs S1:CIMA队列结果来自S1升级前的S0体系。结合01节,S1在 reads质量和组装QV上仍有提升。
因此,同规模队列切换到S1后,关键质量指标有望继续提升。
CIMA队列说明,这套流程可以在批量样本中稳定运行,并产出可比较、可汇总的高质量个体组装结果。这也是后续构建人群泛基因组的基础。
项目合作申请开放
基于S1体系升级后的CycloneSEQ+DNBSEQ人基因组联合组装方案,计划于2026年8月开放首批项目试用与合作申请。
合作流程
提交申请:扫描下方二维码,提交样本数量、CycloneSEQ长读长与 DNBSEQ短读长数据情况、研究目标;
方案评估:项目团队与申请方共同评估数据配置、周期与交付内容;
启动项目:明确交付节点,建立项目沟通机制。
重点关注方向
人群、疾病及家系队列研究;
高质量个体基因组组装;
结构变异与复杂基因组区域研究;
新建队列的CycloneSEQ长读长+DNBSEQ短读长整体方案设计;
已有队列(已积累DNBSEQ短读长,或正在引入CycloneSEQ长读长)的组装能力升级。
⬇️扫描下方二维码,提交项目合作申请⬇️
![]()
CycloneSEQ长读长、DNBSEQ短读长和CycAsm自研软件,共同组成华大高质量基因组组装方案。S1体系升级后,这套方案在质量、成本和规模化交付上都有了质的飞跃。
华大方案,让高质量基因组组装更普惠。
*相关示例数据已归档至国家基因库生命大数据平台(CNGBdb),项目编号:CNP0009803。
*数据链接:
https://db.cngb.org/data_resources/project/CNP0009803/
![]()
让我知道你“在看”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.