dbEST 是 GenBank 的一个分支数据库,由美国国家生物技术信息中心(NCBI)维护,用于收录来自多种生物的单次测序 cDNA 序列,也就是 Expressed Sequence Tags(ESTs,表达序列标签)。它面向的是基因表达研究中的原始序列数据:EST 通常来自 mRNA 的 cDNA,长度通常少于 1000 bp,能够反映某种组织或特定发育阶段中表达的基因。与完整转录本组装数据库不同,dbEST 专门保存 single-pass reads;已经组装的序列应通过 GenBank 的 TSA(Transcriptome Shotgun Assembly)分支提交。
核心功能
表达序列标签数据收录
dbEST 包含来自多种生物的 single-pass cDNA 序列数据及其他相关信息。EST 是从 mRNA(cDNA)产生的短序列读段,通常以大批量方式生成,用于记录目标 cDNA 文库中的表达信息。部分 EST 具有编码意义,部分不编码,因此它们代表的是某个组织或发育阶段的基因表达标签,而不是经过完整组装的转录本。
批量序列提交
EST 项目通常会产生大量序列,这些数据可以按批次提交到 GenBank 和 dbEST。官网说明,提交批次可以包含几十到数千条记录,并共享文献引用、提交者和来源信息。自 2019 年起,dbEST 支持使用 tbl2asn 进行提交;生成 EST 提交所需的必需输入包括模板文件和 FASTA 格式的核苷酸序列数据。
FASTA 数据与来源信息处理
提交的 FASTA 文件中,每条序列需要包含 organism、tech 和 moltype 信息,其中技术类型应标记为 EST,分子类型应标记为 mRNA,SeqID 会被用作 clone 值。提交者还可以加入组织类型、发育阶段和菌株等来源修饰符,例如 tissue-type、dev-stage 和 strain,以补充序列的生物学来源信息。
EST 特征表支持
EST 提交不是必须包含 features,但可以附带 feature table。官网规定,每条序列最多可以添加一个 misc_feat,并在注释中使用“similar to ...”这类说明;对于 EST,不允许应用其他 features。这一限制用于区分单次测序读段与具有更完整注释的序列记录。
序列访问与提交结果发送
EST 序列被纳入 GenBank 的 EST division,可以通过 NCBI 的 E-Utilities 访问,也可以通过匿名 FTP 获取。使用 tbl2asn 生成提交文件后,示例命令会输出 ESTs.sqn 文件,提交者需要将该 .sqn 文件发送至 GenBank 的提交邮箱。若 EST 属于更大规模的持续项目,还可以附带 BioProject 或 BioSample 信息。
使用方式
dbEST 的数据可通过 NCBI 的 E-Utilities 访问,也可通过匿名 FTP 获取历史数据。提交方面,用户需要准备 .sbt 后缀的 ASN.1 Submit-block 模板文件和 .fsa 后缀的 FASTA 序列文件,并在命令行运行 tbl2asn 生成 .sqn 提交文件,再发送给 GenBank 提交地址。正文未说明提交是否必须注册账号,也未提及客户端、浏览器插件或独立 API 使用方式。
适用人群与场景
- 进行基因表达研究的科研人员:可查找来自不同生物、组织或发育阶段的 EST 序列,作为表达信息的序列记录。
- 产生大批量 cDNA 单次测序数据的实验室:可依据模板、FASTA 文件和来源修饰符批量准备提交材料。
- 需要提交 EST 项目的生物信息学人员:可使用 tbl2asn 生成提交文件,并结合 BioProject 或 BioSample 补充项目关联信息。
- 处理转录组组装数据的研究团队:可根据数据类型区分提交位置,单条读段提交至 dbEST,组装序列提交至 TSA。
注意事项
dbEST 仅用于 single-pass reads,组装序列不应提交到该分支。来自下一代测序平台的序列应提交至 Short Read Archive(SRA)。线粒体序列、rRNA、病毒序列、载体、污染序列和低质量序列不应包含在 EST 提交中;载体和接头区域需要先通过 VecScreen 识别并移除。FTP 中截至 2018 年底接收的 EST 仍可获取,2018 年之后接收的 EST 不会以该 FTP 格式提供。