FASTA 是弗吉尼亚大学提供的蛋白质与DNA序列比较服务,核心用途是寻找序列之间的局部或全局相似区域。它既可以将输入序列与蛋白质或DNA数据库进行搜索,也可以识别单条序列中的局部重复。服务提供多种面向蛋白质、核酸、翻译序列、统计显著性和局部重复的程序,因此可以根据序列类型和比较目标选择不同的分析方式。FASTA 的结果可用于推断序列的功能关系和进化关系,也可辅助识别基因家族成员。
核心功能
蛋白质序列比较
FASTA 提供 Protein-protein FASTA,用于蛋白质与蛋白质之间的序列搜索。对于需要更具体比对策略的情况,还提供 Protein-protein Smith-Waterman(ssearch)、Global Protein-protein Needleman-Wunsch(ggsearch)以及 Global/Local protein-protein(glsearch)。这些程序分别覆盖 Smith-Waterman、Needleman-Wunsch、全局比较与局部比较等方向,适用于不同的蛋白质序列比较任务。
特殊蛋白质序列比较
蛋白质工具中还包括带无序肽段的 Protein-protein with unordered peptides(fasts),以及带混合肽段序列的 Protein-protein with mixed peptide sequences(fastf)。这两类程序针对输入中存在肽段组织差异的比较场景,官网将它们作为独立的蛋白质比较程序提供。
DNA 与 RNA 序列比较
在 Nucleotide 部分,Nucleotide-Nucleotide(DNA/RNA fasta)用于DNA或RNA核苷酸序列之间的比较。服务还提供 Ordered Nucleotides vs Nucleotide(fastm)和 Un-ordered Nucleotides vs Nucleotide(fasts),分别对应有序核苷酸和无序核苷酸与核苷酸序列的比较。
翻译序列比较
Translated 部分支持多种翻译方向的序列比较。Translated DNA with frameshifts(fastx/fasty)可将带移码的翻译DNA序列与蛋白质进行比较,官网举例包括ESTs;Protein vs Translated DNA with frameshifts(tfastx/tfasty)则从蛋白质对翻译DNA的方向进行比较;Peptides vs Translated DNA(tfasts)用于肽段与翻译DNA的比较。
统计显著性分析
FASTA 服务提供 Protein vs Protein shuffle(prss)、DNA vs DNA shuffle(prss)和 Translated DNA vs Protein shuffle(prfx)等统计显著性程序。这些工具用于为序列比较或比对结果提供统计显著性相关信息,官网将其单独列在 Statistical Significance 分类下。
局部重复与比对可视化
Local Duplications 分类包含 Local Protein alignments(lalign)和 Local DNA alignments(lalign),用于蛋白质或DNA的局部比对;同时提供 Plot Protein alignment dot-plot(plalign)和 Plot DNA alignment dot-plot(plalign),用于绘制蛋白质或DNA比对的点阵图。该部分适合检查序列内部或序列之间的局部重复和局部匹配区域。
使用方式
官网提供 UVa FASTA Server 入口,并在首页按 Protein、Nucleotide、Translated、Statistical Significance 和 Local Duplications 分类列出对应程序。用户可根据输入是蛋白质、DNA/RNA、翻译DNA还是肽段,选择相应的在线程序;官网还提供 Getting started、FASTA 使用指南、软件变更记录、下载和序列库下载入口。正文未说明是否需要注册、是否需要自备模型Key,也未说明具体导入导出格式。
适用人群与场景
需要比较蛋白质序列的用户,可以使用 FASTA、Smith-Waterman、Needleman-Wunsch或全局/局部比较程序;处理DNA或RNA序列的用户,可以选择核苷酸比较工具。涉及ESTs、移码翻译或肽段与翻译DNA比较的用户,可使用 fastx/fasty、tfastx/tfasty 和 tfasts。需要评估统计显著性、查找局部重复或查看点阵图的用户,则可使用对应的 shuffle、lalign 和 plalign 程序。