Wortschatz Leipzig,也称 Deutscher Wortschatz,是一个由项目团队建设的多语言词汇与文本资源平台,自20世纪90年代中期起持续提供多种语言及其词汇的信息。平台的应用和服务以语言统计算法、文本挖掘方法、大规模文本分析、自建网页抓取基础设施,以及自行开发的处理流程和质量保障程序为基础。它并非只提供单一词典,而是将基于语料库的词典、跨语言文本语料库、语言统计分析、在线文本挖掘工具和面向软件调用的 Web 服务组合在一起,适合需要查询词汇、研究语言使用情况、分析文本或使用语料数据开展教学与实践工作的用户。
核心功能
多语言语料库词典
词典门户提供基于语料库的词典访问能力,覆盖超过250种语言。词典内容建立在实际语料资源之上,用户可以通过该门户获取不同语言的词汇信息。官网将其定位为 Wortschatz Leipzig 的 Wörterbuchportal,即词典门户,而不是只面向德语的单语词典。
多语言文本语料库
语料库门户提供超过1000个文本语料库,涉及超过250种语言。其核心资源是可供分析的文本集合,适用于从多语言材料中观察词汇和语言现象。官网明确说明,这些语料库是平台其他应用和服务的重要基础。
语言统计分析
语言统计部分基于平台语料库,对自然语言的不同方面提供多样化分析。官网将其描述为覆盖 diverse Facetten natürlicher Sprache 的统计服务,因此它关注的不只是词条查询,也包括从语料数据出发对自然语言进行统计观察和分析。
Online Toolbox 文本挖掘工具
Online Toolbox 是一组文本挖掘算法的集合,面向教学和实际应用。工具箱将文本挖掘方法以在线工具形式提供,可用于相关课程中的演示、练习,也可用于实践场景中的文本处理与分析。官网没有在给定正文中进一步列出具体算法名称或输入输出格式。
Web 服务与软件访问
Webservices 允许从任意软件直接访问平台语料库。与通过网页门户手动查询相比,这一入口面向需要把语料资源接入其他软件的使用方式。官网明确将其描述为对语料库的直接软件访问,但给定正文未说明具体接口协议、调用参数、认证方式或配额限制。
文本资源采集与处理基础设施
平台会从选定的公开可访问来源自动收集数据,并使用自建的网页抓取基础设施、定制处理流程和质量保障程序,对大规模文本进行分析和加工。官网还提供 CURL 门户,用于协助收集当前数字资源较少的语言的文本材料;这说明平台不仅消费现有语料,也开展面向语言资源建设的材料收集工作。
使用方式
官网正文展示了词典门户、语料库门户、语言统计、Online Toolbox、Webservices 和 CURL Portal 等在线入口。用户可以通过网页访问词典、文本语料库、统计分析及文本挖掘工具,也可以通过 Webservices 从任意软件直接访问语料库。给定正文没有说明是否需要注册、是否需要自备模型 Key,也没有列出具体的导入导出格式或命令行客户端。
适用人群与场景
语言学习者或词汇研究者可以使用多语言词典门户查询基于语料库的词汇信息。语言学研究人员可利用超过1000个文本语料库和语言统计服务,观察自然语言的不同方面。需要处理大规模文本的开发者或研究团队,可以通过 Webservices 从软件中直接访问语料库。教师和实践应用人员则可以使用 Online Toolbox 中的文本挖掘算法开展教学或文本分析;对于数字资源较少的语言,相关人员还可以通过 CURL Portal 协助收集文本材料。
注意事项
官网标注“Wörter des Tages”每日词汇服务目前不可用。平台数据来自选定的公开来源并自动收集,示例句也由系统自动选择;示例句及其中表达的观点不代表项目立场,相关内容和意见由原作者负责。官网还提醒,词汇中出现的品牌、商号和商品名称即使没有特别标注,也受相关法律规定约束;商标名称被作为同义词使用,并不必然表示其具有对应产品特性。