印度AI研究团队AI4Bharat正式推出IndicNLP语料库,该项目提供多种印度语言的单语语料及词嵌入(Word Embeddings)资源,目标是为低资源语种的自然语言处理研究打下数据基础。
据项目介绍,该语料库聚焦印地语、泰米尔语、泰卢固语等主要印度语言,单语文本涵盖新闻、维基百科及网络语料。词嵌入部分则针对不同语种分别训练了向量表示,便于下游任务直接调用。
目前语料库已开放下载,研究者可通过官方渠道获取。团队表示后续将持续扩充语种与数据规模,并计划加入平行语料等更多语料类型。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.