项目文件夹

0
2026-07-13 10:35:31 +00:00

Note

本文档由 WeHub 基于上游 README 翻译整理,属于社区翻译,非官方中文文档。
English · 原始项目 · 上游 README
原作者、版权与许可证归属以原始项目及本仓库 LICENSE 文件为准。

自然语言处理进展追踪

目录

英语

越南语

印地语

中文

如需了解更多中文任务、数据集和结果,请访问 Chinese NLP 网站。

法语

俄语

西班牙语

葡萄牙语

韩语

尼泊尔语

孟加拉语

波斯语

土耳其语

德语

阿拉伯语

本文旨在追踪自然语言处理(Natural Language Processing,NLP)领域的进展,并概述最常见 NLP 任务及其相应数据集上的最先进水平(state-of-the-art,SOTA)。

本文既涵盖依存句法分析和词性标注等传统核心 NLP 任务,也包括阅读理解、自然语言推理等较新的任务。主要目标是为读者快速概览其关注任务的基准数据集和最先进水平,作为进一步研究的起点。为此,若某任务的结果已在某处发布并定期维护(例如公开排行榜),则会引导读者前往该处查看。

若希望以后再次找到本文,只需在浏览器中访问 nlpprogress.comnlpsota.com

贡献

指南

结果   优先采用已发表论文中报告的结果;对于具有影响力的预印本,可酌情例外。

数据集   数据集除在介绍该数据集的论文中使用外,还应在至少一篇已发表论文中用于评估。

代码   建议在有可用实现时添加实现链接。若表格中尚无该列,可添加 Code 列(见下文)。在 Code 列中,使用 Official. 标注官方实现。若有非官方实现,请使用 Link(见下文)。若无可用实现,可将该单元格留空。

添加新结果

若要添加新结果,只需点击相应任务文件右上角的小编辑按钮(见下文)。

点击编辑按钮以添加文件

这允许您以 Markdown 格式编辑文件。只需按相同格式向相应表格添加一行。确保表格保持排序(最佳结果排在最上方)。完成修改后,请点击页面顶部的 "Preview changes" 选项卡,确认表格显示正常。若一切无误,请滚动至页面底部,您将看到下方表单。

填写文件变更信息

为拟议的变更添加名称和可选描述,选择 "Create a new branch for this commit and start a pull request",然后点击 "Propose file change"。

添加新数据集或任务

添加新数据集或任务时,也可遵循上述步骤。或者,您可以 fork 该仓库。无论采用哪种方式,请按以下步骤操作:

  1. 若任务完全全新,请创建新文件并在上方目录中添加链接。
  2. 否则,将任务或数据集添加到相应文件的对应章节中(按字母顺序排列)。
  3. 简要描述数据集/任务并附上相关参考文献。
  4. 说明评估设置和评估指标。
  5. 展示数据集/任务的标注示例样貌。
  6. 若有下载链接,请添加。
  7. 复制下方表格,并为数据集/任务填写至少两条结果(包括最先进水平)(将 Score 改为您数据集的指标)。若数据集/任务有多个指标,请添加到 Score 的右侧。
  8. 以 pull request 形式提交变更。
Model Score Paper / Source Code

愿望清单

以下仍是尚未覆盖的任务与数据集:

  • 双语词典归纳(bilingual dictionary induction
  • 话语解析(discourse parsing
  • 关键短语抽取(keyphrase extraction
  • 知识库填充(KBP, knowledge base population
  • 更多对话任务
  • 半监督学习(semi-supervised learning
  • 框架语义解析(FrameNet 整句分析,frame-semantic parsing

导出为结构化格式

你可以将所有数据提取为结构化的、机器可读的 JSON 格式,其中包含已解析的任务、描述与 SOTA 表格。

说明见 structured/README.md

在本地构建网站的说明

使用 Jekyll 在本地构建网站的说明见此处