项目文件夹
Note
本文档由 WeHub 基于上游 README 翻译整理,属于社区翻译,非官方中文文档。
English · 原始项目 · 上游 README
原作者、版权与许可证归属以原始项目及本仓库 LICENSE 文件为准。
自然语言处理进展追踪
目录
英语
- 自动语音识别
- CCG
- 常识
- 成分句法分析
- 指代消解
- 数据到文本生成
- 依存句法分析
- 对话
- 领域适应
- 实体链接
- 语法纠错
- 信息抽取
- 意图检测与槽位填充
- 关键短语抽取与生成
- 语言建模
- 词汇规范化
- 机器翻译
- 缺失元素
- 多任务学习
- 多模态
- 命名实体识别
- 自然语言推理
- 词性标注
- 释义生成
- 问答
- 关系预测
- 关系抽取
- 语义文本相似度
- 语义解析
- 语义角色标注
- 情感分析
- 浅层句法分析
- 文本简化
- 立场检测
- 摘要
- 分类体系学习
- 时间处理
- 文本分类
- 词义消歧
越南语
印地语
中文
如需了解更多中文任务、数据集和结果,请访问 Chinese NLP 网站。
法语
俄语
西班牙语
葡萄牙语
韩语
尼泊尔语
孟加拉语
波斯语
土耳其语
德语
阿拉伯语
本文旨在追踪自然语言处理(Natural Language Processing,NLP)领域的进展,并概述最常见 NLP 任务及其相应数据集上的最先进水平(state-of-the-art,SOTA)。
本文既涵盖依存句法分析和词性标注等传统核心 NLP 任务,也包括阅读理解、自然语言推理等较新的任务。主要目标是为读者快速概览其关注任务的基准数据集和最先进水平,作为进一步研究的起点。为此,若某任务的结果已在某处发布并定期维护(例如公开排行榜),则会引导读者前往该处查看。
若希望以后再次找到本文,只需在浏览器中访问 nlpprogress.com 或 nlpsota.com。
贡献
指南
结果 优先采用已发表论文中报告的结果;对于具有影响力的预印本,可酌情例外。
数据集 数据集除在介绍该数据集的论文中使用外,还应在至少一篇已发表论文中用于评估。
代码 建议在有可用实现时添加实现链接。若表格中尚无该列,可添加 Code 列(见下文)。在 Code 列中,使用 Official. 标注官方实现。若有非官方实现,请使用 Link(见下文)。若无可用实现,可将该单元格留空。
添加新结果
若要添加新结果,只需点击相应任务文件右上角的小编辑按钮(见下文)。
这允许您以 Markdown 格式编辑文件。只需按相同格式向相应表格添加一行。确保表格保持排序(最佳结果排在最上方)。完成修改后,请点击页面顶部的 "Preview changes" 选项卡,确认表格显示正常。若一切无误,请滚动至页面底部,您将看到下方表单。
为拟议的变更添加名称和可选描述,选择 "Create a new branch for this commit and start a pull request",然后点击 "Propose file change"。
添加新数据集或任务
添加新数据集或任务时,也可遵循上述步骤。或者,您可以 fork 该仓库。无论采用哪种方式,请按以下步骤操作:
- 若任务完全全新,请创建新文件并在上方目录中添加链接。
- 否则,将任务或数据集添加到相应文件的对应章节中(按字母顺序排列)。
- 简要描述数据集/任务并附上相关参考文献。
- 说明评估设置和评估指标。
- 展示数据集/任务的标注示例样貌。
- 若有下载链接,请添加。
- 复制下方表格,并为数据集/任务填写至少两条结果(包括最先进水平)(将 Score 改为您数据集的指标)。若数据集/任务有多个指标,请添加到
Score的右侧。 - 以 pull request 形式提交变更。
| Model | Score | Paper / Source | Code |
|---|---|---|---|
愿望清单
以下仍是尚未覆盖的任务与数据集:
- 双语词典归纳(bilingual dictionary induction)
- 话语解析(discourse parsing)
- 关键短语抽取(keyphrase extraction)
- 知识库填充(KBP, knowledge base population)
- 更多对话任务
- 半监督学习(semi-supervised learning)
- 框架语义解析(FrameNet 整句分析,frame-semantic parsing)
导出为结构化格式
你可以将所有数据提取为结构化的、机器可读的 JSON 格式,其中包含已解析的任务、描述与 SOTA 表格。
说明见 structured/README.md。
在本地构建网站的说明
使用 Jekyll 在本地构建网站的说明见此处。

