sebastianruder--nlp-progress
196 行
8.1 KiB
Markdown
196 行
8.1 KiB
Markdown
<!-- WEHUB_ZH_README -->
|
||
> [!NOTE]
|
||
> 本文档由 WeHub 基于上游 README 翻译整理,属于社区翻译,非官方中文文档。
|
||
> [English](./README.en.md) · [原始项目](https://github.com/sebastianruder/NLP-progress) · [上游 README](https://github.com/sebastianruder/NLP-progress/blob/HEAD/README.md)
|
||
> 原作者、版权与许可证归属以原始项目及本仓库 LICENSE 文件为准。
|
||
|
||
# 自然语言处理进展追踪
|
||
|
||
## 目录
|
||
|
||
### 英语
|
||
|
||
- [自动语音识别](english/automatic_speech_recognition.md)
|
||
- [CCG](english/ccg.md)
|
||
- [常识](english/common_sense.md)
|
||
- [成分句法分析](english/constituency_parsing.md)
|
||
- [指代消解](english/coreference_resolution.md)
|
||
- [数据到文本生成](english/data_to_text_generation.md)
|
||
- [依存句法分析](english/dependency_parsing.md)
|
||
- [对话](english/dialogue.md)
|
||
- [领域适应](english/domain_adaptation.md)
|
||
- [实体链接](english/entity_linking.md)
|
||
- [语法纠错](english/grammatical_error_correction.md)
|
||
- [信息抽取](english/information_extraction.md)
|
||
- [意图检测与槽位填充](english/intent_detection_slot_filling.md)
|
||
- [关键短语抽取与生成](english/keyphrase_extraction_generation.md)
|
||
- [语言建模](english/language_modeling.md)
|
||
- [词汇规范化](english/lexical_normalization.md)
|
||
- [机器翻译](english/machine_translation.md)
|
||
- [缺失元素](english/missing_elements.md)
|
||
- [多任务学习](english/multi-task_learning.md)
|
||
- [多模态](english/multimodal.md)
|
||
- [命名实体识别](english/named_entity_recognition.md)
|
||
- [自然语言推理](english/natural_language_inference.md)
|
||
- [词性标注](english/part-of-speech_tagging.md)
|
||
- [释义生成](english/paraphrase-generation.md)
|
||
- [问答](english/question_answering.md)
|
||
- [关系预测](english/relation_prediction.md)
|
||
- [关系抽取](english/relationship_extraction.md)
|
||
- [语义文本相似度](english/semantic_textual_similarity.md)
|
||
- [语义解析](english/semantic_parsing.md)
|
||
- [语义角色标注](english/semantic_role_labeling.md)
|
||
- [情感分析](english/sentiment_analysis.md)
|
||
- [浅层句法分析](english/shallow_syntax.md)
|
||
- [文本简化](english/simplification.md)
|
||
- [立场检测](english/stance_detection.md)
|
||
- [摘要](english/summarization.md)
|
||
- [分类体系学习](english/taxonomy_learning.md)
|
||
- [时间处理](english/temporal_processing.md)
|
||
- [文本分类](english/text_classification.md)
|
||
- [词义消歧](english/word_sense_disambiguation.md)
|
||
|
||
### 越南语
|
||
|
||
- [依存句法分析](vietnamese/vietnamese.md#dependency-parsing)
|
||
- [意图检测与槽位填充](vietnamese/vietnamese.md#intent-detection-and-slot-filling)
|
||
- [机器翻译](vietnamese/vietnamese.md#machine-translation)
|
||
- [命名实体识别](vietnamese/vietnamese.md#named-entity-recognition)
|
||
- [词性标注](vietnamese/vietnamese.md#part-of-speech-tagging)
|
||
- [语义解析](vietnamese/vietnamese.md#semantic-parsing)
|
||
- [分词](vietnamese/vietnamese.md#word-segmentation)
|
||
|
||
### 印地语
|
||
|
||
- [组块分析](hindi/hindi.md#chunking)
|
||
- [词性标注](hindi/hindi.md#part-of-speech-tagging)
|
||
- [机器翻译](hindi/hindi.md#machine-translation)
|
||
|
||
### 中文
|
||
|
||
- [实体链接](chinese/chinese.md#entity-linking)
|
||
- [中文分词](chinese/chinese_word_segmentation.md)
|
||
- [问答](chinese/question_answering.md)
|
||
|
||
如需了解更多中文任务、数据集和结果,请访问 [Chinese NLP](https://chinesenlp.xyz/#/) 网站。
|
||
|
||
### 法语
|
||
|
||
- [问答](french/question_answering.md)
|
||
- [摘要](french/summarization.md)
|
||
|
||
### 俄语
|
||
|
||
- [问答](russian/question_answering.md)
|
||
- [情感分析](russian/sentiment-analysis.md)
|
||
- [摘要](russian/summarization.md)
|
||
|
||
### 西班牙语
|
||
|
||
- [命名实体识别](spanish/named_entity_recognition.md)
|
||
- [实体链接](spanish/entity_linking.md#entity-linking)
|
||
- [摘要](spanish/summarization.md)
|
||
|
||
### 葡萄牙语
|
||
|
||
- [问答](portuguese/question_answering.md)
|
||
|
||
### 韩语
|
||
|
||
- [问答](korean/question_answering.md)
|
||
|
||
### 尼泊尔语
|
||
|
||
- [机器翻译](nepali/nepali.md#machine-translation)
|
||
|
||
### 孟加拉语
|
||
- [词性标注](bengali/part_of_speech_tagging.md)
|
||
- [情感检测](bengali/emotion_detection.md)
|
||
- [情感分析](bengali/sentiment_analysis.md)
|
||
|
||
### 波斯语
|
||
- [命名实体识别](persian/named_entity_recognition.md)
|
||
- [自然语言推理](persian/natural_language_inference.md)
|
||
- [摘要](persian/summarization.md)
|
||
|
||
### 土耳其语
|
||
|
||
- [摘要](turkish/summarization.md)
|
||
|
||
### 德语
|
||
|
||
- [问答](german/question_answering.md)
|
||
- [摘要](german/summarization.md)
|
||
|
||
### 阿拉伯语
|
||
- [语言建模](arabic/language_modeling.md)
|
||
|
||
|
||
本文旨在追踪自然语言处理(Natural Language Processing,NLP)领域的进展,并概述最常见 NLP 任务及其相应数据集上的最先进水平(state-of-the-art,SOTA)。
|
||
|
||
本文既涵盖依存句法分析和词性标注等传统核心 NLP 任务,也包括阅读理解、自然语言推理等较新的任务。主要目标是为读者快速概览其关注任务的基准数据集和最先进水平,作为进一步研究的起点。为此,若某任务的结果已在某处发布并定期维护(例如公开排行榜),则会引导读者前往该处查看。
|
||
|
||
若希望以后再次找到本文,只需在浏览器中访问 [`nlpprogress.com`](https://nlpprogress.com/) 或 [`nlpsota.com`](http://nlpsota.com/)。
|
||
|
||
### 贡献
|
||
|
||
#### 指南
|
||
|
||
**结果** 优先采用已发表论文中报告的结果;对于具有影响力的预印本,可酌情例外。
|
||
|
||
**数据集** 数据集除在介绍该数据集的论文中使用外,还应在至少一篇已发表论文中用于评估。
|
||
|
||
**代码** 建议在有可用实现时添加实现链接。若表格中尚无该列,可添加 `Code` 列(见下文)。在 `Code` 列中,使用 [Official](http://link_to_implementation). 标注官方实现。若有非官方实现,请使用 [Link](http://link_to_implementation)(见下文)。若无可用实现,可将该单元格留空。
|
||
|
||
#### 添加新结果
|
||
|
||
若要添加新结果,只需点击相应任务文件右上角的小编辑按钮(见下文)。
|
||
|
||

|
||
|
||
这允许您以 Markdown 格式编辑文件。只需按相同格式向相应表格添加一行。确保表格保持排序(最佳结果排在最上方)。完成修改后,请点击页面顶部的 "Preview changes" 选项卡,确认表格显示正常。若一切无误,请滚动至页面底部,您将看到下方表单。
|
||
|
||

|
||
|
||
为拟议的变更添加名称和可选描述,选择 "Create a new branch for this commit and start a pull request",然后点击 "Propose file change"。
|
||
|
||
#### 添加新数据集或任务
|
||
|
||
添加新数据集或任务时,也可遵循上述步骤。或者,您可以 fork 该仓库。无论采用哪种方式,请按以下步骤操作:
|
||
|
||
1. 若任务完全全新,请创建新文件并在上方目录中添加链接。
|
||
2. 否则,将任务或数据集添加到相应文件的对应章节中(按字母顺序排列)。
|
||
3. 简要描述数据集/任务并附上相关参考文献。
|
||
4. 说明评估设置和评估指标。
|
||
5. 展示数据集/任务的标注示例样貌。
|
||
6. 若有下载链接,请添加。
|
||
7. 复制下方表格,并为数据集/任务填写至少两条结果(包括最先进水平)(将 Score 改为您数据集的指标)。若数据集/任务有多个指标,请添加到 `Score` 的右侧。
|
||
1. 以 pull request 形式提交变更。
|
||
|
||
| Model | Score | Paper / Source | Code |
|
||
| ------------- | :-----:| --- | --- |
|
||
| | | | |
|
||
|
||
|
||
### 愿望清单
|
||
|
||
以下仍是尚未覆盖的任务与数据集:
|
||
|
||
- 双语词典归纳(bilingual dictionary induction)
|
||
- 话语解析(discourse parsing)
|
||
- 关键短语抽取(keyphrase extraction)
|
||
- 知识库填充(KBP, knowledge base population)
|
||
- 更多对话任务
|
||
- 半监督学习(semi-supervised learning)
|
||
- 框架语义解析(FrameNet 整句分析,frame-semantic parsing)
|
||
|
||
### 导出为结构化格式
|
||
|
||
你可以将所有数据提取为结构化的、机器可读的 JSON 格式,其中包含已解析的任务、描述与 SOTA 表格。
|
||
|
||
说明见 [structured/README.md](structured/README.md)。
|
||
|
||
### 在本地构建网站的说明
|
||
|
||
使用 Jekyll 在本地构建网站的说明见[此处](jekyll_instructions.md)。
|