On-the-fly Denoising for Data Augmentation in Natural Language Understanding | allainews.com

Feb. 1, 2024, 12:41 p.m. | Tianqing Fang Wenxuan Zhou Fangyu Liu Hongming Zhang Yangqiu Song Muhao Chen

cs.CL updates on arXiv.org arxiv.org

Data Augmentation (DA) is frequently used to provide additional training data without extra human annotation automatically. However, data augmentation may introduce noisy data that impairs training. To guarantee the quality of augmented data, existing methods either assume no noise exists in the augmented data and adopt consistency training or use simple heuristics such as training loss and diversity constraints to filter out "noisy" data. However, those filtered examples may still contain useful information, and dropping them completely causes a loss …

annotation augmentation augmented data cs.ai cs.cl data denoising extra fly human language language understanding natural natural language noise quality simple training training data understanding

More from arxiv.org / cs.CL updates on arXiv.org

Sketch-Guided Constrained Decoding for Boosting Blackbox Large Language Models without Logit Access 1 day, 1 hour ago | arxiv.org

abstract access application arxiv +21

LLaMA Pro: Progressive LLaMA with Block Expansion 1 day, 1 hour ago | arxiv.org

abstract arxiv block codellama +15

Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning 1 day, 1 hour ago | arxiv.org

arxiv captioning chart charts +4

Sibyl: Sensible Empathetic Dialogue Generation with Visionary Commonsense Knowledge 1 day, 1 hour ago | arxiv.org

abstract access arxiv building +19

PrivLM-Bench: A Multi-level Privacy Evaluation Benchmark for Language Models 1 day, 1 hour ago | arxiv.org

abstract accessibility art arxiv +17

ChatKBQA: A Generate-then-Retrieve Framework for Knowledge Base Question Answering with Fine-tuned Large Language Models 1 day, 1 hour ago | arxiv.org

abstract arxiv challenges core +23

Cross-Lingual Knowledge Editing in Large Language Models 1 day, 1 hour ago | arxiv.org

arxiv cross-lingual cs.ai cs.cl +8

Hi Model, generating 'nice' instead of 'good' is not as bad as generating 'rice'! Towards … 1 day, 1 hour ago | arxiv.org

abstract arxiv context cs.cl +16

Chatlaw: A Multi-Agent Collaborative Legal Assistant with Knowledge Graph Enhanced Mixture-of-Experts Large Language Model 1 day, 1 hour ago | arxiv.org

abstract agent ai legal arxiv +28

ML/AI Engineer / NLP Expert - Custom LLM Development (x/f/m)

@ HelloBetter | Remote

View on ai-jobs.net

Doctoral Researcher (m/f/div) in Automated Processing of Bioimages

@ Leibniz Institute for Natural Product Research and Infection Biology (Leibniz-HKI) | Jena

View on ai-jobs.net

Seeking Developers and Engineers for AI T-Shirt Generator Project

@ Chevon Hicks | Remote

View on ai-jobs.net

Security Data Engineer

@ ASML | Veldhoven, Building 08, Netherlands

View on ai-jobs.net

Data Engineer

@ Parsons Corporation | Pune - Business Bay

View on ai-jobs.net

Data Engineer

@ Parsons Corporation | Bengaluru, Velankani Tech Park

View on ai-jobs.net