본문 바로가기

전체 글22

[Paper] PBD: Plastic Bottle Dataset for Defect Detection https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=108876390 Abstract플라스틱 병 결함 탐지를 위한 벤치마크 데이터셋 제안Plastic Bottle Body: 500개 이미지 & 4가지 결함 유형 포함Plastic Bottle Shoulder: 3,463개 이미지 & 다양한 유형 및 색상 포함1 Introduction플라스틱 병은 공장 출고 전 엄격한 품질 검사를 거침. 하지만 수동 결함 탐지는 labor-intensive하고, inefficient 함→ 컴퓨터 비전 방법은 효율성을 향상시키고, 수동 판단으로 인한 오류를 줄일 수 있음플라스틱 병 결함 탐지를 위한 데이터셋이 부재하여, 해당 분야에서의 컴퓨터 비전 기술의 적용이 제한되는 상황.. 2026. 1. 19.
[Paper] ContextCite: Attributing Model Generation to Context (Cohen-Wang et al., 2024) https://arxiv.org/pdf/2409.007291 IntroductionMotivation언어 모델이 생성한 답변이 정확한가? 실제로 제공된 context에 기반하는가?→ 사람이 직접 검증하는 것은 비효율적임기존 접근법: 언어 모델이 직접 인용을 생성하도록 훈련시키거나 프롬프팅함→ 모델이 생성한 인용을 검증하기 어려움Context Attribution언어 모델이 생성한 답변(또는 답변의 일부분)의 근원이 되는 context를 찾는 것언어 모델에 제공한 context의 일부가 답변으로 이어진 경우, 이를 제거하면 답변에 상당한 영향을 미치므로 검증이 쉬움언어 모델이 context를 잘못 이해한 경우, 해당 context를 찾을 수 있음제공된 context가 아닌 사전 훈련된 지식을 기반으로 답변.. 2026. 1. 19.
[Paper] MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection (Jiang et al., 2025) https://arxiv.org/pdf/2410.094530 Abstractindustrial anomaly detection에서 MLLM의 능력은 아직 체계적으로 연구되지 않음industrial anomaly detection 분야의 MLLM 벤치마크인 MMAD 제안industrial instpection에서 MLLM의 7가지 subtask 정의8,366개의 이미지에 대한 39,672개의 질문을 포함하는 MMAD 데이터셋을 생성하는 파이프라인 제시다양한 sota MLLM에 대해 정량평가 수행GPT-4o에서 average accuracy 74.9% 달성하지만 산업 요구 사항에 훨씬 못 미치는 수준 → industrial anomalies와 관련된 질의응답 부분에서 MLLM의 개선 필요성능 향상을 위한 2.. 2026. 1. 19.
[Paper] Less is More: Learning Graph Tasks with Just LLMs (Shirai et al., 2025) https://arxiv.org/pdf/2508.101150 AbstractLLM은 그래프 인코딩 모델 없이 graph task를 잘 수행하는가?LLM은 학습된 solution을 unseen graph structures나 tasks로 일반화할 수 있는가?graph task를 학습하는데 있어 다른 접근 방식의 장점은 무엇인가?⇒ 작은 LLM이라도 instructive CoT로 학습함으로써 graph task의 솔루션을 학습할 수 있고, graph encoder가 없어도 새로운 task과 그래프 구조로 학습된 솔루션을 일반화할 수 있음1 Introductiongraph 지식을 LLM에 넣는 방법graph → encoder → embedding → LLMgraph → text(LLM instruction t.. 2026. 1. 17.
[Paper] Let Your Graph Do the Talking: Encoding Structured Data for LLMs (Perozzi et al., 2024) https://arxiv.org/pdf/2402.058620 Abstract본 논문에서는 LLM을 위해 structured data를 인코딩하여 프롬프트로 제공하는 Graph-Token 방법론을 제시함실험을 통해 본 논문에서 제안하는 방법이 그래프 추론 태스크 성능 향상을 가져옴을 보임1 IntroductionLLM의 문제점: hallucinations, freshnesshallucinations: LLM이 사실이 아니거나 프롬프트의 내용과 일치하지 않는 출력을 생성freshness: LLM이 학습된 날짜 이후의 정보는 반영하지 못함위의 문제점을 해결하기 위해 RAG(Retrieval Augmented Generation) 이용하여 사실에 기반하고 최신 정보를 반영하고자 함RAG는 web search나 .. 2026. 1. 17.
[Paper] Talk Like a Graph: Encoding Graphs for Large Language Models (Fatemi et al., 2023) https://arxiv.org/pdf/2310.04560 0 Abstract그래프는 복잡한 관계를 표현하고 분석하는데 유용한 도구임 → LLM을 이용한 그래프 추론에 대한 연구는 아직 부족한 상태본 논문에서는 그래프 구조화된 데이터(graph-structured data)를 LLM이 사용할 수 있도록 텍스트로 인코딩하는 방법에 대해 연구함LLM의 그래프 추론 성능은 다음 요소에 따라 달라짐그래프 인코딩 방법그래프 태스크 자체의 특성그래프의 구조실험을 통해, 인코더를 올바르게 선택하면 작업에 따라 LLM의 그래프 추론 성능을 4.8%에서 61.8%까지 향상시킬 수 있음을 보여줌1 IntroductionLLM의 한계비정형 텍스트에 대한 의존성 → 논리적 관계를 놓치거나 할루시네이션 생성LLM이 가지고 있는.. 2026. 1. 2.
[Paper] Post Hoc Explanations of Language Models Can Improve Language Models (Krishna et al., 2023) https://arxiv.org/abs/2305.11426 Post Hoc Explanations of Language Models Can Improve Language ModelsLarge Language Models (LLMs) have demonstrated remarkable capabilities in performing complex tasks. Moreover, recent research has shown that incorporating human-annotated rationales (e.g., Chain-of-Thought prompting) during in-context learning can significarxiv.org0 Abstract문제 제기최근 연구에 따르면, In-C.. 2025. 12. 6.
[Web Content Extraction] Cleaner Pretraining Corpus Curation with Neural Web Scraping 개요 웹페이지 내에는 광고, 배너, 하이퍼링크 및 기타 유해한 콘텐츠가 혼합되어 있기 때문에 웹페이지에서 주요 콘텐츠만 추출하는 것은 어렵다. 이를 위해 web scraper를 사용하는데, 웹페이지 구조가 복잡해짐에 따라 rule-based 및 heuristic scraper는 페이지 레이아웃을 처리하기 위해 더 복잡한 기본 코드가 필요하고, 시간 및 인력도 많이 필요하므로 부적절해지고 있는 추세다. "Cleaner Pretraining Corpus Curation with Neural Web Scraping (Xu et al., 2024)"에서는 웹페이지로부터 주요 콘텐츠를 추출하기 위해 인공 신경망 구조를 활용한 NeuScraper 알고리즘을 제안한다. 본 논문에서는 실험을 통해 NeuScraper가.. 2025. 9. 30.
[Web Content Extraction] DOM Based Content Extraction via Text Density 개요 웹페이지를 구성하는 HTML 문서에는 본문 외에도 광고, 메뉴, 저작권 고지 등 불필요한 노이즈가 많기 때문에, HTML 문서로부터 유의미한 본문만 추출하는 것은 쉽지 않다. "DOM Based Content Extraction via Text Density (Sun et al., 2011)"에서는 Text Density를 이용하여 웹페이지의 구조 정보를 보존하며 주요 콘텐츠를 추출할 수 있는 CETD(Content Extraction via Text Density) 알고리즘을 제안한다.CETD (Content Extraction via Text Density) CETD는 다음과 같은 관찰에 기반하여 제안된 알고리즘이다.노이즈: 복잡한 html 구조 및 많은 태그, 적은 텍스트, 짧은 문장주요 콘텐.. 2025. 9. 30.