[보고서]PDF 파일을 XML 파일로 변환하는 도구 개발

전홍우

지식인프라
지식인프라

연구 활동에 필요한 과학기술정보·데이터, 슈퍼컴퓨팅 자원, 정보분석 도구 등을 제공합니다.
- 지식인프라 전체보기
  
  지식인프라 전체보기
  
  연구 활동에 필요한 과학기술 지식인프라를
  데이터 유형, 연구단계, 이용목적별로 제공합니다.
- 이용목적별 지식인프라
  
  이용목적별 지식인프라
  
  이용자의 소속 유형과 활용 목적에 적합한
  과학기술 지식인프라를 제공합니다.
- 활용 시나리오
  
  활용 시나리오
  
  인프라 기능들 사이에 목적별 워크플로우를 구성하여 과학기술 지식인프라 이용에 도움을 드리려고 합니다.
지능형 분석
지능형 분석

과학기술정보데이터, 슈퍼컴퓨팅활용, 정보분석 등
연구자들이 언제 어디서나 활용할 수 있도록 지원합니다.
- AI 논문 서비스・AI-Helper
  
  AI 논문 서비스・AI-Helper
  
  논문의 문장분류를 기반으로 AI 요약 서비스를
  제공하고 있으며, 딥러닝 AI 모델을 통해 연구주제,
  연구방법, 연구결과에 대한 문장분류 태그를
  자동으로 구축하고 있습니다.
  
  또한, 논문 PDF에서 선택한 텍스트를 요약, 번역,
  용어 설명하는 AI-Helper 서비스를 제공합니다.
- ScienceON TREND
  
  ScienceON TREND
  
  최신 과학기술 트렌드와 토픽에 대한 ScienceON
  연관 콘텐츠 및 내외부 지식인프라 콘텐츠를 한 번에 볼 수 있는 서비스입니다.
- ScienceON Analytics
  
  ScienceON Analytics
  
  ScienceON 이용통계 기반의 활용도 분석 서비스를 제공합니다.
- ScienceON LAB
  
  ScienceON LAB
  
  ScienceON LAB은 사용자들이 ScienceON의
  새로운 서비스, 기능 등을 이용해보고 피드백을
  남길 수 있는 공간입니다.
고객지원
고객지원

이용자의 연구 활동을 돕고 요구사항을 반영하고자
온오프라인을 통해 적극적으로 고객을 지원합니다.
- 공지사항
  
  공지사항
  
  ScienceON, 연구개발, 과학기술 활동과 관련된
  공지 내용을 제공합니다.
- FAQ
  
  FAQ
  
  ScienceON 이용과 관련한 주요 질문과 답변을
  제공합니다.
- Q&A
  
  Q&A
  
  ScienceON 이용 관련 질문, 불편사항,
  개선 요청사항에 대한 게시판입니다.
- 사용설명서
  
  사용설명서
  
  ScienceON 사용에 필요한 설명을 제공합니다.
- OpenAPI
  
  ScienceON API Gateway
  
  KISTI에서 구축한 과학기술정보를 제공하는
  개방형 유통 플랫폼입니다.
- ScienceON 홍보
  
  ScienceON 홍보
  
  ScienceON에서 발간한 ScienceON 홍보자료를 확인할 수 있습니다.
- 저작권 관리 안내
  
  저작권 관리 안내
  
  ScienceON에서 제공하는 콘텐츠에 대한 저작권 관리 안내입니다
About
About

ScienceON 개요, 추진방향, 목표, 기능과
제공 콘텐츠입니다.
- ScienceON 개요
  
  ScienceON 개요
  
  과학기술 지식인프라 ScienceON은 과학기술정보, 연구데이터, 정보분석서비스 및 연구인프라를 연계·융합하여 연구자가 필요로 하는 지식인프라를 한곳에서 제공하는 서비스 입니다.
- 추진방향
  
  추진방향
  
  지식인프라의 통합적 연계·활용 중심에서 인공지능
  큐레이션 서비스로의 진화를 목표로 합니다.
- 서비스 목표
  
  서비스 목표
  
  이용자의 접근성과 활용성 강화, R&D의 효율성 향상, 과학기술의 대중화 실현하고자 합니다.
- 주요기능
  
  주요기능
  
  지식인프라, 지능형 분석, 고객지원 등 연구 활동에
  필요한 주요 기능을 설명합니다.
- 제공콘텐츠
  
  제공콘텐츠
  
  ScienceON에서 제공하는 과학기술정보 및
  지식인프라에 대한 개요 및 현황을 제공합니다.
- 지식인프라 소개
  
  지식인프라 소개
  
  ScienceON에서 제공하는 다양한
  지식인프라에 대한 소개를 제공합니다.

인기검색어
급상승검색어

연합인증

연합인증 가입 기관의 연구자들은 소속기관의 인증정보(ID와 암호)를 이용해 다른 대학, 연구기관, 서비스 공급자의 다양한 온라인 자원과 연구 데이터를 이용할 수 있습니다.

이는 여행자가 자국에서 발행 받은 여권으로 세계 각국을 자유롭게 여행할 수 있는 것과 같습니다.

연합인증으로 이용이 가능한 서비스는 NTIS, DataON, Edison, Kafe, Webinar 등이 있습니다.

한번의 인증절차만으로 연합인증 가입 서비스에 추가 로그인 없이 이용이 가능합니다.

다만, 연합인증을 위해서는 최초 1회만 인증 절차가 필요합니다. (회원이 아닐 경우 회원 가입이 필요합니다.)

연합인증 절차는 다음과 같습니다.

최초이용시에는
ScienceON에 로그인 → 연합인증 서비스 접속 → 로그인 (본인 확인 또는 회원가입) → 서비스 이용

그 이후에는
ScienceON 로그인 → 연합인증 서비스 접속 → 서비스 이용

연합인증을 활용하시면 KISTI가 제공하는 다양한 서비스를 편리하게 이용하실 수 있습니다.

PDF 파일을 XML 파일로 변환하는 도구 개발
Conversion of PDF to XML-based Structural Information 원문보기

보고서 정보
주관연구기관	한국과학기술정보연구원 Korea Institute of Science and Technology Information
연구책임자	전홍우
보고서유형	최종보고서
발행국가	대한민국
언어	한국어
발행년월	2010-12
주관부처	교육과학기술부
사업 관리 기관	교육과학기술부
등록번호	TRKO201100007962
DB 구축일자	2013-04-18
키워드	문장 재구성.단어 재구성.문장 인식.띄어 쓰기.PDF.XML.Sentence reconstruction.Word reconstruction.Sentence detection.word segmentation.

초록 ▼

○ 전체 논문(Full paper)을 이용한 다양한 의미 정보 추출의 요구 증대.
- 대부분의 전체 논문은 PDF 양식으로 공개되어 있음.
- 기존 자연어처리 연구는 대부분 초록(Abstract)만을 이용한 한정적인 연구임.
- 전체 논문 이용의 시도가 있으나 공개 되어 있는 논문수의 제한으로 자체적인 말뭉치 구축 작업 시행.
- 이 작업은 많은 시간과 노동을 필요로 하는 자연어처리 연구의 병목구간임.
○ 위의 요구를 충족시키기 위해 PDF의 XML로의 변환기 개발.
- PDF 문서 내부를 분석하여

Abstract ▼

Most public data have published using PDF (Portable Document Format), because it is not dependant upon devices, operating systems. However, PDF processing is a bottleneck because analysis of semantic information from PDF is a difficult task. Thus, there are a lot of needs to convert PDF to other structural format such as XML format. Such conversion makes it possible to analyze texts in PDF, and extract information from full papers. In other words, the output of the converter can be processed by various Natural Language Processing (NLP) techniques, and it can analyze and extract information more exquisitely. In addition, since corpora can be constructed with a cheap manner, a data sparseness problem that is one of bottlenecks in the probabilistic-based approach might be overcome.
There are several open and commercial convertors from PDF to XML. MOBIPOCKET’s PDF2XML can analyze positions of all objects in PDF, font and line interval information [1]. Besides MOBIPOCKET’s PDF2XML, Matt’s pdf2xml[2], PDFtoRTF ofAdobe[3], and PDFBox of Apache Software Foundation are trying to convert PDF into XML. However, most previous work are focusing on only constructing the same view of PDF. Thus previous approach are notsufficient to reconstruct splitted sentences and words by lines, pages, tables.
The proposed approach aim to analyze texts in PDF and construct XML considering words and sentences reconstruction.In addition, each publishers and articles have their own styles, so spaces in a sheet for necessary information are somewhat different. The analysis of styles of each articles have been included in the proposed approach.

목차 Contents

제출문 ...1
보고서 초록 ...2
요약문 ...3
Summary ...8
Contents ...12
목차 ...13
표차례 ...14
그림차례 ...15
제1장 연구개발 과제의 개요 ...16
제2장 기술개발 현황 ...17
제3장 PDF를 XML로 변환하는 도구 ...18
제1절 출판사별 스타일 분석 ...18
제2절 규칙 기반 단어 재구성 ...20
제3절 규칙 기반 문장 재구성 ...21
제4장 단어 재구성 및 문장 재구성 성능 평가 ...23
제1절 단어 재구성 성능 평가 ...24
제2절 문장 재구성 성능 평가 ...24
제5장 결론 ...25
제1절 독창성 ...25
제2절 활용 가능성 ...25
제3절 향후 계획 ...26
제6장 참고문헌 ...27

표/그림 (2)

표 논문 분석의 예
표 본문 위치 분석을 위한 Mobipocket사의 PDF2XML의 결과

연구자의 다른 보고서 :

참고문헌 (25)

AI-Helper ※ AI-Helper는 오픈소스 모델을 사용합니다.

AI-Helper

안녕하세요, AI-Helper입니다. 좌측 "선택된 텍스트"에서 텍스트를 선택하여 요약, 번역, 용어설명을 실행하세요.
※ AI-Helper는 부적절한 답변을 할 수 있습니다.

선택된 텍스트

맨위로

과제명(ProjectTitle) :	-
연구책임자(Manager) :	-
과제기간(DetailSeriesProject) :	-
총연구비 (DetailSeriesProject) :	-
키워드(keyword) :	-
과제수행기간(LeadAgency) :	-
연구목표(Goal) :	-
연구내용(Abstract) :	-
기대효과(Effect) :	-

내보내기 구분	파일저장 인쇄 메일전송
구성항목	기본정보 상세정보 관리번호, 제목(한글), 저자명(한글), 발행일자, 전자원문, 초록(한글), 초록(영문) 관리번호, 제목(한글), 제목(영문), 저자명(한글), 저자명(영문), 주관연구기관(한글), 주관연구기관(영문), 발행일자, 총페이지수, 주관부처명, 과제시작일, 보고서번호, 과제종료일, 주제분류, 키워드(한글), 전자원문, 키워드(영문), 입수제어번호, 초록(한글), 초록(영문), 목차
저장형식	Text(ASCII format) Excel format
메일정보	받는사람 (필수) @ 보내는사람 (선택) @ 제목 내용 KISTI 검색결과 이메일 서비스
안내	총 건의 자료가 검색되었습니다. 다운받으실 자료의 인덱스를 입력하세요. (1-10,000) 검색결과의 순서대로 최대 10,000건 까지 다운로드가 가능합니다. 데이타가 많을 경우 속도가 느려질 수 있습니다.(최대 2~3분 소요) 다운로드 파일은 UTF-8 형태로 저장됩니다. 파일의 내용이 제대로 보이지 않을실 때는 웹브라우저 상단의 보기 -> 인코딩 -> 자동선택 여부를 확인하십시오. ~ Text(ASCII format) Excel format

연합인증

PDF 파일을 XML 파일로 변환하는 도구 개발
Conversion of PDF to XML-based Structural Information 원문보기