Giter Site home page Giter Site logo

pythainlp / thaigov-corpus Goto Github PK

View Code? Open in Web Editor NEW
18.0 3.0 8.0 81.18 MB

โครงการเก็บรวบรวมข่าวสารจากเว็บไซต์รัฐบาลไทย

Home Page: https://pythainlp.github.io/thaigov-corpus/

Python 58.00% Jupyter Notebook 42.00%
corpus thai thai-language thai-nlp thailand

thaigov-corpus's Introduction

ThaiGov corpus

HuggingFace Dataset: pythainlp/thaigov-corpus

English

  • Data from Thai government website. https://www.thaigov.go.th
  • This part of PyThaiNLP Project.
  • Compiled by Mr.Wannaphong Phatthiyaphaibun
  • License Dataset is public domain.

Data format

  • 1 file, 1 news, which is extracted from 1 url.
topic
(Blank line)
content
content
content
content
content
(Blank line)
ที่มา (URL source) : http://www.thaigov.go.th/news/contents/details/NNN

Thai

  • เป็นข้อมูลที่รวบรวมข่าวสารจากเว็บไซต์รัฐบาลไทย https://www.thaigov.go.th
  • โครงการนี้เป็นส่วนหนึ่งในแผนพัฒนา PyThaiNLP
  • รวบรวมโดย นาย วรรณพงษ์ ภัททิยไพบูลย์
  • ข้อมูลที่รวบรวมในคลังข้อความนี้เป็นสาธารณสมบัติ (public domain) ตามพ.ร.บ.ลิขสิทธิ์ พ.ศ. 2537 มาตรา 7 (สิ่งต่อไปนี้ไม่ถือว่าเป็นงานอันมีลิขสิทธิ์ตามพระราชบัญญัตินี้ (1) ข่าวประจำวัน และข้อเท็จจริงต่างๆ ที่มีลักษณะเป็นเพียงข่าวสารอันมิใช่งานในแผนกวรรณคดี แผนกวิทยาศาสตร์ หรือแผนกศิลปะ [...] (3) ระเบียบ ข้อบังคับ ประกาศ คำสั่ง คำชี้แจง และหนังสือตอบโต้ของกระทรวง ทบวง กรม หรือหน่วยงานอื่นใดของรัฐหรือของท้องถิ่น [...])

สามารถติดตามประวัติการแก้ไขคลังข้อความนี้ได้ผ่านระบบ Git

จำนวนข่าว

  • วันเริ่มต้นโครงการ 14 ก.พ. 2561
  • รวบรวมครั้งล่าสุด 01.50 น. วันที่ 18 มีนาคม พ.ศ.2563

รูปแบบข้อมูล

  • 1 ไฟล์ 1 ข่าว ซึ่งดึงมาจาก 1 url
หัวเรื่อง
(บรรทัดว่าง)
เนื้อความ
เนื้อความ
เนื้อความ
เนื้อความ
เนื้อความ
(บรรทัดว่าง)
ที่มา : http://www.thaigov.go.th/news/contents/details/NNN

รายละเอียดชื่อไฟล์

  • ชื่อหมวดหมู่_จำนวนที่ของข่าว.txt
  • มีโฟลเดอร์ 1 - 24 (ไม่มีโฟลเดอร์ที่ 13)

Script

  • run.py สำหรับเก็บข้อมูลจากหน้าเว็บ โดยจะดึงหน้าเว็บจาก url http://www.thaigov.go.th/news/contents/details/NNN โดยที่ NNN คือเลขจำนวนเต็ม
    • เปลี่ยนค่าตัวแปร i ในไฟล์เป็นเลขที่ต้องการเริ่มเก็บ
  • clean.py สำหรับทำความสะอาดข้อมูลเบื้องต้น โดยจะลบช่องว่างหน้าและท้ายบรรทัด ลบบรรทัดว่าง
    • clean.py ชื่อไฟล์
    • clean.py ชื่อไฟล์1 ชื่อไฟล์2
    • clean.py *.txt

We build Thai NLP.

PyThaiNLP

thaigov-corpus's People

Contributors

bact avatar wannaphong avatar

Stargazers

 avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar

Watchers

 avatar  avatar  avatar

Recommend Projects

  • React photo React

    A declarative, efficient, and flexible JavaScript library for building user interfaces.

  • Vue.js photo Vue.js

    🖖 Vue.js is a progressive, incrementally-adoptable JavaScript framework for building UI on the web.

  • Typescript photo Typescript

    TypeScript is a superset of JavaScript that compiles to clean JavaScript output.

  • TensorFlow photo TensorFlow

    An Open Source Machine Learning Framework for Everyone

  • Django photo Django

    The Web framework for perfectionists with deadlines.

  • D3 photo D3

    Bring data to life with SVG, Canvas and HTML. 📊📈🎉

Recommend Topics

  • javascript

    JavaScript (JS) is a lightweight interpreted programming language with first-class functions.

  • web

    Some thing interesting about web. New door for the world.

  • server

    A server is a program made to process requests and deliver data to clients.

  • Machine learning

    Machine learning is a way of modeling and interpreting data that allows a piece of software to respond intelligently.

  • Game

    Some thing interesting about game, make everyone happy.

Recommend Org

  • Facebook photo Facebook

    We are working to build community through open source technology. NB: members must have two-factor auth.

  • Microsoft photo Microsoft

    Open source projects and samples from Microsoft.

  • Google photo Google

    Google ❤️ Open Source for everyone.

  • D3 photo D3

    Data-Driven Documents codes.