ประเภทการเรียนรู้ของเครื่องและการฝึก
| English | ไทย |
|---|---|
| machine learning/məˈʃiːn ˈlɜːnɪŋ/ | การเรียนรู้ของเครื่อง |
| backpropagation/ˌbækprəpəˈɡeɪʃn/ | การย้อนกลับการแพร่กระจาย |
| supervised learning/ˈsuːpəvaɪzd ˈlɜːnɪŋ/ | การเรียนรู้ภายใต้การควบคุม |
| classification/ˌklæsɪfɪˈkeɪʃn/ | การจำแนกประเภท |
| unsupervised learning/ʌnˈsuːpəvaɪzd ˈlɜːnɪŋ/ | การเรียนรู้โดยไม่มีการควบคุม |
| clusters/ˈklʌstəz/ | กลุ่ม |
| reinforcement learning/ˌriːɪnˈfɔːsmənt ˈlɜːnɪŋ/ | การเรียนรู้ด้วยการเสริมแรง |
| agent/ˈeɪdʒənt/ | เอเจนต์ |
| reward/rɪˈwɔːd/ | รางวัล |
| policy/ˈpɒlɪsi/ | นโยบาย |
| gradient descent/ˈɡreɪdɪənt dɪˈsent/ | gradient descent algorithm |
| loss function/lɒs ˈfʌŋkʃn/ | ฟังก์ชันความสูญเสีย |
| epoch/ˈiːpɒk/ | epoch training |
โปรแกรมที่สอนตัวเองเปิดเกมที่ไม่เคยมีมนุษย์เล่นมาก่อน
- AlphaGo Zero ถูกกำหนดกฎของเกมโกะออกมาเพียงอย่างเดียว ไม่มีเกมมนุษย์ ไม่มีหนังสือเปิดเกม ไม่มีคำแนะนำ มันเล่นกับตัวเอง เริ่มจากการเดินสุ่ม
- ภายในสามวัน มันสามารถเหนือกว่าเวอร์ชันที่เคยชนะแชมป์โลกได้ ระหว่างทางมันค้นพบทฤษฎีเปิดเกมของมนุษย์มาหลายศตวรรษอีกครั้ง จากนั้นก็ทิ้งบางส่วนออกเพราะถือว่าด้อยกว่า
- มันเรียนรู้จากตัวเลขเดียวหลังแต่ละเกม: ชนะหรือแพ้ นั่นเป็นรูปแบบการเรียนรู้ที่แตกต่างกันอย่างสิ้นเชิงจากการถูกแสดงภาพที่มีป้ายกำกับนับล้าน
- บทเรียนนี้คือสามแนวคิดหลักของ การเรียนรู้ของเครื่อง, ข้อมูลที่แต่ละแบบต้องการ, และ น้ำหนัก ของเครือข่ายถูกเปลี่ยนอย่างไรโดย backpropagation
การเรียนรู้แบบมีผู้ควบคุม
- การเรียนรู้แบบมีผู้ควบคุม ฝึกบนข้อมูลที่มี ป้ายกำกับ: ภาพถ่ายที่มีแท็กว่า "แมว" หรือ "สุนัข", อีเมลที่ระบุว่าเป็นสแปมหรือไม่, บ้านที่มีราคาขาย
- โมเดลเรียนรู้การแมปจาก อินพุตไปยังป้ายกำกับ แล้วจึงได้รับอินพุตที่未曾เห็นมาก่อนและถูกขอให้สร้างป้ายกำกับ
- แบ่งออกเป็น การจัดประเภท, ที่เอาต์พุตเป็นหมวดหมู่, และ การถดถอย, ที่เอาต์พุตเป็นตัวเลข
- ค่าใช้จ่ายของมันคือป้ายกำกับ: ต้องมีคนสร้างมันขึ้นมา ซึ่งสำหรับภาพหนึ่งล้านภาพคืองานของมนุษย์จำนวนมาก

ตัวอย่างที่มีป้ายกำกับเข้า, โมเดลออก, จากนั้นอินพุตที่ไม่มีป้ายกำกับ
การเรียนรู้ภายใต้การควบคุมใช้:
การเรียนรู้ภายใต้การควบคุมฝึกบนตัวอย่างที่มีป้าย (เช่น ภาพที่มีป้ายแมว/สุนัข)
การเรียนรู้แบบไม่มีผู้ควบคุม
- การเรียนรู้แบบไม่มีผู้ควบคุม ได้รับข้อมูลที่มี ไม่มีป้ายกำกับ และถูกขอให้หาโครงสร้างในนั้น
- การใช้ทั่วไปที่สุดคือ การจัดกลุ่ม: กลุ่ม INTO คลัสเตอร์ ของรายการที่คล้ายกัน เช่น ลูกค้าที่ซื้อสิ่งของคล้ายกัน โดยไม่มีใครตัดสินใจล่วงหน้าว่ากลุ่มควรเป็นอย่างไร
- นั่นคือจุดแข็งและจุดอ่อนของมัน: มันสามารถค้นพบการจัดกลุ่มที่ไม่มีใครคาดถึงได้ และมันไม่สามารถบอกคุณได้ว่าการจัดกลุ่มนั้น หมายถึงอะไร
การเรียนรู้โดยไม่มีการควบคุมใช้เพื่อ:
เมื่อไม่มีป้าย, การเรียนรู้โดยไม่มีการควบคุมค้นหารูปแบบ/กลุ่มในข้อมูล
การเรียนรู้แบบเสริมแรง
- การเรียนรู้แบบเสริมแรง มี เอเจนต์ ทำการกระทำในสภาพแวดล้อม การกระทำแต่ละอย่างจะเปลี่ยนสถานะและคืนค่า รางวัล ซึ่งอาจเป็นศูนย์เป็นเวลานาน
- เอเจนต์เรียนรู้ นโยบาย, กลยุทธ์ในการเลือกการกระทำ, ที่เพิ่ม ผลตอบแทนรวมตามเวลา ให้สูงสุด มันเรียนรู้โดยการ ลองผิดลองถูก, โดยไม่มีตัวอย่างที่มีป้ายกำกับเลย
- เหมาะกับปัญหาที่เป็น ลำดับของการตัดสินใจ ที่การเคลื่อนไหวที่ถูกต้องจะถูกเปิดเผยเฉพาะโดยผลลัพธ์สุดท้าย: เกม, การควบคุมหุ่นยนต์, รถขับอัตโนมัติ นั่นคือกรณีของ AlphaGo Zero พอดี
ในการเรียนรู้ด้วยการเสริมแรง, เอเจนต์เรียนรู้โดย:
เอเจนต์พยายามกระทำ, ได้รับรางวัล, และเรียนรู้นโยบายที่เพิ่มรางวัลระยะยาว
ในการเรียนรู้ด้วยการเสริมแรง เอเจนต์เรียนรู้ ____ ที่เพิ่มผลรวมรางวัลตามเวลา
มันเรียนรู้จากการลองผิดลองถูกจากรางวัล โดยไม่มีตัวอย่างที่มีป้ายเลย นี่คือเหตุผลว่ามันเหมาะสำหรับการตัดสินใจเป็นลำดับขั้นตอน
ตัวอย่างการคำนวณ: เลือกแนวคิด
- การสแกนทางการแพทย์หนึ่งหมื่นครั้ง โดยแต่ละครั้งมีการติดฉลากโดยแพทย์ว่าเป็นก้อนเนื้องอกหรือไม่ ใช้เพื่อฝึกระบบให้ระบุการสแกนใหม่ การเรียนรู้ภายใต้การควบคุม: ข้อมูลมีฉลากและงานคือการเรียนรู้จากอินพุตไปยังฉลาก โดยเฉพาะการจำแนกประเภท
- ร้านค้าต้องการทราบว่าลูกค้าของตนแบ่งเป็นกลุ่มธรรมชาติหรือไม่ โดยไม่ตัดสินใจกลุ่มล่วงหน้า การเรียนรู้แบบไม่มีผู้ควบคุม: ไม่มีป้ายกำกับ, และ任务是หาโครงสร้าง, โดยเฉพาะการจัดกลุ่ม
- แขนหุ่นยนต์ต้องเรียนรู้ในการวางชิ้นส่วน, ที่ตัดสินโดยความสำเร็จของการพยายามแต่ละครั้งเท่านั้น การเรียนรู้แบบเสริมแรง: เอเจนต์, ลำดับของการกระทำ, และผลตอบแทนแทนป้ายกำกับ
- ชื่อบนวคิดจากนั้นอธิบายเหตุผลจาก ข้อมูล: มีป้ายกำกับ, ไม่มีป้ายกำกับ, หรือสัญญาณผลตอบแทน
ห้องปฏิบัติการประเภทการเรียนรู้ของ AI
จำแนกตัวอย่าง AI ตามประเภทการเรียนรู้หรือประเด็นที่เกี่ยวข้อง
จับคู่แนวคิด ML แต่ละแบบกับข้อมูลที่สอดคล้องกัน
Supervised = ป้าย; Unsupervised = ไม่มีป้าย; Reinforcement = ข้อเสนอแนะเรื่องรางวัล
จับคู่สถานการณ์แต่ละอย่างกับแนวคิดการเรียนรู้ของเครื่องที่ต้องการ
ฉลาก, ไม่มีฉลาก หรือรางวัล ข้อมูลกำหนดกรอบแนวคิด ไม่ใช่ความยากของงาน
การฝึกโดย backpropagation
- การฝึกคือการปรับ น้ำหนัก เพื่อให้เอาต์พุตของเครือข่ายตรงกับเป้าหมาย วิธีคือ backpropagation กับ gradient descent
- Forward pass: ส่งอินพุตผ่านเครือข่ายและรับเอาต์พุต คำนวณความผิดพลาด โดยใช้ loss function, ซึ่งวัดว่าเอาต์พุตห่างจากเป้าหมายแค่ไหน
- Backward pass: กระจายความผิดพลาดย้อนกลับผ่านเลเยอร์เพื่อหา gradient ของน้ำหนักแต่ละตัว นั่นคือว่าน้ำหนักนั้นมีส่วนร่วมกับความผิดพลาดเท่าไหร่
- อัปเดต: เปลี่ยนน้ำหนักแต่ละตัวด้วยก้าวเล็กๆ ตัดกับ gradient ขนาดก้าวคือ learning rate

ลงเขา, ก้าวเล็กๆ的一步ต่อหนึ่ง
Backpropagation ฝึกเครือข่ายโดย:
ความผิดพลาดไหลย้อนกลับจากเอาต์พุทผ่านเครือข่าย (กฎโซ่) ทำให้ได้ gradient ของทุกน้ำหนัก จากนั้นน้ำหนักจะเลื่อนลงตามทางลัด
เรียงลำดับขั้นตอนการฝึก Backpropagation หนึ่งรอบ
Forward, error, backward, update, ทำซ้ำหลาย epoch จนกว่าความผิดพลาดจะลดลงจนคงที่
Epochs และทำไม Learning Rate จึงสำคัญ
- การวนรอบผ่านชุดข้อมูลฝึกสอนทั้งหมดหนึ่งครั้งเรียกว่า epoch การฝึกจะซ้ำหลายรอบจนกว่าค่าความผิดพลาดจะหยุดลดลง
- หาก Learning rate ใหญ่ เกินไป จะข้ามจุดต่ำสุดและทำให้ค่าความผิดพลาดกระโดดไปมา; ถ้า เล็ก เกินไป การฝึกจะใช้เวลานานเกินจำเป็น
- หลังการฝึกแล้ว การใช้โมเดลเป็นการ forward pass เพียงอย่างเดียว นี่คือเหตุผลที่เครือข่ายที่ถูกฝึกแล้วตอบคำถามได้ทันที แม้ว่าการฝึกจะใช้เวลาถึงวัน
ในการหาจุดต่ำสุด by gradient descent learning rate กำหนดขนาดก้าวของการอัปเดตน้ำหนัก — ใหญ่เกินไปจะข้ามจุดต่ำสุด过小ทำให้การฝึกช้า
Backpropagation หาค่า gradient ของน้ำหนัก; learning rate เป็นตัวคูณว่าน้ำหนักจะเคลื่อนที่ไปตาม gradient นั้น多远
ข้อใดถูกต้องเกี่ยวกับการฝึก? เลือก ทั้งหมด ที่ตรง
learning rate คือขนาดของการอัปเดตน้ำหนัก นั่นคือเหตุผลที่การฝึกอาจใช้เวลาหลายวัน แต่การทำ forecast ใช้เวลาเพียงมิลลิวินาที
คะแนนที่หลุดหายไป
- ยืนยัน Paradigm จาก ข้อมูล: มีป้ายกำกับหมายถึง supervised, ไม่มีป้ายกำกับหมายถึง unsupervised, มีสัญญาณรางวัลหมายถึง reinforcement
- Reinforcement learning ไม่มี labels การเรียก reward ของมันว่า label คือความสับสนแบบคลาสสิก
- Backpropagation คือ forward, error, backward, update, ทำซ้ำ การบอกแค่ว่า "มันปรับน้ำหนัก" เป็นเพียงคำตอบครึ่งเดียว
- Learning rate คือขนาดของแต่ละก้าว ไม่ใช่ความเร็วในการฝึกหรือจำนวน epoch
คุณเข้าใจแล้ว
- supervised เรียนรู้จาก input ไปหา label จาก labelled data เพื่อ classification หรือ regression · unsupervised ค้นหารูปแบบเช่น clusters ใน unlabelled data · reinforcement มี agent ที่เรียนรู้ policy จาก rewards ผ่านการลองผิดลองถูก
- เลือก paradigm จากสิ่งที่ข้อมูลให้มา ไม่ใช่จากความยากของงาน
- backpropagation: forward pass หนึ่งครั้ง, ค่า error จาก loss function, backward pass ที่ให้ gradient ของแต่ละ weight, แล้วทำการอัปเดตขนาดที่กำหนดโดย learning rate
- การฝึกทำซ้ำหลาย epochs; การใช้โมเดลที่ถูกฝึกแล้วเป็นการ forward pass ครั้งเดียว