Regresi dan AI dalam praktik
| English | Bahasa Indonesia |
|---|---|
| regression/rɪˈɡreʃn/ | regresi |
| classification/ˌklæsɪfɪˈkeɪʃn/ | klasifikasi |
| linear regression/ˈlɪnɪə rɪˈɡreʃn/ | regresi linear |
| OCR/ˌəʊ siː ˈɑː/ | OCR |
Meramalkan nombor, bukan nama
- Tanya model "adakah e-mel ini spam?" dan ia mesti memilih daripada set jawapan tetap. Tanya "berapa harga rumah ini akan dijual?" dan tiada set untuk dipilih: jawapannya ialah nombor, dan tersilap seribu pound hampir betul.
- Itu adalah dua tugas berbeza, dan mencampurnya adalah kesilapan paling biasa dalam topik ini. Kedua-duanya adalah pembelajaran terarah; hanya bentuk jawapan yang berbeza.
- Pelajaran ini adalah regresi berbanding pengelasan, bagaimana regresi linear memilih garisnya, dan bagaimana produk sebenar menyambungkan model-model yang dilatih menjadi satu alur kerja.
Regresi dan pengelasan
- Pengelasan meramalkan kategori daripada set tetap: kucing atau anjing, spam atau bukan spam, mana-mana daripada sepuluh digit.
- Regresi meramalkan nombor pada skala berterusan: harga rumah, suhu esok, berapa lama perjalanan akan mengambil masa.
- Kedua-duanya adalah terarah: kedua-duanya belajar daripada contoh berlabel. Pilihan antara keduanya ditentukan oleh satu soalan: adakah jawapannya label atau nombor?
- Pembezaaan ini mengubah cara anda mengukur kejayaan. Pengklasifikasi betul atau salah; perengres tertentu jaraknya keluar, oleh itu fungsi kehilangan mereka berbeza.
Perbedaan antara regresi dan klasifikasi adalah bahwa regresi memprediksi:
Regresi menghasilkan angka kontinu (harga, suhu); klasifikasi menghasilkan kategori.
Regresi memprediksi angka kontinu (harga, suhu), sedangkan klasifikasi memprediksi kategori (kucing vs anjing).
Output angka = regresi; output kategori = klasifikasi — dua jenis utama prediksi terawasi.
Contoh bertutur: tugasan mana yang mana
- Meramalkan mana-mana daripada lima jenis pelanggan yang pembeli termasuk. Pengelasan: jawapannya adalah salah satu daripada set kategori tetap.
- Meramalkan berapa banyak pembeli itu akan membelanjakan bulan depan. Regresi: jawapannya ialah nombor, dan berada dekat dikira hampir betul.
- Meramalkan sama ada mesin akan gagal dalam minggu hadapan. Pengelasan: ya atau tidak. Meramalkan berapa hari sehingga ia gagal. Regresi.
- Data asas yang sama boleh memberi makan kedua-duanya. Baca soalan yang ditanya, bukan subjek materinya.
Cocokkan setiap tugas prediksi dengan jenisnya.
Data yang sama dapat digunakan untuk keduanya. Baca pertanyaannya: apakah ada label dari himpunan tetap, atau angka pada skala.
Regresi linear
- Regresi linear sesuaikan garis lurus, atau permukaan rata apabila terdapat beberapa input:
- Koefisien dipilih untuk mengminimumkan jumlah kuasa dua ralat antara ramalan garis dan nilai latihan sebenar.
- Dipangkatkan dua, kerana dua sebab yang diterima peperiksaan: ralat di atas dan di bawah garis kemudian tidak dapat saling membatalkan, dan ralat besar dihukum jauh lebih banyak daripada beberapa ralat kecil.

Garis yang meninggalkan jumlah jarak kuasa dua yang paling sedikit
Menyesuaikan garis regresi
Seret kontrol. Regresi linear menggambar garis lurus yang membuat jarak kuadrat ke titik data seminimal mungkin — lalu memprediksi angka untuk setiap input baru.
Regresi linear memilih koefisiennya untuk:
Garis/hyperplane disesuaikan agar perbedaan kuadrat dari titik data seminimal mungkin.
Mengapa regresi linear meminimalkan jumlah KESALAHAN KUADRAT alih-alih kesalahannya sendiri?
Kedua alasan diterima. Tanpa pengkuadratan, garis bisa memiliki kesalahan besar di atas dan di bawah namun tetap bernilai nol.
Apabila garis lurus adalah model yang tepat
- Gunakan regresi linear apabila hubungan nampak kira-kira linear dan anda mahu model yang boleh dibaca manusia: setiap koefisien mengatakan berapa banyak input itu penting, dan ke arah mana.
- Apabila data melengkung, idea yang sama masih berlaku dengan model yang berbeza: regresi polinomial, pokok keputusan, atau rangkaian saraf. Dalam setiap kes resipenya sama, pilih model, tentukan kehilangan, minimumkannya.
- Resipen ini adalah apa yang menghubungkan pelajaran ini dengan yang terakhir: penurunan kecerunan hanyalah bagaimana pengminimuman dilakukan apabila tiada formula untuk jawapannya.
AI dalam produk sebenar
- Sistem sebenar jarang menggunakan satu model. Mereka menyambungkan beberapa model yang dilatih menjadi satu alur kerja, masing-masing melakukan satu langkah.
- Pengenalan wajah di pintu: kamera menangkap wajah, pengenalan imej menukarkannya kepada perwakilan numerikal, dan itu dicocokkan dengan perwakilan orang berdaftar.
- Membaca papan tanda keras-keras untuk pelawat: pengenalan imej terletak teks, OCR menukar piksel kepada aksara, terjemahan mesin menukar perkataan, dan teks-ke-ucapan menghasilkan audio.
- Peperiksaan memberi senario dan bertanya model apakah yang digunakan, secara tertib. Namakan peringkat dan apa yang dihasilkannya untuk yang seterusnya.
Cocokkan setiap ide AI dengan artinya.
Pelatihan menyesuaikan model sekali; inferensi adalah prediksi cepat setiap kali pengguna berinteraksi.
Fitur "membaca tanda keras" biasanya merantai model manakah?
Beberapa model yang dilatih membentuk pipeline: temukan teks, ekstrak karakter, terjemahkan, lalu ucapkan.
Urutkan tahap-tahap aplikasi yang membaca tanda asing keras.
Beberapa model yang dilatih dirantai bersama, masing-masing menyerahkan outputnya ke berikutnya. Sebutkan tahap dan apa yang dihasilkan.
Contoh bertutur: latihan berbanding inferens
- Aplikasi telefon mengenali tumbuhan daripada foto serta-merta, namun melatih modelnya mengambil berminggu-minggu di atas banyak mesin. Jelaskan mengapa.
- Latihan menjalankan laluan maju dan mundur berulang kali merentasi set data berlabel yang sangat besar, menyesuaikan jutaan berat selama banyak epoch. Itulah yang mengambil berminggu-minggu.
- Inferensi, menggunakan model yang telah dilatih, adalah satu kali lemparan maju (forward pass) melalui jaringan yang bobotnya kini tetap: kalikan, tambahkan, aktifkan, lapisan demi lapisan, hanya sekali.
- Kecerdasan berada di dalam bobot-bobot yang dipelajari, itulah sebabnya model jadi cukup kecil dan cepat untuk dikirimkan ke ponsel.
Menggunakan model yang dilatih untuk membuat prediksi hanya memerlukan satu ____ pass.
Pelatihan mengulangi pass maju dan mundur melintasi dataset besar; inferensi menjalankan bobot tetap sekali, itulah sebabnya ia instan.
⟦⟧ Nilai yang sering terlewat
- Klasifikasi memberikan kategori, regresi memberikan angka. Keduanya bersifat terawasi; itu bukan perbedaannya.
- Regresi linear meminimalkan jumlah kuadrat kesalahan, bukan "total jarak". Sebutkan 'kuadrat', dan jelaskan alasannya.
- Jawaban pipeline harus memberikan tahap-tahapnya berurutan dan menjelaskan apa yang diserahkan oleh setiap tahap ke tahap berikutnya.
- Pelatihan adalah perulangan lemparan maju dan mundur; inferensi adalah satu kali lemparan maju. Jangan mendeskripsikan pelatihan ketika pertanyaan menanyakan penggunaan.
Anda telah memahaminya
- Klasifikasi memprediksi kategori, regresi memprediksi angka; keduanya bersifat terawasi, dan bentuk jawaban yang diminta soal menentukan mana yang dipilih.
- Regresi linear menyesuaikan $y = m_1x_1 + \ldots + c$ dengan meminimalkan jumlah kuadrat kesalahan, sehingga kesalahan tidak saling meniadakan dan kesalahan besar dihukum berat
- Data melengkung memerlukan model lain, tetapi resepnya tidak berubah: pilih model, tentukan fungsi kerugian (loss), lalu minimalkan fungsi tersebut
- Produk nyata menghubungkan beberapa model: pengenalan gambar, OCR, penerjemahan, dan teks-ke-ucapan; pelatihan melibatkan banyak lemparan maju dan mundur, sedangkan inferensi hanya satu kali lemparan maju