Pertanyaan yang Sering Diajukan
Automatically translated. View the original in English.
Pertanyaan yang Sering Diajukan
Di mana saya dapat menemukan detail penggunaan API dan endpoint?
Silakan merujuk ke bagian endpoint API dalam dokumentasi kami untuk informasi lebih lengkap.
Pengaturan jaringan dan sertifikat apa yang diperlukan?
Autentikasi bersifat token-based. Anda dapat menemukan semua detail tentang hostname dan cara menggunakan API dalam dokumentasi kami.
Contoh:
curl -X POST 'https://api.elsanow.io/api/v1/score_audio_plus' \
-H 'Content-Type: multipart/form-data' \
-H 'Accept: application/json' \
-H 'Authorization: Bearer <TOKEN>' \
-F 'api_plan="premium"' \
-F 'return_json="true"' \
-F 'audio_file=@"/path/to/file"'
Contoh tambahan tersedia di bagian API dalam dokumentasi.
Bagaimana cara mendapatkan dan menggunakan kunci atau token API?
API token akan dibuat oleh kami setelah NDA ditandatangani. Harap beritahu kami ketika hal ini selesai, dan kami akan menyediakan token tersebut. Petunjuk penggunaan diuraikan dalam dokumentasi.
Apa struktur dan batasan permintaan serta respons API?
Anda dapat menemukan struktur permintaan dan respons secara lengkap, termasuk parameters dan limitations, dalam dokumentasi API.
Apakah tersedia sandbox, dan apakah saya memerlukan akun uji coba?
Saat ini kami tidak menyediakan lingkungan staging.
Apakah tersedia dasbor atau log untuk pemantauan dan debugging?
Dasbor customer-facing tersedia untuk memberikan visibilitas ke dalam permintaan dan aktivitas. Antarmuka berbasis Retool ini memungkinkan pengguna melacak penggunaan mereka untuk panggilan API yang bersifat scripted maupun unscripted.
Apakah API kami saat ini mendukung, atau dapat diintegrasikan dengan, solusi RAG?
Meskipun API kami tidak mengimplementasikan solusi RAG (Retrieval-Augmented Generation) secara native, API ini tentu saja dapat diintegrasikan ke dalam alur kerja RAG. Layanan kami berfokus pada analisis aliran audio, dan hasilnya dapat digunakan sebagai input untuk sistem RAG atau pipeline lain yang mendapat manfaat dari konteks yang diperkaya dari audio. Untuk memberikan jawaban yang lebih tepat atau menyarankan pendekatan integrasi yang optimal, harap bagikan lebih banyak detail tentang kasus penggunaan yang dimaksud pelanggan atau arsitekturnya.
Berapa bandwidth yang diperlukan untuk fitur berbicara AI yang lancar?
Saat ini, satu-satunya persyaratan terkait bandwidth yang kami berikan adalah yang tercantum dalam dokumentasi API kami. Persyaratan ini berlaku terlepas dari bagaimana fitur berbicara AI digunakan atau diintegrasikan. Jika Anda dapat berbagi sedikit lebih banyak tentang kasus penggunaan spesifik Anda, kami akan dengan senang hati memberikan rekomendasi yang lebih tepat.
Apakah mungkin untuk mengidentifikasi alamat IP mana yang digunakan untuk mengirim setiap chunk?
Saat ini, kami tidak menyimpan informasi apa pun tentang asal permintaan API, seperti alamat IP. Ini berarti kami tidak dapat menentukan IP mana yang digunakan untuk mengirim setiap chunk. Log kami berfokus pada metadata permintaan yang relevan dengan fungsionalitas layanan, tetapi tidak menyertakan detail jaringan tingkat origin-level.
Apa saja parameter di bagian respons "utterance"?
Parameter di bagian respons utterance adalah:
nativeness_score: Skor kealamian yang dicapai pengguna untuk keseluruhan utterance, pada skala 0–100.
nativeness_score_partial: Skor ini mencerminkan kealamian pengguna pada subset kata yang benar-benar diucapkan dengan skor minimum
25%.decision: String yang menunjukkan kemampuan pengguna dalam mengucapkan utterance, berdasarkan
nativeness_score. Nilai yang mungkin:correct,almost_correct, atauincorrect.
Catatan: Sementara nativeness_score mempertimbangkan semua kata dalam utterance (termasuk yang tidak diucapkan pengguna), nativeness_score_partial hanya berfokus pada kata-kata yang diucapkan pengguna, meskipun memiliki skor rendah.
Contoh: Jika utterance adalah "Hello ELSA" dan pengguna hanya mengucapkan "Hello," nativeness_score_partial hanya akan mempertimbangkan skor "Hello" (dengan asumsi melebihi 25%), sementara nativeness_score akan memperhitungkan semua kata, termasuk yang tidak diucapkan (misalnya, "ELSA," dengan skor rendah atau nol).
Untuk detail lebih lanjut, lihat dokumentasi API.
Apa saja parameter di bagian respons "words"?
Parameter di bagian respons words adalah:
nativeness_score: Skor kealamian (
0–100) untuk pengucapan kata individual.decision: Penilaian kemampuan berdasarkan
nativeness_score, dengan nilai yang mungkin adalahcorrect,almost_correct, atauincorrect.
Untuk detail lebih lanjut, lihat dokumentasi API.
Apa saja parameter di bagian respons "word_stress"?
Parameter di bagian respons word_stress adalah:
- decision: Menunjukkan apakah pengguna memberi tekanan pada suku kata dengan benar, dengan nilai yang mungkin adalah
correctatauincorrect.
Untuk detail lebih lanjut, lihat dokumentasi API.
Apa saja parameter di bagian respons "phonemes"?
Parameter di bagian respons phonemes adalah:
nativeness_score: Skor untuk fonem dalam entri ini, pada skala
0–100.decision: Menunjukkan akurasi pengucapan fonem, dengan nilai yang mungkin adalah
correct,warning, atauerror.
Untuk detail lebih lanjut, lihat dokumentasi API.
Cara Kerja Perhitungan Chunk
Sebuah chunk berdurasi 15 detik. Namun, jumlah sebenarnya dari chunk dihitung menggunakan rumus:
num_chunks = ceil(duration / chunk_size)
Jadi, misalnya, input audio 17 detik menghasilkan 2 chunk (bukan 1,13), karena operasi ceiling.
Selain itu:
Jika total durasi sedikit melebihi durasi maksimum yang diizinkan API, durasi tersebut dipotong agar sesuai dengan batas. Ini mencegah permintaan kedua dipicu hanya karena beberapa frame tambahan.
Kami juga memangkas keheningan dan kebisingan dari awal atau akhir audio bila berlaku, yang dapat lebih mempengaruhi jumlah chunk akhir.
Faktor-faktor ini menjelaskan mengapa num_standard_chunks mungkin tidak selalu selaras persis dengan num_secs / 15.
Bagaimana Speech Analyzer mendeteksi kesalahan tata bahasa?
Kami mendeteksi kesalahan tata bahasa tetapi hanya mengoreksi yang kami sangat yakin dalam konteksnya. Secara khusus, koreksi yang diusulkan harus memiliki skor kepercayaan setidaknya 80% sebelum diterapkan. Pendekatan ini memastikan bahwa kami menghindari saran perubahan yang tidak relevan dalam kasus ambiguitas tata bahasa.
Apa Batas Maksimum Unggahan File Audio
Byte
Ukuran file maksimum yang diizinkan untuk diunggah adalah 100MB. Jika Anda perlu mengunggah file yang lebih besar dari batas ini, harap hubungi tim dukungan kami untuk bantuan.
Menit
Panjang file audio maksimum untuk permintaan unscripted dengan flag sync yang disetel ke True yang diizinkan untuk diunggah adalah 15 menit.
Scripted: Tidak Terbatas
Unscripted:
sync = True => 15 menit
sync = False => 12 menit
Apakah skor pengucapan dan intonasi saling berkaitan?
Tidak ada ketergantungan langsung antara pronunciation_score dan intonation_score. Namun, kami biasanya hanya menghitung intonation_score untuk input yang lebih panjang, seperti kalimat lengkap. Akibatnya, pengguna yang benar-benar pemula dan cenderung menghasilkan ucapan yang sangat pendek atau tidak lengkap mungkin tidak menerima intonation_score. Hal ini mungkin memberikan kesan adanya hubungan, tetapi itu lebih mencerminkan panjang dan kualitas input daripada ketergantungan antara skor itu sendiri.
Bagaimana keputusan pengucapan dan intonasi dievaluasi?
Atribut keputusan ini didasarkan pada skor CEFR-level yang sesuai (misalnya, pronunciation_cefr, intonation_cefr). Contoh pemetaan adalah sebagai berikut:
Correct: Level CEFR C1 atau C2
Warning: Level CEFR B1 atau B2
Incorrect: Level CEFR A1 atau A2
Mengapa beberapa panggilan API unscripted tidak memiliki skor EPS atau transkrip?
Untuk mendapatkan hasil dengan metrik, pastikan panjang audio melebihi 20 detik.
Apakah level pengucapan dipetakan ke aksen native AS/Inggris?
Kami mengikuti standar global (CEFT, IELTS, TOEFL), di mana kami tidak memberikan penalti kepada individu karena berbicara dengan aksen asli mereka, melainkan berfokus pada kejelasan berbicara. Meskipun mungkin ada sedikit variasi untuk pengguna dengan aksen yang lebih kental, perbedaannya biasanya tetap berada dalam band yang sama.
Mengapa metrik tata bahasa dan kosakata tidak ada dalam hasil API unscripted?
Metrik ini memiliki ambang batas minimum. Jika Anda ingin mendapatkan hasil untuk metrik tata bahasa dan kosakata dalam API unscripted meskipun ada ambang batas minimum ini, cukup tambahkan flag -F force_grammar_vocab=True. Namun, penting untuk dicatat bahwa hasil ini mungkin tidak seakurat hasil yang memenuhi ambang batas minimum.
Standar apa yang kami gunakan untuk explainability?
Model kami bersifat proprietary, dan kami tidak mengungkapkan arsitektur atau mekanisme internal yang tepat. Meskipun kami mengutamakan transparansi dalam hal kualitas output dan tolok ukur kinerja, saat ini kami tidak mengikuti standar publik untuk explainability model.
Bagaimana kami menghitung skor Keseluruhan?
Skor keseluruhan merupakan kombinasi dari lima metrik: pronunciation, intonation, fluency, grammar, dan vocabulary. Terkadang, jika kami tidak memberikan skor kosakata atau tata bahasa karena rekaman terlalu singkat, kami masih dapat memberikan skor keseluruhan berdasarkan metrik lain yang tersedia.
Bagaimana skor dihitung?
Cara kami menghitung ELSA Score dan memetakannya ke IELTS dikembangkan secara internal. Parameter untuk menghitung skor ELSA dapat berubah dari waktu ke waktu, begitu pula pemetaan ke IELTS. Dari waktu ke waktu kami mengevaluasi ulang dan mengubahnya sedikit.
Bagaimana bobot grammar range dan errors dalam skor Grammar?
Proporsi aspek-aspek ini bergantung pada jenis rekaman. Untuk percakapan kasual, proporsinya kira-kira 60% kesalahan tata bahasa dan 40% grammar range; untuk pengaturan seperti ujian, proporsinya kira-kira 50% kesalahan tata bahasa dan 50% grammar range. Penting untuk dicatat bahwa angka-angka ini disesuaikan ketika kami memiliki data baru.
Bagaimana kami menghitung skor pengucapan?
Skor pengucapan didasarkan pada seberapa akurat Anda mengucapkan bunyi-bunyi bahasa Inggris dalam setiap kata yang dikenali oleh ELSA dalam rekaman Anda. Jumlah dan tingkat keparahan salah pengucapan yang disorot akan berkontribusi pada skor pengucapan.
Bagaimana kami menghitung skor kelancaran?
Skor Kelancaran merupakan kombinasi kinerja Anda dalam Pace, Pausing, dan Hesitations. Menjaga Pace yang baik, Pausing hanya di tempat yang wajar, dan mengurangi jumlah kata pengisi serta pengulangan akan berkontribusi pada skor Kelancaran yang baik.
Bagaimana kami menghitung skor intonasi?
Skor intonation mempertimbangkan naik turunnya nada suara Anda dan seberapa baik Anda memberikan penekanan pada kata-kata dalam kalimat.
Bagaimana kami menghitung skor kosakata?
Skor Vocabulary terutama didasarkan pada estimasi CEFR levels dari kata-kata dan ekspresi dalam ucapan pengguna.
Catatan: Kami mengeluarkan distribusi CEFR raw sebagai umpan balik (persentase kata di setiap level A1-C2), tetapi skor keseluruhan dihitung oleh algoritma statistik yang memetakan distribusi ini ke nilai 0-100 (di mana 100% sesuai dengan penggunaan kosakata seperti penutur asli). Skor vocabulary hanya dikembalikan jika teks (saat ini) terdiri dari 75 kata atau lebih.
Bagaimana kami menghitung skor tata bahasa?
Skor grammar dihitung berdasarkan output dari modul deteksi dan koreksi kesalahan tata bahasa yang dikombinasikan dengan grammar range yang teridentifikasi. Deteksi dan koreksi kesalahan tata bahasa mengidentifikasi kesalahan tata bahasa dalam teks dan menghasilkan skor kesalahan. Modul grammar range mengidentifikasi semua struktur tata bahasa dan menghitung skor range berdasarkan 5 struktur tingkat tertinggi yang berhasil digunakan dalam rekaman. Skor grammar hanya dikembalikan jika teks (saat ini) terdiri dari 50 kata atau lebih.
Apa volume dan keberagaman data pelatihan?
Meskipun kami tidak mengungkapkan detail implementasi atau struktur internal model kami, kami berkomitmen untuk memastikan bahwa output dapat diinterpretasikan dan sesuai dengan ekspektasi pengguna. Bila berlaku, kami menyediakan score breakdowns atau umpan balik tingkat category-level yang mencerminkan logika evaluasi model secara transparan dan dapat ditindaklanjuti oleh pengguna akhir. Secara internal, kami mengikuti praktik validasi yang kuat dan kinerja tolok ukur untuk memastikan konsistensi dan keadilan dalam keputusan model.
Seberapa akurat model tersebut, dan seberapa sering model dilatih ulang?
Secara historis kami belum pernah berbagi angka akurasi terperinci secara publik. Sebaliknya, kami biasanya menyampaikan bahwa model kami mengungguli pesaing berdasarkan tolok ukur internal kami. Mengenai frekuensi pelatihan ulang model, hal ini sangat bervariasi tergantung pada model. Sementara beberapa model tidak berubah dalam jangka waktu yang lama, pendekatan keseluruhan kami secara konsisten adalah mengumpulkan data pengguna (di mana diizinkan) dan secara iteratif meningkatkan kinerja model dari waktu ke waktu.
Apa risiko bias atau diskriminasi?
AI ELSA dirancang secara khusus untuk mendukung penutur bahasa Inggris non-native. Dengan melatih pada ribuan jam bahasa Inggris beraksen, yang bersumber dari penutur bahasa kedua (L2) yang nyata, ELSA berada dalam posisi unik untuk mengenali dan mengatasi tantangan pengucapan para pelajar. Pendekatan inklusif ini membantu mengurangi bias aksen dan memastikan para pelajar merasa dilihat, didukung, dan diberdayakan sejak hari pertama.
Apa bobot "intonasi" dalam model, dan bagaimana hal itu ditangani secara etis?
Baik kontennya scripted maupun unscripted, tingkat deteksi adalah sekitar 20%.
Mengenai pertanyaan tentang penanganan hal ini secara etis, mungkin kekhawatirannya berkaitan dengan potensi deteksi pola ucapan individu atau risiko seputar pemalsuan suara.
Untuk memperjelas: Sistem analisis ucapan dan intonasi kami dirancang untuk bersifat agnostic terhadap karakteristik suara pengguna yang dapat diidentifikasi. Kami tidak melakukan identifikasi pembicara, dan kami juga tidak menggunakan data audio untuk tujuan tersebut. Fokus kami tetap semata-mata pada penilaian pengucapan dan prosodi dalam konteks pembelajaran bahasa.
Bagaimana penggunaan layanan API dilacak?
Kami menawarkan dasbor pelacakan penggunaan melalui Retool yang memberikan visibilitas ke dalam konsumsi API harian secara keseluruhan. Ini mencakup metrik seperti jumlah karakter yang diproses, jumlah permintaan (dibagi berdasarkan penggunaan scripted dan unscripted), tier paket, waktu pemrosesan, jumlah chunk, dan jumlah permintaan ASR. Selain itu, kami menyediakan tampilan per-permintaan yang terperinci, yang mencakup tier, panjang audio, dan teks yang ditranskripsikan untuk setiap permintaan individual. Dasbor ini dapat berfungsi sebagai cara yang andal untuk memantau dan mengelola penggunaan.
Mengapa tidak ada skor tata bahasa atau kosakata untuk audio singkat?
Dalam kasus audio singkat, wajar jika skor tata bahasa dan kosakata mungkin tidak dihasilkan. Sistem kami biasanya memerlukan minimum sekitar 50 kata untuk evaluasi tata bahasa dan 75 kata untuk analisis kosakata guna menghasilkan hasil yang andal dan bermakna.
Untuk hasil terbaik, kami merekomendasikan pengiriman sampel audio yang lebih panjang. Ini memungkinkan mesin penilaian kami untuk menganalisis pola dan memberikan umpan balik yang lebih komprehensif.
Bagaimana skor dipetakan?
CEFRIELTSTOEFL SpeakingRentang PTEA11.50-110-10A122-310-10A12.54-510-10A236-710-11A23.58-912-15B1410-1116-19B14.512-2320-25B1514-1526-31B25.516-1732-40B2618-1941-50B26.520-2251-60C1723-2361-70C17.524-2571-79C1826-2780-86C28.528-2987-89C2930-3090-90
Referensi:
Mengapa permintaan saya diblokir (403 Forbidden)?
Permintaan Anda kemungkinan diblokir oleh Cloudflare karena satu atau lebih pemeriksaan keamanan yang dipicu oleh Managed Ruleset mereka. Aturan-aturan ini dirancang untuk mendeteksi dan mencegah lalu lintas yang berpotensi berbahaya atau mencurigakan — meskipun permintaan tersebut tidak berbahaya dalam konteks spesifik Anda. Beberapa alasan umum mengapa permintaan mungkin diblokir meliputi:
Nama file atau ekstensi yang mencurigakan: Misalnya, file yang berakhiran ".php", ".asp", atau format yang dapat dieksekusi lainnya sering diblokir saat diunggah atau dirujuk dalam permintaan, karena umumnya digunakan dalam upaya eksploitasi.
Header atau payload yang tidak biasa: Jika badan permintaan atau header mengandung konten yang tidak terduga (misalnya, pola injeksi kode atau data yang tidak valid), Cloudflare mungkin menandainya sebagai mencurigakan.
Parameter yang cocok dengan tanda tangan eksploit yang diketahui: Misalnya, permintaan mungkin cocok dengan kerentanan yang diketahui seperti:
CVE-2018-9206: Eksploit dalam plugin jQuery File Upload.
CVE-2019-17132: Kerentanan eksekusi kode jarak jauh Bulletin.
Meskipun sistem Anda tidak terpengaruh langsung oleh CVE-CVE ini, kesamaan dalam struktur atau penamaan dapat menyebabkan permintaan diblokir sebagai tindakan pencegahan. Pendekatan Cloudflare adalah berhati-hati — memprioritaskan keamanan dengan memblokir permintaan yang cocok dengan pola serangan atau heuristik yang diketahui, meskipun ternyata merupakan false positive.
Untuk menyelesaikan ini:
Anda dapat berbagi detail permintaan lengkap (metode, header, badan, URL) dengan kami agar kami dapat menganalisis apa yang secara khusus memicu aturan tersebut.
Jika permintaan tersebut sah dan merupakan perilaku yang diharapkan, kami dapat mempertimbangkan untuk membuat aturan pengecualian yang aman atau memodifikasi tingkat keamanan untuk akun Anda.
Was this article helpful?
Or open the chat in the corner to ask follow-up questions.