คำถามที่พบบ่อย
Automatically translated. View the original in English.
คำถามที่พบบ่อย
ฉันจะหารายละเอียดการใช้งาน API และ endpoint ได้ที่ไหน?
โปรดดูที่ส่วน API endpoint ในเอกสารประกอบของเราเพื่อข้อมูลโดยละเอียด
ต้องใช้การตั้งค่าเครือข่ายและใบรับรองอะไรบ้าง?
การยืนยันตัวตนใช้ระบบ token-based คุณสามารถดูรายละเอียดทั้งหมดเกี่ยวกับ hostname และวิธีใช้ API ได้ในเอกสารประกอบของเรา
ตัวอย่าง:
curl -X POST 'https://api.elsanow.io/api/v1/score_audio_plus' \
-H 'Content-Type: multipart/form-data' \
-H 'Accept: application/json' \
-H 'Authorization: Bearer <TOKEN>' \
-F 'api_plan="premium"' \
-F 'return_json="true"' \
-F 'audio_file=@"/path/to/file"'
ตัวอย่างเพิ่มเติมมีให้ในส่วน API ของเอกสารประกอบ
ฉันจะรับและใช้ API key หรือ token ได้อย่างไร?
API token จะถูกสร้างโดยเราเมื่อมีการลงนาม NDA แล้ว โปรดแจ้งให้เราทราบเมื่อดำเนินการเสร็จสิ้น และเราจะจัดเตรียม token ให้ คำแนะนำการใช้งานมีอยู่ในเอกสารประกอบ
โครงสร้างและข้อจำกัดของคำขอและการตอบสนอง API เป็นอย่างไร?
คุณสามารถดูโครงสร้างคำขอและการตอบสนองโดยละเอียด รวมถึง parameters และ limitations ได้ในเอกสารประกอบ API
มี sandbox ให้ใช้งานหรือไม่ และฉันต้องมีบัญชีทดสอบหรือเปล่า?
ขณะนี้เรายังไม่มีสภาพแวดล้อม staging ให้บริการ
มี dashboard หรือ logs สำหรับการตรวจสอบและแก้ไขปัญหาหรือไม่?
มี dashboard แบบ customer-facing เพื่อให้มองเห็นคำขอและกิจกรรมต่าง ๆ อินเทอร์เฟซที่ใช้ Retool นี้ช่วยให้ผู้ใช้ติดตามการใช้งานของตนทั้งสำหรับการเรียก API แบบ scripted และ unscripted
API ของเรารองรับหรือสามารถรวมเข้ากับโซลูชัน RAG ได้หรือไม่?
แม้ว่า API ของเราจะไม่ได้ใช้งานโซลูชัน RAG (Retrieval-Augmented Generation) โดยตรง แต่สามารถรวมเข้ากับขั้นตอนการทำงาน RAG ได้อย่างแน่นอน บริการของเรามุ่งเน้นการวิเคราะห์สตรีมเสียง และผลลัพธ์ที่ได้สามารถนำไปใช้เป็น input สำหรับระบบ RAG หรือ pipeline อื่น ๆ ที่ได้ประโยชน์จากบริบทที่ได้จากเสียง เพื่อให้คำตอบที่ตรงกับความต้องการหรือแนะนำแนวทางการรวมระบบที่เหมาะสม โปรดแชร์รายละเอียดเพิ่มเติมเกี่ยวกับกรณีการใช้งานหรือสถาปัตยกรรมที่ตั้งใจไว้ของลูกค้า
ต้องใช้แบนด์วิดธ์เท่าไรสำหรับฟีเจอร์การพูดด้วย AI อย่างราบรื่น?
ในขณะนี้ ข้อกำหนดด้านแบนด์วิดธ์เพียงอย่างเดียวที่เราระบุไว้คือสิ่งที่ระบุในเอกสารประกอบ API ของเรา ซึ่งใช้บังคับโดยไม่คำนึงถึงวิธีการใช้งานหรือการรวมฟีเจอร์การพูดด้วย AI หากคุณสามารถแชร์ข้อมูลเพิ่มเติมเกี่ยวกับกรณีการใช้งานเฉพาะของคุณ เรายินดีให้คำแนะนำที่แม่นยำยิ่งขึ้น
สามารถระบุได้หรือไม่ว่า chunk แต่ละชิ้นถูกส่งมาจาก IP address ใด?
ในขณะนี้ เราไม่เก็บรักษาข้อมูลใด ๆ เกี่ยวกับแหล่งที่มาของคำขอ API เช่น IP address ซึ่งหมายความว่าเราไม่สามารถระบุได้ว่า IP ใดส่ง chunk แต่ละชิ้น บันทึกของเรามุ่งเน้นที่ metadata ของคำขอที่เกี่ยวข้องกับการทำงานของบริการ แต่ไม่รวมรายละเอียดเครือข่ายระดับ origin-level
พารามิเตอร์ในส่วนการตอบสนอง "utterance" มีอะไรบ้าง?
พารามิเตอร์ในส่วนการตอบสนอง utterance มีดังนี้:
nativeness_score: คะแนนความเป็นเจ้าของภาษาที่ผู้ใช้ได้รับสำหรับ utterance ทั้งหมด โดยใช้สเกล 0–100
nativeness_score_partial: คะแนนนี้สะท้อนถึงความเป็นเจ้าของภาษาของผู้ใช้ในส่วนของคำที่พวกเขาออกเสียงจริง โดยมีคะแนนขั้นต่ำที่
25%decision: สตริงที่ระบุความสามารถในการออกเสียง utterance ของผู้ใช้ โดยอ้างอิงจาก
nativeness_scoreค่าที่เป็นไปได้:correct,almost_correctหรือincorrect
หมายเหตุ: ในขณะที่ nativeness_score พิจารณาคำทั้งหมดใน utterance (รวมถึงคำที่ผู้ใช้ไม่ได้พูด) nativeness_score_partial จะมุ่งเน้นเฉพาะคำที่ผู้ใช้พูดเท่านั้น แม้ว่าคะแนนจะต่ำก็ตาม
ตัวอย่าง: หาก utterance คือ "Hello ELSA" และผู้ใช้พูดเพียง "Hello" nativeness_score_partial จะพิจารณาเฉพาะคะแนนของ "Hello" (โดยถือว่าเกิน 25%) ในขณะที่ nativeness_score จะคำนึงถึงคำทั้งหมด รวมถึงคำที่ไม่ได้พูด (เช่น "ELSA" ที่มีคะแนนต่ำหรือเป็นศูนย์)
สำหรับรายละเอียดเพิ่มเติม โปรดดูเอกสารประกอบ API
พารามิเตอร์ในส่วนการตอบสนอง "words" มีอะไรบ้าง?
พารามิเตอร์ในส่วนการตอบสนอง words มีดังนี้:
nativeness_score: คะแนนความเป็นเจ้าของภาษา (
0–100) สำหรับการออกเสียงของแต่ละคำdecision: การประเมินความสามารถโดยอ้างอิงจาก
nativeness_scoreโดยมีค่าที่เป็นไปได้คือcorrect,almost_correctหรือincorrect
สำหรับรายละเอียดเพิ่มเติม โปรดดูเอกสารประกอบ API
พารามิเตอร์ในส่วนการตอบสนอง "word_stress" มีอะไรบ้าง?
พารามิเตอร์ในส่วนการตอบสนอง word_stress มีดังนี้:
- decision: ระบุว่าผู้ใช้เน้นพยางค์ได้ถูกต้องหรือไม่ โดยมีค่าที่เป็นไปได้คือ
correctหรือincorrect
สำหรับรายละเอียดเพิ่มเติม โปรดดูเอกสารประกอบ API
พารามิเตอร์ในส่วนการตอบสนอง "phonemes" มีอะไรบ้าง?
พารามิเตอร์ในส่วนการตอบสนอง phonemes มีดังนี้:
nativeness_score: คะแนนสำหรับ phoneme ในรายการนี้ บนสเกล
0–100decision: ระบุความถูกต้องของการออกเสียง phoneme โดยมีค่าที่เป็นไปได้คือ
correct,warningหรือerror
สำหรับรายละเอียดเพิ่มเติม โปรดดูเอกสารประกอบ API
วิธีการคำนวณ Chunk
chunk มีระยะเวลา 15 วินาที อย่างไรก็ตาม จำนวน chunk จริงจะคำนวณโดยใช้สูตร:
num_chunks = ceil(duration / chunk_size)
ตัวอย่างเช่น อินพุตเสียงขนาด 17 วินาที จะได้ 2 chunk (ไม่ใช่ 1.13) เนื่องจากการปัดขึ้น (ceiling operation)
นอกจากนี้:
หากระยะเวลารวมเกินระยะเวลาสูงสุดที่ API อนุญาตเล็กน้อย ระบบจะตัดทอนให้อยู่ภายในขีดจำกัด ซึ่งช่วยป้องกันไม่ให้มีการส่งคำขอที่สองเนื่องจากเฟรมพิเศษเพียงไม่กี่เฟรม
เรายังตัดความเงียบและเสียงรบกวนจากต้นหรือท้ายเสียงเมื่อเป็นไปได้ ซึ่งอาจส่งผลต่อจำนวน chunk สุดท้ายด้วย
ปัจจัยเหล่านี้อธิบายว่าเหตุใด num_standard_chunks จึงอาจไม่ตรงกับ num_secs / 15 เสมอไป
Speech Analyzer ตรวจจับข้อผิดพลาดทางไวยากรณ์อย่างไร?
เราตรวจจับข้อผิดพลาดทางไวยากรณ์ แต่จะแก้ไขเฉพาะกรณีที่เรามั่นใจสูงในบริบทนั้น ๆ โดยเฉพาะอย่างยิ่ง การแก้ไขที่เสนอต้องมีคะแนนความมั่นใจอย่างน้อย 80% ก่อนที่จะนำไปใช้ แนวทางนี้ช่วยให้เราหลีกเลี่ยงการเสนอการเปลี่ยนแปลงที่ไม่เกี่ยวข้องในกรณีที่มีความคลุมเครือทางไวยากรณ์
ขีดจำกัดสูงสุดในการอัปโหลดไฟล์เสียงคืออะไร
ไบต์
ขนาดไฟล์สูงสุดที่อนุญาตให้อัปโหลดคือ 100MB หากคุณต้องการอัปโหลดไฟล์ที่มีขนาดใหญ่กว่าขีดจำกัดนี้ โปรดติดต่อทีมสนับสนุนของเราเพื่อขอความช่วยเหลือ
นาที
ความยาวไฟล์เสียงสูงสุดสำหรับคำขอ unscripted ที่มีการตั้งค่า sync flag เป็น True ที่อนุญาตให้อัปโหลดคือ 15 นาที
Scripted: ไม่จำกัด
Unscripted:
sync = True => 15 นาที
sync = False => 12 นาที
คะแนนการออกเสียงและคะแนนน้ำเสียงมีความสัมพันธ์กันหรือไม่?
ไม่มีความสัมพันธ์โดยตรงระหว่าง pronunciation_score และ intonation_score อย่างไรก็ตาม โดยทั่วไปเราจะคำนวณ intonation_score เฉพาะสำหรับ input ที่ยาวกว่า เช่น ประโยคที่สมบูรณ์ ดังนั้น ผู้ใช้ที่เป็นผู้เริ่มต้นอย่างแท้จริงและมักจะพูดสั้นหรือไม่สมบูรณ์อาจไม่ได้รับ intonation_score ซึ่งอาจดูเหมือนว่ามีความสัมพันธ์กัน แต่จริง ๆ แล้วเป็นเพราะความยาวและคุณภาพของ input มากกว่าการพึ่งพากันระหว่างคะแนนทั้งสอง
การประเมิน decision สำหรับการออกเสียงและน้ำเสียงทำอย่างไร?
แอตทริบิวต์ decision เหล่านี้อ้างอิงจากคะแนน CEFR-level ที่สอดคล้องกัน (เช่น pronunciation_cefr, intonation_cefr) ตัวอย่างการแมปมีดังนี้:
Correct: ระดับ CEFR C1 หรือ C2
Warning: ระดับ CEFR B1 หรือ B2
Incorrect: ระดับ CEFR A1 หรือ A2
เหตุใดการเรียก API แบบ unscripted บางรายการจึงไม่มีคะแนน EPS หรือ transcript?
เพื่อให้ได้ผลลัพธ์พร้อม metrics โปรดตรวจสอบให้แน่ใจว่าความยาวเสียงเกิน 20 วินาที
ระดับการออกเสียงถูกแมปกับสำเนียงเจ้าของภาษาของ US/UK หรือไม่?
เราปฏิบัติตามมาตรฐานสากล (CEFT, IELTS, TOEFL) ซึ่งเราไม่ลงโทษบุคคลที่พูดด้วยสำเนียงของตนเอง แต่มุ่งเน้นที่ความชัดเจนในการพูดแทน แม้ว่าอาจมีความแตกต่างเล็กน้อยสำหรับผู้ใช้ที่มีสำเนียงหนักกว่า แต่ความแตกต่างเหล่านั้นมักอยู่ภายในระดับเดียวกัน
เหตุใด metrics ด้านไวยากรณ์และคำศัพท์จึงหายไปในผลลัพธ์ unscripted API?
metrics เหล่านี้มีเกณฑ์ขั้นต่ำ หากคุณต้องการรับผลลัพธ์สำหรับ metrics ด้านไวยากรณ์และคำศัพท์ใน unscripted API แม้จะต่ำกว่าเกณฑ์ขั้นต่ำ เพียงเพิ่ม flag -F force_grammar_vocab=True อย่างไรก็ตาม สิ่งสำคัญคือต้องทราบว่าผลลัพธ์เหล่านี้อาจไม่แม่นยำเท่ากับผลลัพธ์ที่ตรงตามเกณฑ์ขั้นต่ำ
เราใช้มาตรฐานใดสำหรับ explainability?
โมเดลของเราเป็นกรรมสิทธิ์เฉพาะ และเราไม่เปิดเผยสถาปัตยกรรมที่แน่นอนหรือกลไกภายใน แม้ว่าเราจะให้ความสำคัญกับความโปร่งใสในแง่ของคุณภาพผลลัพธ์และ benchmark ประสิทธิภาพ แต่ขณะนี้เราไม่ได้ปฏิบัติตามมาตรฐานสาธารณะสำหรับ model explainability
เราคำนวณคะแนน Overall อย่างไร?
คะแนนรวมเป็นการรวมกันของ metrics ห้าประการ: pronunciation, intonation, fluency, grammar และ vocabulary บางครั้ง หากเราไม่ได้ให้คะแนน vocabulary หรือ grammar เนื่องจากการบันทึกสั้นเกินไป เราก็ยังสามารถให้คะแนนรวมโดยอ้างอิงจาก metrics อื่น ๆ ที่มีอยู่ได้
คะแนนคำนวณอย่างไร?
วิธีที่เราคำนวณ ELSA Score และแมปกับ IELTS ได้รับการพัฒนาภายในองค์กร พารามิเตอร์ในการคำนวณคะแนน ELSA อาจเปลี่ยนแปลงได้ตามกาลเวลา และการแมปกับ IELTS ก็เช่นกัน เราจะประเมินและปรับปรุงเล็กน้อยเป็นระยะ ๆ
น้ำหนักของ grammar range และ errors ในคะแนน Grammar เป็นอย่างไร?
สัดส่วนของแง่มุมเหล่านี้ขึ้นอยู่กับประเภทของการบันทึก สำหรับการพูดทั่วไปจะอยู่ที่ประมาณ 60% สำหรับข้อผิดพลาดทางไวยากรณ์และ 40% สำหรับช่วงไวยากรณ์ สำหรับสภาพแวดล้อมที่คล้ายการสอบจะอยู่ที่ประมาณ 50% สำหรับข้อผิดพลาดทางไวยากรณ์และ 50% สำหรับช่วงไวยากรณ์ สิ่งสำคัญคือต้องทราบว่าตัวเลขเหล่านี้จะปรับปรุงเมื่อเรามีข้อมูลใหม่
เราคำนวณคะแนนการออกเสียงอย่างไร?
คะแนนการออกเสียงอ้างอิงจากความแม่นยำในการออกเสียงภาษาอังกฤษในแต่ละคำที่ ELSA รู้จักในการบันทึกของคุณ จำนวนและความรุนแรงของ การออกเสียงผิด ที่ถูกไฮไลต์จะส่งผลต่อคะแนนการออกเสียง
เราคำนวณคะแนน fluency อย่างไร?
คะแนน Fluency เป็นการรวมกันของประสิทธิภาพของคุณใน Pace, Pausing และ Hesitations การรักษา Pace ที่ดี การหยุดเฉพาะในจุดที่เป็นธรรมชาติ และการลด filler words และการพูดซ้ำจะช่วยให้ได้คะแนน Fluency ที่ดี
เราคำนวณคะแนน intonation อย่างไร?
คะแนน intonation คำนึงถึงการขึ้นและลงของระดับเสียงของคุณ และวิธีที่คุณให้ความสำคัญกับคำในประโยค
เราคำนวณคะแนน vocabulary อย่างไร?
คะแนน Vocabulary อ้างอิงจากการประมาณ CEFR levels ของคำและสำนวนในการพูดของผู้ใช้เป็นหลัก
หมายเหตุ: เราส่งออกการกระจาย CEFR แบบ raw เป็น feedback (เปอร์เซ็นต์ของคำในแต่ละระดับ A1-C2) แต่คะแนนรวมจะคำนวณด้วยอัลกอริทึมทางสถิติที่แมปการกระจายนี้เป็นค่า 0-100 (โดยที่ 100% สอดคล้องกับการใช้คำศัพท์ระดับเจ้าของภาษา) คะแนน vocabulary จะถูกส่งคืนเฉพาะเมื่อข้อความมีความยาว (ในปัจจุบัน) 75 คำ ขึ้นไป
เราคำนวณคะแนน grammar อย่างไร?
คะแนน grammar คำนวณจากผลลัพธ์ของโมดูลการตรวจจับและแก้ไขข้อผิดพลาดทางไวยากรณ์รวมกับช่วงไวยากรณ์ที่ระบุได้ โมดูลการตรวจจับและแก้ไขข้อผิดพลาดทางไวยากรณ์จะระบุข้อผิดพลาดทางไวยากรณ์ในข้อความและส่งออกคะแนนข้อผิดพลาด โมดูลช่วงไวยากรณ์จะระบุโครงสร้างไวยากรณ์ทั้งหมดและคำนวณคะแนนช่วงโดยอ้างอิงจากโครงสร้างระดับสูงสุด 5 อันดับแรกที่ใช้ได้สำเร็จในการบันทึก คะแนน grammar จะถูกส่งคืนเฉพาะเมื่อข้อความมีความยาว (ในปัจจุบัน) 50 คำ ขึ้นไป
ปริมาณและความหลากหลายของข้อมูลฝึกสอนเป็นอย่างไร?
แม้ว่าเราจะไม่เปิดเผยรายละเอียดการดำเนินงานหรือโครงสร้างภายในของโมเดล แต่เรามุ่งมั่นที่จะทำให้ผลลัพธ์สามารถตีความได้และสอดคล้องกับความคาดหวังของผู้ใช้ ในกรณีที่เป็นไปได้ เราจัดเตรียม score breakdowns หรือ feedback ระดับ category-level ที่สะท้อนตรรกะการประเมินของโมเดลในลักษณะที่โปร่งใสและนำไปใช้ได้จริงสำหรับผู้ใช้ปลายทาง ภายในองค์กร เราปฏิบัติตามแนวทาง validation ที่เข้มแข็งและ benchmark ประสิทธิภาพเพื่อให้มั่นใจในความสม่ำเสมอและความเป็นธรรมในการตัดส
Was this article helpful?
Or open the chat in the corner to ask follow-up questions.