ELSA SpeakELSA Speak

Câu hỏi thường gặp

Updated July 6, 2026·48 views

Automatically translated. View the original in English.

Câu hỏi thường gặp

Tôi có thể tìm thông tin chi tiết về cách sử dụng API và các endpoint ở đâu?

Vui lòng tham khảo phần endpoint API trong tài liệu của chúng tôi để biết thông tin chi tiết.

Những cài đặt mạng và chứng chỉ nào là bắt buộc?

Xác thực được thực hiện dựa trên token. Bạn có thể tìm thấy tất cả thông tin chi tiết về hostname và cách sử dụng API trong tài liệu của chúng tôi.

Ví dụ:

curl -X POST 'https://api.elsanow.io/api/v1/score_audio_plus' \
     -H 'Content-Type: multipart/form-data' \
     -H 'Accept: application/json' \
     -H 'Authorization: Bearer <TOKEN>' \
     -F 'api_plan="premium"' \
     -F 'return_json="true"' \
     -F 'audio_file=@"/path/to/file"'

Các ví dụ bổ sung có trong phần API của tài liệu.

Làm thế nào để lấy và sử dụng API key hoặc token?

API token sẽ được chúng tôi tạo sau khi NDA được ký. Vui lòng thông báo cho chúng tôi khi hoàn tất, và chúng tôi sẽ cung cấp token. Hướng dẫn sử dụng được trình bày trong tài liệu.

Cấu trúc và giới hạn của các yêu cầu và phản hồi API là gì?

Bạn có thể tìm thấy cấu trúc yêu cầu và phản hồi chi tiết, bao gồm các parameterslimitations, trong tài liệu API.

Có môi trường sandbox không và tôi có cần tài khoản thử nghiệm không?

Hiện tại chúng tôi không cung cấp môi trường staging.

Có dashboard hoặc nhật ký nào để theo dõi và gỡ lỗi không?

Một dashboard customer-facing hiện có sẵn để cung cấp khả năng hiển thị các yêu cầu và hoạt động. Giao diện dựa trên Retool này cho phép người dùng theo dõi mức sử dụng của họ cho cả các lệnh gọi API có kịch bản và không có kịch bản.

API của chúng tôi hiện có hỗ trợ hoặc có thể tích hợp với giải pháp RAG không?

Mặc dù API của chúng tôi không triển khai giải pháp RAG (Retrieval-Augmented Generation) một cách tự nhiên, nó hoàn toàn có thể được tích hợp vào các quy trình làm việc RAG. Các dịch vụ của chúng tôi tập trung vào phân tích luồng âm thanh, và các đầu ra có thể được sử dụng làm đầu vào cho các hệ thống RAG hoặc các pipeline khác được hưởng lợi từ ngữ cảnh phong phú được trích xuất từ âm thanh. Để cung cấp câu trả lời phù hợp hơn hoặc đề xuất phương pháp tích hợp tối ưu, vui lòng chia sẻ thêm thông tin về trường hợp sử dụng dự kiến của khách hàng hoặc kiến trúc của nó.

Băng thông cần thiết để các tính năng AI nói hoạt động trơn tru là bao nhiêu?

Hiện tại, các yêu cầu liên quan đến băng thông duy nhất chúng tôi cung cấp là những yêu cầu được liệt kê trong tài liệu API của chúng tôi. Những yêu cầu này áp dụng bất kể tính năng AI nói được sử dụng hoặc tích hợp như thế nào. Nếu bạn có thể chia sẻ thêm về trường hợp sử dụng cụ thể của mình, chúng tôi sẽ sẵn lòng đưa ra khuyến nghị chính xác hơn.

Có thể xác định địa chỉ IP nào đã gửi mỗi chunk không?

Hiện tại, chúng tôi không lưu giữ bất kỳ thông tin nào về nguồn gốc của các yêu cầu API, chẳng hạn như địa chỉ IP. Điều này có nghĩa là chúng tôi không thể xác định IP nào đã gửi mỗi chunk. Nhật ký của chúng tôi tập trung vào siêu dữ liệu yêu cầu liên quan đến chức năng dịch vụ, nhưng không bao gồm thông tin chi tiết mạng ở cấp độ origin-level.

Các tham số trong phần phản hồi "utterance" là gì?

Các tham số trong phần phản hồi utterance bao gồm:

  • nativeness_score: Điểm nativeness mà người dùng đạt được cho toàn bộ utterance, trên thang điểm từ 0–100.

  • nativeness_score_partial: Điểm này phản ánh mức độ nativeness của người dùng trên tập hợp các từ họ thực sự phát âm với điểm tối thiểu là 25%.

  • decision: Một chuỗi chỉ ra mức độ thành thạo của người dùng trong việc phát âm utterance, dựa trên nativeness_score. Các giá trị có thể: correct, almost_correct, hoặc incorrect.

Lưu ý: Trong khi nativeness_score xem xét tất cả các từ trong utterance (bao gồm cả những từ người dùng không nói), nativeness_score_partial chỉ tập trung vào những từ được người dùng nói, ngay cả khi chúng có điểm thấp.

Ví dụ: Nếu utterance là "Hello ELSA" và người dùng chỉ nói "Hello," nativeness_score_partial sẽ chỉ xem xét điểm của "Hello" (giả sử vượt quá 25%), trong khi nativeness_score sẽ tính đến tất cả các từ, bao gồm cả những từ không được nói (ví dụ: "ELSA," với điểm thấp hoặc bằng không).

Để biết thêm chi tiết, xem tài liệu API.

Các tham số trong phần phản hồi "words" là gì?

Các tham số trong phần phản hồi words bao gồm:

  • nativeness_score: Điểm nativeness (0–100) cho việc phát âm từng từ riêng lẻ.

  • decision: Đánh giá mức độ thành thạo dựa trên nativeness_score, với các giá trị có thể là correct, almost_correct, hoặc incorrect.

Để biết thêm chi tiết, xem tài liệu API.

Các tham số trong phần phản hồi "word_stress" là gì?

Các tham số trong phần phản hồi word_stress bao gồm:

  • decision: Chỉ ra liệu người dùng có nhấn trọng âm âm tiết đúng hay không, với các giá trị có thể là correct hoặc incorrect.

Để biết thêm chi tiết, xem tài liệu API.

Các tham số trong phần phản hồi "phonemes" là gì?

Các tham số trong phần phản hồi phonemes bao gồm:

  • nativeness_score: Điểm cho các âm vị trong mục này, trên thang điểm 0–100.

  • decision: Chỉ ra độ chính xác của việc phát âm âm vị, với các giá trị có thể là correct, warning, hoặc error.

Để biết thêm chi tiết, xem tài liệu API.

Cách tính Chunk hoạt động như thế nào

Một chunk có thời lượng 15 giây. Tuy nhiên, số lượng chunk thực tế được tính bằng công thức:

num_chunks = ceil(duration / chunk_size)

Vì vậy, ví dụ, một đầu vào âm thanh 17 giây cho ra 2 chunk (không phải 1.13), vì phép làm tròn lên.

Ngoài ra:

  • Nếu tổng thời lượng vượt quá một chút so với thời lượng tối đa cho phép của API, nó sẽ bị cắt bớt để nằm trong giới hạn. Điều này ngăn một yêu cầu thứ hai bị kích hoạt chỉ vì một vài khung hình thừa.

  • Chúng tôi cũng cắt bỏ khoảng lặng và tiếng ồn ở đầu hoặc cuối âm thanh khi áp dụng, điều này có thể ảnh hưởng thêm đến số lượng chunk cuối cùng.

Những yếu tố này giải thích tại sao num_standard_chunks có thể không phải lúc nào cũng khớp chính xác với num_secs / 15.

Speech Analyzer phát hiện lỗi ngữ pháp như thế nào?

Chúng tôi phát hiện các lỗi ngữ pháp nhưng chỉ sửa những lỗi mà chúng tôi rất tự tin về ngữ cảnh. Cụ thể, một đề xuất sửa lỗi phải có điểm tin cậy ít nhất là 80% trước khi được áp dụng. Cách tiếp cận này đảm bảo rằng chúng tôi tránh đề xuất các thay đổi không liên quan trong các trường hợp mơ hồ về ngữ pháp.

Giới hạn tải lên tệp âm thanh tối đa là bao nhiêu

Byte

Kích thước tệp tối đa được phép tải lên là 100MB. Nếu bạn cần tải lên các tệp lớn hơn giới hạn này, vui lòng liên hệ với nhóm hỗ trợ của chúng tôi để được trợ giúp.

Phút

Độ dài tệp âm thanh tối đa cho các yêu cầu unscripted có cờ sync được đặt thành True được phép tải lên là 15 phút.

  • Scripted: Không giới hạn

  • Unscripted:

    • sync = True => 15 phút

    • sync = False => 12 phút

Điểm phát âm và ngữ điệu có liên quan đến nhau không?

Không có sự phụ thuộc trực tiếp giữa pronunciation_scoreintonation_score. Tuy nhiên, chúng tôi thường chỉ tính intonation_score cho các đầu vào dài hơn, chẳng hạn như các câu hoàn chỉnh. Do đó, những người dùng là người mới bắt đầu tuyệt đối và có xu hướng tạo ra các utterance rất ngắn hoặc không đầy đủ có thể không nhận được intonation_score. Điều này có thể tạo ra ấn tượng về mối quan hệ, nhưng đó thực ra là phản ánh độ dài và chất lượng đầu vào hơn là sự phụ thuộc giữa các điểm số.

Các quyết định về phát âm và ngữ điệu được đánh giá như thế nào?

Các thuộc tính quyết định này dựa trên điểm CEFR-level tương ứng (ví dụ: pronunciation_cefr, intonation_cefr). Một ví dụ về ánh xạ như sau:

  • Correct: Cấp độ CEFR C1 hoặc C2

  • Warning: Cấp độ CEFR B1 hoặc B2

  • Incorrect: Cấp độ CEFR A1 hoặc A2

Tại sao một số lệnh gọi API unscripted thiếu điểm EPS hoặc bản ghi?

Để có kết quả với các chỉ số, hãy đảm bảo rằng độ dài âm thanh vượt quá 20 giây.

Cấp độ phát âm có được ánh xạ theo giọng bản ngữ Mỹ/Anh không?

Chúng tôi tuân theo các tiêu chuẩn toàn cầu (CEFT, IELTS, TOEFL), trong đó chúng tôi không phạt người dùng vì nói theo giọng bản ngữ của họ mà tập trung vào sự rõ ràng của lời nói. Mặc dù có thể có những biến thể nhỏ đối với người dùng có giọng đặc hơn, nhưng sự khác biệt thường vẫn nằm trong cùng một nhóm.

Tại sao các chỉ số ngữ pháp và từ vựng bị thiếu trong kết quả API unscripted?

Các chỉ số này có ngưỡng tối thiểu. Nếu bạn muốn lấy kết quả cho các chỉ số ngữ pháp và từ vựng trong API unscripted mặc dù có ngưỡng tối thiểu này, chỉ cần thêm cờ -F force_grammar_vocab=True. Tuy nhiên, điều quan trọng cần lưu ý là những kết quả này có thể không chính xác như những kết quả đáp ứng ngưỡng tối thiểu.

Chúng tôi sử dụng tiêu chuẩn nào cho khả năng giải thích?

Các mô hình của chúng tôi là độc quyền và chúng tôi không tiết lộ kiến trúc chính xác hoặc cơ chế nội bộ. Mặc dù chúng tôi ưu tiên tính minh bạch về chất lượng đầu ra và điểm chuẩn hiệu suất, hiện tại chúng tôi không tuân theo tiêu chuẩn công khai nào về khả năng giải thích của mô hình.

Chúng tôi tính điểm Tổng thể như thế nào?

Điểm tổng thể là sự kết hợp của năm chỉ số: pronunciation, intonation, fluency, grammarvocabulary. Đôi khi, nếu chúng tôi không cung cấp điểm từ vựng hoặc ngữ pháp vì bản ghi quá ngắn, chúng tôi vẫn có thể cung cấp điểm tổng thể dựa trên các chỉ số hiện có khác.

Điểm số được tính như thế nào?

Cách chúng tôi tính ELSA Score và ánh xạ nó sang IELTS được phát triển nội bộ. Các tham số để tính điểm ELSA có thể thay đổi theo thời gian, và việc ánh xạ sang IELTS cũng vậy. Định kỳ chúng tôi đánh giá lại và điều chỉnh nhẹ.

Phạm vi ngữ pháp và lỗi ngữ pháp được tính trọng số như thế nào trong điểm Ngữ pháp?

Tỷ lệ của các khía cạnh này phụ thuộc vào loại bản ghi. Đối với lời nói thông thường, tỷ lệ khoảng 60% lỗi ngữ pháp và 40% phạm vi ngữ pháp; đối với các bài kiểm tra, tỷ lệ là khoảng 50% lỗi ngữ pháp và 50% phạm vi ngữ pháp. Điều quan trọng cần lưu ý là những con số này được điều chỉnh khi chúng tôi có dữ liệu mới.

Chúng tôi tính điểm phát âm như thế nào?

Điểm phát âm dựa trên mức độ chính xác khi bạn phát âm các âm tiếng Anh trong mỗi từ được ELSA nhận diện trong bản ghi của bạn. Số lượng và mức độ nghiêm trọng của các lỗi phát âm được đánh dấu sẽ ảnh hưởng đến điểm phát âm.

Chúng tôi tính điểm lưu loát như thế nào?

Điểm Lưu loát là sự kết hợp hiệu suất của bạn trong Pace, PausingHesitations. Duy trì tốc độ tốt, chỉ dừng lại ở những nơi tự nhiên và giảm số lượng từ đệm và từ lặp sẽ góp phần tạo ra điểm Lưu loát tốt.

Chúng tôi tính điểm ngữ điệu như thế nào?

Điểm intonation tính đến sự lên xuống trong giọng của bạn và mức độ bạn nhấn mạnh vào các từ trong câu tốt như thế nào.

Chúng tôi tính điểm từ vựng như thế nào?

Điểm Vocabulary chủ yếu dựa trên các CEFR levels ước tính của các từ và cụm từ trong lời nói của người dùng.

Lưu ý: Chúng tôi xuất ra phân phối CEFR raw dưới dạng phản hồi (tỷ lệ phần trăm các từ ở mỗi cấp độ A1-C2) nhưng điểm tổng thể được tính bằng một thuật toán thống kê ánh xạ phân phối này sang giá trị 0-100 (trong đó 100% tương ứng với việc sử dụng từ vựng như người bản ngữ). Điểm vocabulary chỉ được trả về nếu văn bản có (hiện tại) từ 75 từ trở lên.

Chúng tôi tính điểm ngữ pháp như thế nào?

Điểm grammar được tính dựa trên đầu ra của mô-đun phát hiện và sửa lỗi ngữ pháp kết hợp với phạm vi ngữ pháp được xác định. Mô-đun phát hiện và sửa lỗi ngữ pháp xác định các lỗi ngữ pháp trong văn bản và xuất ra điểm lỗi. Mô-đun phạm vi ngữ pháp xác định tất cả các cấu trúc ngữ pháp và tính điểm phạm vi dựa trên 5 cấu trúc cấp cao nhất được sử dụng thành công trong bản ghi. Điểm grammar chỉ được trả về nếu văn bản có (hiện tại) từ 50 từ trở lên.

Khối lượng và sự đa dạng của dữ liệu huấn luyện là gì?

Mặc dù chúng tôi không tiết lộ chi tiết triển khai hoặc cấu trúc nội bộ của các mô hình, chúng tôi cam kết đảm bảo rằng các đầu ra có thể diễn giải được và phù hợp với kỳ vọng của người dùng. Khi áp dụng, chúng tôi cung cấp score breakdowns hoặc phản hồi ở cấp độ category-level phản ánh logic đánh giá của mô hình theo cách minh bạch và có thể hành động cho người dùng cuối. Nội bộ, chúng tôi tuân theo các thực hành xác thực chặt chẽ và đo lường hiệu suất để đảm bảo tính nhất quán và công bằng trong các quyết định của mô hình.

Các mô hình chính xác đến mức nào và chúng được tái huấn luyện bao lâu một lần?

Trước đây chúng tôi chưa công bố số liệu độ chính xác chi tiết một cách công khai. Thay vào đó, chúng tôi thường thông báo rằng các mô hình của chúng tôi vượt trội hơn các đối thủ cạnh tranh dựa trên các điểm chuẩn nội bộ của chúng tôi. Về tần suất tái huấn luyện mô hình, nó thay đổi đáng kể tùy thuộc vào mô hình. Trong khi một số mô hình không thay đổi trong thời gian dài, cách tiếp cận tổng thể của chúng tôi luôn nhất quán là thu thập dữ liệu người dùng (khi được phép) và cải thiện hiệu suất mô hình theo từng bước theo thời gian.

Rủi ro về định kiến hoặc phân biệt đối xử là gì?

AI của ELSA được xây dựng có mục đích để hỗ trợ người học tiếng Anh không phải bản ngữ. Bằng cách huấn luyện trên hàng nghìn giờ tiếng Anh có giọng, lấy từ những người học ngôn ngữ thứ hai (L2) thực tế, ELSA được định vị độc đáo để nhận biết và giải quyết những thách thức phát âm của người học. Cách tiếp cận toàn diện này giúp giảm thiểu định kiến về giọng và đảm bảo người học cảm thấy được nhìn nhận, hỗ trợ và trao quyền ngay từ ngày đầu tiên.

Trọng số của "ngữ điệu" trong mô hình là bao nhiêu và nó được xử lý như thế nào về mặt đạo đức?

Dù nội dung là scripted hay unscripted, tỷ lệ phát hiện là khoảng 20%.

Về câu hỏi xử lý vấn đề này một cách có đạo đức, có thể mối lo ngại liên quan đến khả năng phát hiện các mẫu giọng nói cá nhân hoặc rủi ro về giả mạo giọng nói.

Để làm rõ: Các hệ thống phân tích giọng nói và ngữ điệu của chúng tôi được thiết kế để không phân biệt bất kỳ đặc điểm nhận dạng nào của giọng nói của người dùng. Chúng tôi không thực hiện nhận dạng người nói, và cũng không sử dụng dữ liệu âm thanh cho mục đích đó. Trọng tâm của chúng tôi chỉ là đánh giá phát âm và ngữ điệu trong bối cảnh học ngôn ngữ.

Việc sử dụng dịch vụ API được theo dõi như thế nào?

Chúng tôi cung cấp dashboard theo dõi mức sử dụng qua Retool cung cấp khả năng hiển thị vào tổng mức tiêu thụ API hàng ngày. Bao gồm các chỉ số như số lượng ký tự đã xử lý, số lượng yêu cầu (chia theo scriptedunscripted), cấp độ gói, thời gian xử lý, số lượng chunksố lượng yêu cầu ASR. Ngoài ra, chúng tôi cung cấp chế độ xem chi tiết theo từng yêu cầu, bao gồm cấp độ, độ dài âm thanhvăn bản đã ghi cho từng yêu cầu riêng lẻ. Dashboard này có thể phục vụ như một cách đáng tin cậy để theo dõi và quản lý mức sử dụng.

Tại sao không có điểm ngữ pháp hoặc từ vựng cho các âm thanh ngắn?

Trong trường hợp âm thanh ngắn, điểm ngữ pháp và từ vựng có thể không được tạo ra là điều bình thường. Hệ thống của chúng tôi thường yêu cầu tối thiểu khoảng 50 từ để đánh giá ngữ pháp75 từ để đánh giá từ vựng để tạo ra kết quả đáng tin cậy và có ý nghĩa.

Để có kết quả tốt nhất, chúng tôi khuyến nghị gửi các mẫu âm thanh dài hơn. Điều này cho phép công cụ chấm điểm của chúng tôi phân tích các mẫu và cung cấp phản hồi toàn diện hơn.

Các điểm số được ánh xạ như thế nào?

CEFRIELTSTOEFL SpeakingPTE RangeA11.50-110-10A122-310-10A12.54-510-10A236-710-11A23.58-912-15B1410-1116-19B14.512-2320-25B1514-1526-31B25.516-1732-40B2618-1941-50B26.520-2251-60C1723-2361-70C17.524-2571-79C1826-2780-86C28.528-2987-89C2930-3090-90

Tài liệu tham khảo:

Tại sao yêu cầu của tôi bị chặn (403 Forbidden)?

Yêu cầu của bạn có thể đã bị Cloudflare chặn do một hoặc nhiều kiểm tra bảo mật được kích hoạt bởi Managed Ruleset của họ. Các quy tắc này được thiết kế để phát hiện và ngăn chặn lưu lượng truy cập có th

Was this article helpful?

Or open the chat in the corner to ask follow-up questions.