Đa phương thức ASR Người nói
SotaSpeech Chuyển giọng nói thành văn bản có mốc thời gian và gán người nói cho tiếng Việt và âm thanh đa ngôn ngữ — nhận dạng, gán người nói và xác định thời gian trong một lượt duy nhất.
Mô hình thực hiện đồng thời việc chuyển văn bản, gán người nói và dự đoán mốc thời gian, tạo ra các đoạn văn bản căn theo thời gian kèm mốc tuyệt đối trên toàn bản ghi. Mô hình được xây dựng cho biên bản họp, phân tích cuộc gọi và xử lý media dạng dài.
Chuyển văn bản đa người nói với độ chồng lấn cao Doubao ElevenLabs GPT-4o Gemini 2.5 Pro Gemini 3 Pro
SotaSpeech Transcribe Diarize
0 5 10 15 20 25 30 35 10.2 11.6 9.1 14 15.2 7.8 WER (Word Error Rate) 28.4 18.2 15.3 23.1 24.6 13.9 cpWER (Concatenated Permutation) 19.1 7.4 6.8 9.6 8.9 6 DER (Diarization Error Rate) So sánh benchmark — tập kiểm thử cuộc họp Việt Nam Gemini-Flash-3.7 Mai_transcribe_1.5 (Microsoft) Elevenlabs_scribe_v2 SmartVoice VNPT ViettelAI
SotaSpeech
0 10 20 30 40 50 60 28.86 35.85 35.17 52.56 48.36 7.8 WER (Word Error Rate) 20.71 28.76 29.87 46.71 38.48 5.94 NWER (Normalized WER) 19.39 28.66 27.93 40.45 33.44 4.83 CER (Character Error Rate) Tỷ lệ lỗi trên tập kiểm thử cuộc họp Việt Nam — càng thấp càng tốt.
Lỗi thấp hơn so với nhà cung cấp trong nước ViettelAI −84% WER −86% CER SmartVoice VNPT −85% WER −88% CER
Kiến trúc 1 · ingest upload ffmpeg decode 16 kHz mono f32 VAD FireRedVAD | RMS Request gate 4 concurrent sgl-omni T=0 · 8192 tok whole clip, no chunking 2 · MOSS-Transcribe-Diarize + Vietnamese LoRA Whisper-Medium audio encoder 80 mel bins · 24 layers · d_model 1024 · 16 heads · FFN 4096 log-mel in · GELU 30 s window, 1500 positions = 50 frames/s 4x time merge (B, T, 1024) reshape to (B, T/4, 4096) 50 to 12.5 tokens/s VQAdaptor — projection Linear 4096 to 1024 · SiLU · Linear 1024 to 1024 LayerNorm eps 1e-6 maps encoder dim to LM hidden 1024 masked_scatter into text embeddings audio placeholder token 151671 Qwen3-0.6B decoder 28 layers · d 1024 · GQA 16/8 · head_dim 128 · SiLU RoPE theta 1e6 · RMSNorm · 131072-token context + Vietnamese LoRA r=64 · ckpt-27000 tied embeddings lm_head to 151936 vocab jointly: words + speaker + time one autoregressive token stream 3 · parse [0.11] [S01] Good morning! [1.03] [1.11] [S02] Morning, guys! [1.34] timestamp speaker words speaker tag: base only — VI adapter emits none Parse [t] ([Sxx])? text [t] Collapse repeats Segment[] no CAPU — model emits cased text Mô hình nền OpenMOSS-Team/MOSS-Transcribe-Diarize (Apache-2.0), kết hợp bộ mã hoá Whisper với bộ giải mã Qwen3; thiết kế ngữ cảnh dài theo Yu et al., arXiv:2601.01554v7 (CC BY 4.0 ). Adapter tiếng Việt và toàn bộ dịch vụ xung quanh là của riêng dự án này.
Khả năng của mô hình Chuyển văn bản kèm tách người nói Đang tải…