Alibaba مدلهای Qwen Audio 3.1 را معرفی کرد
گروه هوش مصنوعی Qwen در Alibaba مدلهای Qwen-Audio-3.1 را برای تشخیص گفتار، تبدیل متن به گفتار و تعامل بلادرنگ عرضه کرد. این مجموعه شامل پنج مدل است که تشخیص چندزبانه و لهجهها را بهبود میدهند و کلمات پرکننده را پاکسازی میکنند. مدل ASR-Next امکان شناسایی چند گوینده با زمانبندی را اضافه کرده و احساسات، صداهای محیطی و نویز ماشین را تشخیص میدهد. مدل TTS سنتز چندزبانه را انجام میدهد و کاربران میتوانند احساس، سرعت و سبک را با دستورهای متنی ساده کنترل کنند.
مدل TTS-Next یک مدل زبانی را با رویکرد نفوذ برای تولید صدا، جلوههای صوتی و صدای پسزمینه در یک مرحله ترکیب میکند. مدل بلادرنگ از صحبت کردن و گوش دادن همزمان با قطع فوری پشتیبانی میکند و هنگام تشخیص خلقوخوی پایین، پاسخ خود را تنظیم میکند. شرکت Alibaba همچنین قیمتها را کاهش داده است، به طوری که قیمت TTS حدود ۷۰ درصد، مدل بلادرنگ نزدیک به ۸۵ درصد و ASR تا ۹۵ درصد کاهش مییابد.