VOICE AI / TELEPHONY
شناسایی گوینده تلفنی
مدل پردازش گفتار برای تشخیص گوینده پشت خط تلفن؛ استخراج هویت از سیگنال محدود و نویزی
VOICEPRINT / ISOLATINGNOISE → EMBEDDING → IDENTITY
در تماس تلفنی، داده کم است و نویز زیاد
طراحی صفحه مثل موج صوتی فشرده است: خطهای سیگنال، کارتهای فرکانسی و micro-interactionهایی که نشان میدهند تشخیص گوینده فقط شنیدن صدا نیست؛ استخراج هویت از آشوب است
تشخیص گوینده برای کانالی که همیشه تمیز نیست
تشخیص گوینده در صدای تلفنی یعنی کار با پهنای باند محدود، نویز، افت کیفیت و تغییرات کانال. این پروژه مسیر مدلسازی صوت را برای ساخت اثر انگشت صوتی و مقایسه هویت گوینده طراحی کرد؛ جایی که هر فریم صوتی باید از نویز جدا شود و به سیگنال قابل اعتماد تبدیل شود
Speech ProcessingSpeaker EmbeddingsAudio MLTelephonySignal Processing
کانال
گفتار پشت خط تلفن
هویت
الگوی صوتی گوینده
تمرکز
پایداری روی سیگنال کمکیفیت
پردازش گفتار
طراحی مسیر استخراج ویژگی و مدل تشخیص برای صدای تلفنی با پهنای باند محدود
مدیریت نویز
توجه به افت کیفیت، قطعووصلی و تغییرات کانال در سناریوی تماس واقعی
تشخیص هویت صوتی
تبدیل گفتار به بردارهای قابل مقایسه برای شناسایی گوینده
ماموریت بعدی · 07
تحلیل هوشمند سوابق پزشکی
↗