← بازگشت به آرشیو

VOICE AI / TELEPHONY

شناسایی گوینده تلفنی

مدل پردازش گفتار برای تشخیص گوینده پشت خط تلفن؛ استخراج هویت از سیگنال محدود و نویزی

VOICEPRINT / ISOLATING

NOISE → EMBEDDING → IDENTITY

در تماس تلفنی، داده کم است و نویز زیاد

طراحی صفحه مثل موج صوتی فشرده است: خط‌های سیگنال، کارت‌های فرکانسی و micro-interactionهایی که نشان می‌دهند تشخیص گوینده فقط شنیدن صدا نیست؛ استخراج هویت از آشوب است

تشخیص گوینده برای کانالی که همیشه تمیز نیست

تشخیص گوینده در صدای تلفنی یعنی کار با پهنای باند محدود، نویز، افت کیفیت و تغییرات کانال. این پروژه مسیر مدل‌سازی صوت را برای ساخت اثر انگشت صوتی و مقایسه هویت گوینده طراحی کرد؛ جایی که هر فریم صوتی باید از نویز جدا شود و به سیگنال قابل اعتماد تبدیل شود

ابزار و فناوری

Speech ProcessingSpeaker EmbeddingsAudio MLTelephonySignal Processing

01Phone

کانال

گفتار پشت خط تلفن

02Voiceprint

هویت

الگوی صوتی گوینده

03Noise-aware

تمرکز

پایداری روی سیگنال کم‌کیفیت

01

پردازش گفتار

طراحی مسیر استخراج ویژگی و مدل تشخیص برای صدای تلفنی با پهنای باند محدود

02

مدیریت نویز

توجه به افت کیفیت، قطع‌ووصلی و تغییرات کانال در سناریوی تماس واقعی

03

تشخیص هویت صوتی

تبدیل گفتار به بردارهای قابل مقایسه برای شناسایی گوینده

ماموریت بعدی · 07 تحلیل هوشمند سوابق پزشکی