เครื่องวัดเสียงรบกวน - รับความเข้าใจที่ลึกซึ้งยิ่งขึ้นเกี่ยวกับการลดเสียงรบกวน
หลังจากทำความเข้าใจความแตกต่างพื้นฐานระหว่างการลดเสียงรบกวน (ระงับเสียงรบกวนจากสิ่งแวดล้อมของลำโพงเพื่อให้ผู้ฟังระยะไกลได้ยินอย่างชัดเจน) และการลดเสียงรบกวนแบบแอคทีฟ (ชดเชยเสียงรบกวนจากสิ่งแวดล้อมของผู้ฟังเอง) เรามาดูวิธีลดเสียงรบกวนกันดีกว่า
วิธีหนึ่งคือการใช้ไมโครโฟนหลายตัวเพื่อระงับข้อมูล การรวบรวมข้อมูลจากสถานที่หลายแห่งจะส่งผลให้อุปกรณ์ได้รับสัญญาณที่คล้ายกัน (แต่ยังคงมีความแตกต่าง) สัญญาณเสียงที่ได้รับจากไมโครโฟนใกล้กับกลุ่มผู้พูดจะแรงกว่าไมโครโฟนรองอย่างมาก ไมโครโฟนสองตัวจะได้รับเสียงพื้นหลังที่ไม่ใช่เสียงพูดที่มีความแรงของสัญญาณใกล้เคียงกัน ลบข้อมูลเสียงที่รวบรวมโดยไมโครโฟนเสียงที่ดังและไมโครโฟนรอง และส่วนที่เหลือเป็นข้อมูลเสียงส่วนใหญ่ ยิ่งระยะห่างระหว่างไมโครโฟนมากขึ้นเท่าใด ความแตกต่างของสัญญาณระหว่างไมโครโฟนที่อยู่ใกล้และไกลมากขึ้นเท่านั้น ทำให้ง่ายต่อการใช้อัลกอริธึมง่ายๆ นี้ในการลดเสียงรบกวน อย่างไรก็ตาม เมื่อคุณไม่ได้พูด หรือเมื่อคุณคาดว่าข้อมูลเสียงจะเปลี่ยนแปลงเมื่อเวลาผ่านไป (เช่น เมื่อคุณเดินหรือวิ่ง และโทรศัพท์ของคุณยังคงสั่น) ประสิทธิภาพของวิธีนี้จะลดลง การลดเสียงรบกวนของไมโครโฟนหลายตัวนั้นเชื่อถือได้อย่างแน่นอน แต่ก็มีข้อเสียในด้านฮาร์ดแวร์และการประมวลผลเพิ่มเติม
แล้วถ้ามีไมโครโฟนเพียงตัวเดียวล่ะ? หากไม่ได้ใช้แหล่งเสียงเพิ่มเติมในการตรวจสอบ/เปรียบเทียบ โซลูชันไมโครโฟนตัวเดียวจะต้องอาศัยความเข้าใจลักษณะเสียงที่ได้รับและกรองออก สิ่งนี้เกี่ยวข้องกับคำจำกัดความที่กล่าวถึงก่อนหน้านี้ของเสียงรบกวนในสภาวะคงที่และไม่อยู่กับที่ สัญญาณรบกวนในสภาวะคงตัวสามารถกรองออกได้อย่างมีประสิทธิภาพผ่านอัลกอริธึม DSP ในขณะที่สัญญาณรบกวนที่ไม่อยู่กับที่ก่อให้เกิดความท้าทาย โครงข่ายประสาทเทียมเชิงลึก (DNN) สามารถช่วยแก้ปัญหาได้
วิธีการนี้ต้องใช้ชุดข้อมูลสำหรับการฝึกเครือข่าย ชุดข้อมูลนี้ประกอบด้วยเสียงรบกวนที่แตกต่างกัน (ในสภาวะคงที่และไม่นิ่ง) และคำพูดที่ชัดเจน ทำให้เกิดรูปแบบคำพูดที่มีเสียงดังสังเคราะห์ ป้อนชุดข้อมูลเป็นอินพุตไปยัง DNN และเอาต์พุตด้วยเสียงที่ชัดเจน สิ่งนี้จะสร้างโมเดลโครงข่ายประสาทเทียมที่จะกำจัดเสียงรบกวนและแสดงเฉพาะเสียงพูดที่ชัดเจนเท่านั้น
แม้จะมี DNN ที่ได้รับการฝึกอบรมแล้ว แต่ก็ยังมีความท้าทายและตัวชี้วัดที่ต้องพิจารณา หากคุณต้องการทำงานแบบเรียลไทม์โดยมีความหน่วงต่ำ คุณต้องมีพลังการประมวลผลที่แข็งแกร่งหรือ DNN ที่น้อยกว่า ยิ่งมีพารามิเตอร์ใน DNN มากเท่าใด ความเร็วในการทำงานก็จะยิ่งช้าลงเท่านั้น อัตราการสุ่มตัวอย่างเสียงมีผลเช่นเดียวกันกับการลดเสียง อัตราการสุ่มตัวอย่างที่สูงขึ้นหมายความว่า DNN จำเป็นต้องจัดการพารามิเตอร์มากขึ้น แต่ในทางกลับกัน จะได้เอาต์พุตคุณภาพสูงขึ้น การสื่อสารด้วยเสียงด้วยย่านความถี่แคบเป็นตัวเลือกที่ดีเยี่ยมสำหรับการลดเสียงรบกวนแบบเรียลไทม์
การประมวลผลประเภทนี้เป็นงานที่ต้องใช้ความพยายามอย่างมาก และการประมวลผลแบบคลาวด์ก็มีทักษะมากในการทำงานดังกล่าวให้สำเร็จ แต่วิธีนี้จะเพิ่มเวลาแฝงได้อย่างมาก เมื่อพิจารณาว่ามนุษย์สามารถแยกแยะความล่าช้าที่ประมาณ 108 มิลลิวินาทีหรือมากกว่าได้อย่างน่าเชื่อถือ ความล่าช้าเพิ่มเติมที่เกิดจากการประมวลผลระบบคลาวด์จึงไม่ใช่ผลลัพธ์ในอุดมคติอย่างชัดเจน อย่างไรก็ตาม การเรียกใช้ DNN บน Edge จำเป็นต้องมีการปรับเปลี่ยนที่ชาญฉลาดบางประการ CEVA มุ่งมั่นที่จะปรับปรุงความสามารถในการประมวลผลเสียงพูดและคำพูดของเราอยู่เสมอ ซึ่งรวมถึงความชัดเจนของคำพูดที่ได้รับการตรวจสอบแล้วและอัลกอริธึมการรู้จำคำสั่ง - อัลกอริธึมเหล่านี้ให้การสื่อสารที่ชัดเจนและการควบคุมเสียงแม้ที่ขอบ ยินดีต้อนรับสู่ติดต่อเราและรับฟังด้วยตนเอง






