Tutkijatohtori puhe- ja kieliteknologian alalle
Aalto-yliopisto · Espoo
Hybridisenior💰 4,250–5,150 EURResearch · EducationJulkaistu 18.09.2026 klo 03.00
Taidot
Deep LearningMachine Learningaudio processingspeech synthesiswatermarkingPythonPyTorchTensorFlowsignal processingresearch publication
Työn kuvaus
Aalto-yliopistossa tiede ja taide kohtaavat tekniikan ja talouden. Rakennamme kestävää tulevaisuutta saavuttamalla läpimurtoja avainalueillamme ja niiden yhtymäkohdissa. Samalla innostamme tulevaisuuden muutoksentekijöitä ja luomme ratkaisuja maailman suuriin haasteisiin. Yliopistoyhteisöömme kuuluu 16 000 opiskelijaa, 446 professoria ja yli 5000 työntekijää, jotka edustavat yhteensä yli 120 kansalaisuutta. Kampuksemme sijaitsee Espoon Otaniemessä. Monimuotoisuus on osa meitä, ja teemme jatkuvaa työtä yhteisömme monimuotoisuuden ja syrjimättömyyden varmistamiseksi. Siksi kannustammekin päteviä hakijoita taustasta riippumatta liittymään yhteisöömme. Tutkimus tehdään Aalto-yliopiston informaatio- ja tietoliikennetekniikan laitoksella, DICEssä. Projektiympäristö tarjoaa erinomaiset puitteet syväoppimisen, puheen ja audion tutkimukseen. Käytettävissä ovat muun muassa Aalto-yliopiston tieteellisen laskennan klusteri, CSC:n kansallinen laskentainfrastruktuuri mukaan lukien LUMI sekä Aallon Akustiikan Laboratorion kaiuttomat huoneet, kuunteluhuoneet ja audiomittauslaitteet. Haemme nyt tutkijatohtoria puhe- ja kieliteknologian alalle Kiinnostaako sinua läpinäkyvyys, sisällön alkuperä ja jäljitettävyys tekoälyn tuottamassa puheessa, musiikissa ja audiossa? Haemme tutkijatohtoria mukaan COWAMA: Content-based watermarking for AI-generated audio -projektiin, jota johtaa apulaisprofessori Lauri Juvela. Generatiivinen tekoäly pystyy nykyisin tuottamaan yhä realistisempaa puhetta ja musiikkia, mikä herättää tärkeitä kysymyksiä misinformaatiosta, tekijänoikeuksista, omistajuudesta, attribuutiosta ja vastuullisuudesta. EU:n tekoälysäädös edellyttää, että generatiiviset tekoälyjärjestelmät merkitsevät tuotetun sisällön, mutta ulkoinen metadata on helppo poistaa. Siksi tarvitaan myös teknisiä menetelmiä läpinäkyvyyden ja tunnistamisen tukemiseksi. Tässä projektissa kehitetään vesileimausmenetelmiä ja ohjelmistoja puheen ja audion generatiivisiin malleihin. Erityisenä painopisteinä ovat menetelmien robustius ja soveltuvuus avoimen lähdekoodin käyttöön. Roolisi Tutkijatohtorina otat päävastuun syvien sisältöpohjaisten vesileimojen kehittämisestä audiolle ja työskentelet yhdessä väitöskirjatutkijan kanssa robustiuden, arvioinnin ja yleistettävyyden parissa. Tehtäviisi kuuluu: Uusien sisältöpohjaisten vesileimausmenetelmien kehittäminen generoidulle puheelle, musiikille ja äänelle Tunnistusmenetelmien ja laatumittojen suunnittelu tilanteisiin, joissa generoitu audio voi poiketa alkuperäisestä referenssisisällöstä Menetelmien kehittäminen esimerkiksi audiosisällön tunnistuksessa, musiikki-informaation haussa, audiosormenjäljissä, itseohjattujen audiorepresentaatioiden piirrevastaavuuksissa ja referenssittömässä äänen laadun ennustamisessa Vesileimauksen integroiminen syviin generatiivisiin audiopmalleihin, mukaan lukien kollaboratiivisen vesileimauksen käyttö diffuusiomalleissa ja neuraalisiin audiokoodekkeihin perustuviin audion kielimalleissa Sen tutkiminen, voidaanko vesileimainformaatiota upottaa pitkäkestoiseen sisältöön, kuten puheen semantiikkaan, kestoon, prosodiaan tai painotuksiin, eikä ainoastaan paikallisiin signaalitason piirteisiin Robustiuden arviointimenetelmien, differentioituvien augmentaatiotyökalujen ja realististen hyökkäysskenaarioiden kehittäminen audiovesileimoille Tutkimuksen julkaiseminen johtavissa puheen, audion ja koneoppimisen julkaisuissa ja konferensseissa sekä osallistuminen ohjelmistojen, koulutettujen mallien ja toistettavien tutkimustuotosten avoimiin julkaisuihin. Tutkimusmenetelmiin kuuluvat kokeiden suunnittelu, ohjelmistototeutus, syväoppimiskokeiden ajaminen suurteholaskentainfrastruktuurissa sekä arviointi objektiivisilla mittareilla ja subjektiivisilla kuuntelukokeilla. Verkostosi ja tiimisi Ohjaajanasi toimii apulaisprofessori Lauri Juvela, joka johtaa Aalto-yliopiston Speech Synthesis -tutkimusryhmää. Ryhmä työskentelee syvien generatiivisten puhe- ja audiomallien, puhesynteesin, differentioituvan signaalinkäsittelyn, deepfake-tunnistuksen ja vesileimauksen parissa. Aallon puheryhmien ja projektin tutkijatohtorin lisäksi työskentelet kansainvälisessä yhteistyöverkostossa, johon kuuluvat muun muassa professori Junichi Yamagishi National Institute of Informatics -instituutista Japanista, professori Xavier Serra Universitat Pompeu Fabrasta Espanjasta ja professori Gustav Eje Henter KTH Royal Institute of Technologysta Ruotsista. Yhteistyöverkostolla on vahva tausta puheen ja audion synteesissä, syvissä generatiivisissa malleissa ja deepfake-tunnistuksessa, mikä tekee projektista hyvin asemoituneen vaikuttamaan tekoälyllä tuotetun audion vesileimaukseen ja lähteen jäljittämiseen. Odotamme sinulta Etsimme motivoitunutta tutkijaa, jolla on vahva kiinnostus generatiiviseen tekoälyyn, puheeseen, musiikkiin ja audioteknologioihin. Tehtävässä onnistuminen edellyttää: Tohtorin tutkintoa tai pian valmistuvaa tohtorin tutkintoa puheen- tai audionkäsittelyn, koneoppimisen, signaalinkäsittelyn, tietoj