Nahrávání vterénním lingvistickém výzkumu: jak získat kvalitní záznam řeči?1 Magdalena Zíková — Jan Křivan ABSTRACT: Field recording in linguistic research: how to achieve high-quality audio recordings? The article deals with recording techniques in linguistic field research. It aims at providing linguists with technical and practical knowledge on how to make ahigh quality speech recording in anon-la boratory setting. As the first step in field recording is to master the manipulation with the audio device, the paper starts with the presentation and the explanation of basic concepts related to digital audio signal processing. It goes on with the description of the basic technical equipment for speech recording as well as some of the supplementary components. This should help the readers handle the instruments in practice. Aseparate section is devoted to the classification and the description of external microphones which can be used as an effective extension of compact recording devices. Apart from technical aspects of field recording, practical issues such as the choice of an appropriate place and the organization of the recording session are also discussed. Attention is paid to the ways how to manage and store the recordings too, including proper treatment of the metadata. Finally, some suggestions on how to enhance the spontaneity of the respondents’ speech behaviour are offered. The article draws primarily on the authors’ own experience with field recording and it presupposes no previous knowledge of technical terms and audio processing techniques. KLÍČOVÁ SLOVA / KEY WORDS: digitální audiotechnika, kompaktní rekordér, mikrofon, nahrávání řeči, spontánní projev, terénní lingvistika compact recorder, digital audio, field linguistics, microphone, speech recording, spontaneous speech 0. ÚVOD Zájem lingvistiky se během posledních desetiletí výrazně posunul ve prospěch mluveného jazyka. Přirozený řečový projev, nebo ještě lépe přirozené řečové chování, konkrétně situované do jedinečného času aprostoru amanifestované vprojevu určitého mluvčího, vymezeného společensky ikulturně, lze vsoučasnosti považovat za hlavní předmět jazykového výzkumu. Tento článek předkládáme čtenářům snadějí, že společně snámi ocení iněkteré aktuální praktické otázky, které tento směr zkoumání jazyka neodbytně provázejí. Souběžně smasivním přesunem zájmu se totiž výrazně proměnily imetodologické nároky na lingvistický výzkum. Lingvista moderní doby se již nemůže spoleh1 Tato studie vznikla vrámci Programu rozvoje vědních oblastí na Univerzitě Karlově č. P10 Lingvistika podprogram Vliv faktorů skupinové variability češtiny na vnímání osobnosti mluvčího.
66 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2014 nout jen na vlastní jazykovou intuici aumění spekulace. Svá tvrzení ojazyce čím dál častěji formuluje jako hypotézy vyžadující důkladné empirické ověření. Obstarává si proto patřičná jazyková data, provádí na jejich základě vlastní výzkum aaž nakonec vyslovuje závěry, které teprve mají oprávnění vstoupit do obecného lingvistického povědomí. Ať tak či tak, přístup kpřímým datům je pro moderního lingvistu prakticky nutností ajeho připravenost aschopnost ztěchto dat těžit se stává jeho hlavní zbraní vboji opřežití na vědeckém iakademickém poli. Jak ovšem tato data získat? Buď sáhneme po dostupných korpusech, ať už menších, specifičtějších souborech, které jsou kdispozici na různých výzkumných pracovištích, nebo se vydáme hledat do hlubokých vod celonárodních korpusů, pro češtinu korpusů čnk. Právě tam asi směřují první ponorné sondy kověření teprve klíčících hypotéz. Jakkoli cenné korpusy čnk nicméně jsou, mají své limity, znichž nejpalčivější je stále zřetelná převaha psaných korpusů nad mluvenými, ve většině případů absence zvukové stopy nebo její nízká kvalita, omezená lemmatizace ahranice zobrazitelného kontextu. Nehledě na leckdy obtížné vyhledávání, pro určité typy výzkumných otázek je formát takto budovaných korpusů jednoduše nedostatečný— při sledování kontextuálních výrazů, při zaměření na specifické, vkorpusu nereprezentované skupiny mluvčích atd. Často tak nezbývá než si nahrávku pořídit samostatně. Ovšem získat kvalitní (což leckdy znamená tolik co použitelnou) nahrávku je operace poměrně komplikovaná. Zde je třeba především vyvrátit mezi lingvisty poměrně rozšířený (aspíše obranný) předpoklad, že pro určité typy analýz, soustředěné na vyšší jazykové roviny, si vystačíme ishorší úrovní záznamu, aže proto není třeba do nahrávání investovat více prostředků, času aenergie, než je nutné. Omyl, taková úvaha je krátkozraká anešetrná. Stálou snahou každého výzkumníka by mělo být pořídit nahrávku natolik kvalitní, nakolik je to jen za daných okolnostní možné, neboť materiál, který získává, by měl být principiálně využitelný ipro jiné účely, než za jakými byl původně pořizován (viz např. Nathan, 2009). Tento článek je míněn jako jakýsi úvodní bedekr pro všechny, kteří na pole nahrávání teprve vstupují. Jeho cílem je představit základní technické pojmy, které jsou svázány snahrávací technikou, azásady, které se vyplatí při nahrávání vpřirozeném komunikačním prostředí dodržovat. Vycházíme zde ze základní situace, kdy výzkumník sám pořizuje rozhovor srespondentem, nebo se zapojuje do rozhovoru více účastníků. Výklad přímo cílí na stereotyp výzkumníka lingvisty/filologa, který pojmy jako frekvence, amplituda či perioda až dosud považoval za šťastně nepotřebné. Teoretické otázky akustiky proto budou pojednány nanejvýš pietně, sohledem na netechnicky orientovaného čtenáře. První kapitola seznámí stechnickou ipraktickou stránkou nahrávání za pomoci kompaktních rekordérů, druhá kapitola představí možnosti rozšíření kompaktního rekordéru oexterní mikrofony, ve třetí kapitole ukážeme základní operace při dodatečné úpravě nahrávek vaudiosoftwaru, čtvrtá kapitola připomene zásady správy auchovávání nahrávky aněkteré formální povinnosti svázané snahráváním akonečně poslední, pátá kapitola se věnuje otázce spontaneity projevu.
MAGDALENA ZíKOVÁ — JAN KřIVAN 67 1. NAHRÁVÁNÍ SKOMPAKTNÍMI REKORDÉRY Předpokládejme, že většina znás se při nahrávání vterénu nechce utkávat sexterními mikrofony, kabely apředzesilovači aplně nám postačí malý, kompaktní rekordér, který nevyžaduje žádné další příslušenství. Kvalitativně slušných nahrávacích zařízení tohoto typu avtéto kategorii je kdostání několik, jejich cena se pohybuje mezi pěti až deseti tisíci korun. Při správném výběru (apoužití) přístroje už itaková investice dovoluje velmi dobrý záznam řeči azároveň nevylučuje pozdější rozšíření nahrávací výbavy odalší součásti. Dnešním standardem jsou rekordéry digitální, které (podobně jako digitální fotoaparáty) ukládají data přímo na vyjímatelné paměťové karty. Zacházení srůznými rekordéry imožnosti jejich nastavení jsou velmi podobné. Hlavní rozdíly mezi přístroji lze pozorovat spíše ve zpracování jejich analogových částí (zejm. mikrofonů), které mají zásadní vliv na kvalitu vstupního signálu. Digitální záznam zvukové vlny spočívá vpřekladu analogového signálu do diskrétní podoby vpodobě číselné informace. Schematicky si tento převod můžeme představit jako „sejmutí otisku“ zvukové vlny pomocí mřížky, kterou na vlnu přiložíme akterá vpravidelných časových intervalech do nejbližšího uzlu vláken aproximuje průběh zvukové vlny. Samozřejmě platí, že čím jemnější mřížka, tím větší pokrytí uzly atím ivěrnější rekonstrukce obrazu zvukové vlny. Otázkám apochopení, jak správně nastavit přístroj pro nerušený převod vlny do digitální podoby, se věnujeme voddílech 1.1 až 1.3. Voddílu 1.4 probíráme praktické otázky související spoužitím rekordéru při samotném nahrávání. 1.1 VZOrKOVACí FrEKVENCE ABITOVÁ HLOUBKA Rozlišení digitální mřížky, která ukládá souřadnice zvukové vlny, je konkrétně dáno dvěma parametry: vzorkovací frekvencí („sampling rate“) abitovou hloubkou („bit depth“). Znázorněny jsou na obrázku 1. Zvuková vlna se odvíjí včase (osa x) avyznačuje se určitou amplitudou (osa y). Vzorkovací frekvence udává hrubost mřížky na osex(vjak velkých časových intervalech bude vlna snímána), bitová hloubka její rozlišení na ose y (jak přesně bude naměřena výchylka). obrázek 1: Vzorkovací frekvence abitová hloubka. Úsek vyobrazené zvukové vlny je digitálně zaznamenán pomocí třinácti vzorků vpěti úrovních hloubky. Průběh vlny je aproximován vdaný časový okamžik pomocí nejbližšího uzlu mřížky.
68 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2014 Kratší intervaly mezi vzorky (= jednotlivými okamžiky sejmutí) logicky zachytí vlny svyšší frekvencí, tedy srychlejším kmitáním. Uvážíme-li, že lidské ucho slyší zvuky ve frekvenčním rozsahu cca 20–20 000 Hz (Howard— Angus, 2009, s. 89),2 je pro úplný přenos zvuku třeba zajistit, aby ifrekvenční složky kolem 20 000 Hz byly vdigitálním signálu přítomny. Toho docílíme jednoduše tím, že nejvyšší frekvenční složka, kterou jsme schopni sluchově postihnout, bude sejmuta dvakrát během každé své periody. Obecně řečeno, pro úplnou rekonstrukci zvukového signálu by vzorkovací frekvence měla být dvojnásobkem nejvyšší frekvence, kterou je lidské ucho schopno zachytit (Nyquistův teorém; viz např. Zsiga, 2013, s. 124). Při hrubším měřítku bude zvuková informace ochuzena ovyšší frekvenční složky. Většina nahrávacích přístrojů dnes takovému nároku dostojí: standardní vzorkovací frekvence kvality cd (hudebního „cédéčka“) je 44,1 kHz, mnozí lingvisté fonetici ovšem doporučují nahrávání při 48 kHz. Pro běžného posluchače je rozdíl mezi srovnávanými úrovněmi nepostřehnutelný astejně tak bychom asi jen stěží sluchově vyhodnotili pokles vkvalitě signálu ipři 32 kHz. Strochou zjednodušení lze navíc říci, že ipro standardní fonetickou analýzu řeči dostačují informace přítomné do 8 000 Hz frekvenčního rozsahu řečového signálu; do vyšších pásem zasahuje většina řečových zvuků měrou, která není pro jejich charakter klíčová.3 Pracovně bychom tedy mohli konstatovat, že vzorkovací frekvence neklesající pod 16 kHz (8000 × 2) by teoreticky měla být stále dostatečná pro většinu lingvistických izákladních fonetických analýz, ikdyž poslechová kvalita signálu při 16 kHz je už znatelně horší. Představu onižších vzorkovacích frekvencích pak můžeme získat zběžného telefonního hovoru, který bývá přenášen ve frekvenci 8 000 Hz. Není zároveň výjimkou, že nahrávací přístroj disponuje ifrekvencemi vyššími— 88,2 kHz a96 kHz. Jejich využití je už spíše věcí vyhraněných osobních preferencí či specifických zájmů. Rozdíly vobjemu přenášené informace mezi různými vzorkovacími frekvencemi jsou ilustrovány na obrázku 2. Stejně jako má vzorkovací frekvence přímý vztah kčasu, vněmž se vlna odvíjí, atím kfrekvenci, bitová hloubka má přímý vztah kjejí amplitudě: udává, jak přesně (vkolika úrovních) je amplituda zachycena, což má přímý vliv na dynamický rozsah signálu. Standardem je dnes 16bitové rozlišení (tj. kódování řetězcem 16 digitálních číslic binární hodnoty), používané ve formátech cd, které pracuje s65 536 úrovněmi (216) apokrývá rozsah 96 dB. Mnozí fonetikové ovšem prosazují až 24bitové rozlišení, nabízející 16 777 216 (224) úrovní apokrývající dynamický rozsah 144 dB, což je celá škála mezi zvukem na samém prahu slyšitelnosti azvukem dosahujícím prahu bolesti. Kvalitní nahrávací přístroj by měl umožnit obě úrovně záznamu. Samozřejmě je třeba poznamenat, že— stejně jako uvzorkovacích frekvencí— jsou rozdíly mezi oběma rovinami (16bitová × 24bitová) daleko za hranicemi toho, co jsme schopni sluchově vyhodnotit jako různé; ostatně dynamický rozsah řeči samotné (tedy rozdíl 2 Horní hranice je pro průměrného dospělého jedince spíše nadhodnocena. Autoři udávají pro dvacetiletého jedince hodnotu 16 000 Hz stím, že limit se po tomto věku dále postupně snižuje. 3 Pokud se ovšem soustředíme na rozbor sykavek, měli bychom rozhodně volit vyšší vzorkovací frekvenci— takovou, která dovolí zobrazit hladinu do cca 16 kHz, tedy minimálně 32 kHz. Sykavky patří mezi hlásky sjednoznačně nejvyšším frekvenčním těžištěm.
MAGDALENA ZíKOVÁ — JAN KřIVAN 69 mezi nejtiššími anejhlasitější řečovými zvuky, které vběžných podmínkách produkujeme) se běžně udává jako 40 dB (Eargle, 2005, s. 4). Ukládání ve formátu wav je při zaznamenávání řeči samozřejmostí. Další zvukové formáty, snimiž se nejčastěji setkáváme při poslechu hudby (zejm. mp3), představují tzv. ztrátovou kompresi. Při těchto metodách jsou hodnoty nasnímané ve výše popsané mřížce následně systematicky promazávány adopočítávány různými algoritmy. Ztoho je patrné, že kvalita zachycení signálu vždy utrpí (např. pro přesná akustická měření je formát mp3 zcela nepoužitelný); proto je třeba se kompresi vyhýbat. 1.2 HLASITOST VSTUPU (INPUT LEVEL) Správné nastavení hlasitosti4 vstupního signálu je jedním zklíčových předpokladů pro vytvoření kvalitní nahrávky. Neznalost vzorkovací frekvence nebo bitové hloubky dokážou některé nahrávací přístroje kompenzovat prostě tím, že příliš nízké 4 Termín „hlasitost“ zde užíváme vsouladu sjeho běžným, neodborným významem, nikoli vjeho striktním terminologickém vymezení. obrázek 2: Spektrogram věty Zmrzlá prašivka vmodrém lese pronesené ženskou mluvčí při různých vzorkovacích frekvencích. Všimněme si, že a) nejvyšší zaznamenané frekvence signálu dosahují vždy do poloviny vzorkovací frekvence, b) snižováním vzorkovací frekvence jsou nejvíce postiženy sykavky (zrnité vertikální pruhy stěžištěm ve vysokých oblastech).
70 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2014 úrovně ani nenabízejí, apraktické riziko vysokých úrovní spočívá jen vnadměrně velkém datovém objemu výsledné nahrávky. Pokud ovšem podceníme nastavení hlasitosti vstupního signálu, můžeme lehce skončit snahrávkou buďto tzv. přebuzenou, nebo skoro neslyšitelnou. Druhý případ lze za určitých předpokladů (kvalitní rekordér snízkým inherentním šumem) ještě řešit dodatečným zpracováním vaudiosoftwaru (viz níže), přebuzení signálu ovšem nahrávku pro každou detailnější řečovou analýzu sjistotou devalvuje. Zde je tedy několik praktických doporučení, která výše uvedená nebezpečí pomohou eliminovat. Při přepnutí rekordéru do nahrávacího modu se na displeji automaticky aktivuje stupnice měření hladiny zvuku vstupního signálu (viz obrázek 3). Na digitálních zařízeních je udávána vjednotkách dB, resp. dbfs (= „DeciBels relative to Full Scale“), což prakticky neznamená nic jiného, než že aktuální hodnoty vdB jsou vyjadřovány vminusových hodnotách, jako odečet od maximální možné hodnoty vstupu přístroje, která odpovídá 0 dbfs. Dosahuje-li tedy např. aktuální signál na stupnici k−12 dB, je o12 dB nižší, než je maximum (plná škála), které je přístroj schopen přijmout. Hodnota minima je přitom dána právě bitovou hloubkou: při 16bitovém rozlišení dosahuje k−96 dbfs, při 24bitovém rozlišení k−144 dbfs atd. Potěšující zprávou je, že znalost číselných hodnot není pro nastavení hlasitosti vstupu nezbytná, úplně stačí orientovat se vizuálně, podle toho, ve které části stupnice dosahuje vstupní signál vrcholu. Pokud se při příjmu řečového zvuku jen mihotá vdolní (levé) půli nebo uprostřed stupnice, je vhodné vstup (pomocí tlačítek Input Level, někdy také Rec Level) zesílit. Ideální stav je ten, kdy nejhlasitější řečové zvuky vstupního signálu dosahují konstantně cca −12 až −6 dbfs, tedy když jsou smírnou rezervou pod absolutním maximem. Samozřejmě čím více různě hlasitých vstupů (různí mluvčí různě daleko, zapojení do různých aktivit), tím větší péči je třeba nastavení věnovat. Vždy by ale mělo platit, že určující je nejhlasitější signál, který chceme zachytit. Pokud je vstupní signál hlasitější než maximální úroveň vstupu, kterou přístroj dokáže přijmout, informuje otom indikátor Peak (případně Overload). Výsledkem je, že zvuková vlna je vtéto výchylce zaznamenána nekompletně: digitální mřížka (na ose y) nestačí na to, aby zvukovou vlnu obsáhla celou, ajejí vrchol tak na výšku přečnívá (dojde kodstřihnutí vlny, angl. „clipping“, viz obrázek 4). Kodstřihnutí obvykle dochází při náhlých hlasitých neřečových zvucích, jako je zakašlání, kýchnutí apod., nebo při různých zvucích provázejících mluvní aktivitu (pomlaskávání apod.), které ani nemusíme vnímat jako zvlášť hlasité. Vtěchto případech je to přirozené atolerovatelné anení se třeba při každém takovém zvuku 70 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2014 úrovně ani nenabízejí, apraktické riziko vysokých úrovní spočívá jen vnadměrně velkém datovém objemu výsledné nahrávky. Pokud ovšem podceníme nastavení hlasitosti vstupního signálu, můžeme lehce skončit snahrávkou buďto tzv. přebuzenou, nebo skoro neslyšitelnou. Druhý případ lze za určitých předpokladů (kvalitní rekordér snízkým inherentním šumem) ještě řešit dodatečným zpracováním vaudiosoftwaru (viz níže), přebuzení signálu ovšem nahrávku pro každou detailnější řečovou analýzu sjistotou devalvuje. Zde je tedy několik praktických doporučení, která výše uvedená nebezpečí pomohou eliminovat. Při přepnutí rekordéru do nahrávacího modu se na displeji automaticky aktivuje stupnice měření hladiny zvuku vstupního signálu (viz obrázek 3). Na digitálních zařízeních je udávána vjednotkách dB, resp. dbfs (= „DeciBels relative to Full Scale“), což prakticky neznamená nic jiného, než že aktuální hodnoty vdB jsou vyjadřovány vminusových hodnotách, jako odečet od maximální možné hodnoty vstupu přístroje, která odpovídá 0 dbfs. Dosahuje-li tedy např. aktuální signál na stupnici k−12 dB, je o12 dB nižší, než je maximum (plná škála), které je přístroj schopen přijmout. obrázek 3: Stupnice dBFS na displeji přístroje. Černá výplň ukazuje přibližné hodnoty pro levý apra - vý mikrofon (−7 dBFS, resp. −9 dBFS). Oddělené pole P („Peak“) by indikovalo překročení maxima. Hodnota minima je přitom dána právě bitovou hloubkou: při 16bitovém rozlišení dosahuje k−96 dbfs, při 24bitovém rozlišení k−144 dbfs atd. Potěšující zprávou je, že znalost číselných hodnot není pro nastavení hlasitosti vstupu nezbytná, úplně stačí orientovat se vizuálně, podle toho, ve které části stupnice dosahuje vstupní signál vrcholu. Pokud se při příjmu řečového zvuku jen mihotá vdolní (levé) půli nebo uprostřed stupnice, je vhodné vstup (pomocí tlačítek Input Level, někdy také Rec Level) zesílit. Ideální stav je ten, kdy nejhlasitější řečové zvuky vstupního signálu dosahují konstantně cca −12 až −6 dbfs, tedy když jsou smírnou rezervou pod absolutním maximem. Samozřejmě čím více různě hlasitých vstupů (různí mluvčí různě daleko, zapojení do různých aktivit), tím větší péči je třeba nastavení věnovat. Vždy by ale mělo platit, že určující je nejhlasitější signál, který chceme zachytit. Pokud je vstupní signál hlasitější než maximální úroveň vstupu, kterou přístroj dokáže přijmout, informuje otom indikátor Peak (případně Overload). Výsledkem je, že zvuková vlna je vtéto výchylce zaznamenána nekompletně: digitální mřížka (na ose y) nestačí na to, aby zvukovou vlnu obsáhla celou, ajejí vrchol tak na výšku přečnívá (dojde kodstřihnutí vlny, angl. „clipping“, viz obrázek 4). Kodstřihnutí obvykle dochází při náhlých hlasitých neřečových zvucích, jako je zakašlání, kýchnutí apod., nebo při různých zvucích provázejících mluvní aktivitu (pomlaskávání apod.), které ani nemusíme vnímat jako zvlášť hlasité. Vtěchto případech je to přirozené atolerovatelné anení se třeba při každém takovém zvuku - 40 - 30 - 20 - 12 - 6 P L R
MAGDALENA ZíKOVÁ — JAN KřIVAN 71 znepokojovat. Pokud je ovšem absolutní vrchol během nahrávání atakován častěji, ato zejména při zaznamenávání řeči, je třeba hladinu vstupu snížit, jinak je zvuková vlna nenávratně poškozena (viz obrázek 5). Vkaždém případě je nutné správnou hladinu vstupu otestovat ještě před nahráváním avyladit ji přímo na konkrétní situaci. Přístroj by už měl spočívat na místě, na kterém po celou dobu nahrávání zůstane, vrelativně stejné vzdálenosti od respondentů. Dobré je nechat rekordér před samotným začátkem sezení prostě chvíli ležet, aby se sním mohl citlivější respondent alespoň vizuálně seznámit anepanikařil při každé zaznamenané aktivitě na displeji. Zároveň je třeba počítat stím, že vprůběhu nahrávání bude možná potřeba vstup mírně zeslabit, neboť souběžně stím, jak mluvčí ztrácí rozpaky, přidává na hlasitosti. Zpočátku nesmělý projev na hranici slyšitelnosti často ústí do suverénního, hlasitého finále. Pokud ovšem zasahujeme do parametrů nahrávání během sezení, nemělo by se tak dít přímo během promluvy, nýbrž vpauzách ana tematických předělech. obrázek 4: Odstřihnutí vlny. Amplituda vlny je ve fázích III–VI vyšší, než je maximální úroveň vstupu. Šedě podbarvené úseky vyznačují místa, kde je vlna odstřihnuta. obrázek 5: Clipping. Zvuková vlna věty Zmrzlá prašivka vmodrém lese znehodnocená odstřihnutím částí vlny. MAGDALENA ZíKOVÁ — JAN KřIVAN 71 znepokojovat. Pokud je ovšem absolutní vrchol během nahrávání atakován častěji, ato zejména při zaznamenávání řeči, je třeba hladinu vstupu snížit, jinak je zvuková vlna nenávratně poškozena (viz obrázek 5). Vkaždém případě je nutné správnou hladinu vstupu otestovat ještě před nahráváním avyladit ji přímo na konkrétní situaci. Přístroj by už měl spočívat na místě, na kterém po celou dobu nahrávání zůstane, vrelativně stejné vzdálenosti od respondentů. Dobré je nechat rekordér před samotným začátkem sezení prostě chvíli ležet, aby se sním mohl citlivější respondent alespoň vizuálně seznámit anepanikařil při každé zaznamenané aktivitě na displeji. Zároveň je třeba počítat stím, že vprůběhu nahrávání bude možná potřeba vstup mírně zeslabit, neboť souběžně stím, jak mluvčí ztrácí rozpaky, přidává na hlasitosti. Zpočátku nesmělý projev na hranici slyšitelnosti často ústí do suverénního, hlasitého fi nále. Pokud ovšem zasahujeme do parametrů nahrávání během sezení, nemělo by se tak dít přímo během promluvy, nýbrž vpauzách ana tematických předělech. obrázek 4: Odstřihnutí vlny. Amplituda vlny je ve fázích III–VI vyšší, než je maximální úroveň vstupu. Šedě podbarvené úseky vyznačují místa, kde je vlna odstřihnuta. obrázek 5: Clipping. Zvuková vlna věty Zmrzlá prašivka vmodrém lese znehodnocená odstřihnutím částí vlny. I II III IV V VI VII VIII MAGDALENA ZíKOVÁ — JAN KřIVAN 71 znepokojovat. Pokud je ovšem absolutní vrchol během nahrávání atakován častěji, ato zejména při zaznamenávání řeči, je třeba hladinu vstupu snížit, jinak je zvuková vlna nenávratně poškozena (viz obrázek 5). Vkaždém případě je nutné správnou hladinu vstupu otestovat ještě před nahráváním avyladit ji přímo na konkrétní situaci. Přístroj by už měl spočívat na místě, na kterém po celou dobu nahrávání zůstane, vrelativně stejné vzdálenosti od respondentů. Dobré je nechat rekordér před samotným začátkem sezení prostě chvíli ležet, aby se sním mohl citlivější respondent alespoň vizuálně seznámit anepanikařil při každé zaznamenané aktivitě na displeji. Zároveň je třeba počítat stím, že vprůběhu nahrávání bude možná potřeba vstup mírně zeslabit, neboť souběžně stím, jak mluvčí ztrácí rozpaky, přidává na hlasitosti. Zpočátku nesmělý projev na hranici slyšitelnosti často ústí do suverénního, hlasitého fi nále. Pokud ovšem zasahujeme do parametrů nahrávání během sezení, nemělo by se tak dít přímo během promluvy, nýbrž vpauzách ana tematických předělech. obrázek 4: Odstřihnutí vlny. Amplituda vlny je ve fázích III–VI vyšší, než je maximální úroveň vstupu. Šedě podbarvené úseky vyznačují místa, kde je vlna odstřihnuta. obrázek 5: Clipping. Zvuková vlna věty Zmrzlá prašivka vmodrém lese znehodnocená odstřihnutím částí vlny. I II III IV V VI VII VIII
72 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2014 1.3 SPECIÁLNí FUNKCE: LIMITER, AGC, LOW CUT Většina nahrávacích přístrojů nabízí škálu speciálních funkcí, umožňujících dále modifikovat přijímaný signál. Představíme zde tři standardní funkce, které pomáhají automaticky eliminovat deformace zvukové vlny (viz předchozí oddíl) ataké potlačit některé nežádoucí zvuky. Udalších funkcí, zde nezmíněných, doporučujeme silnou obezřetnost. Je lepší se vždy držet pravidla „nepoužívat nic navíc, pokud pro to nemám dobrý důvod“. Výrobce totiž obvykle nabízí různé efekty, které mohou mít na zvukový signál podobně zásadní anevratný účinek jako převedení barevné fotografie na černobílou. Funkce Limiter automaticky zeslabuje příliš hlasitý vstupní signál. Vokamžiku, kdy vlna narazí na práh hlasitosti, začne se místo jednoduchého odstřihnutí (viz předchozí oddíl) stlačovat jakoby pod pístem. Frekvence vlny tedy zůstává nezměněna, ovšem amplituda se sníží. Vzávislosti na typu limiteru (který je vpřístroji pevně nastaven) může být tato změna okamžitá (viz obrázek 6), nebo postupná. Když se amplituda vrátí do normálu, přístroj snížení hlasitosti postupně zruší apokračuje vnahrávání podle původního nastavení. Funkce se dobře uplatní při krátkodobém zvýšení hlasitosti projevu nebo při neočekávatelných, ale nevyhnutelných rušivých zvucích, jako je zakašlání, vyjeknutí dítěte vpozadí atd. obrázek 6: Limiter. Amplituda vlny je po dosažení maxima okamžitě snížena, takže je deformována jen ve fázi III (srov. sobrázkem 4). Když se intenzita vstupního signálu ve fázích VII–VIII sníží na původní hodnotu, limiter ještě krátce pokračuje ve snižování hlasitosti, než amplitudu postupně zvýší. Funkce AGC, příp. ALC („Automatic Gain Control / Automatic Level Control“ neboli automatická kontrola příjmu) jednoduše řečeno vyrovnává úroveň různě hlasitých zvuků, tedy zesiluje tiché zvuky azeslabuje silné. Na rozdíl od limiteru se tedy neaplikuje jen na příliš hlasité zvuky, ale pracuje neustále; ztoho také vyplývá, že svyužitím limiteru se logicky vylučuje (tyto dvě funkce obvykle nalezneme vnastavení společně). Při záznamu řeči pro analytické účely se AGC prakticky nepoužívá. Především může vést knechtěnému efektu posílení rušivých zvuků vtichých pasážích asoučasně nutně narušuje přirozené rozvržení nahrávané situace, které si experimentátor připraví. Jen výjimečně by mohl experimentátor uvítat vyvažování hlasitosti, např. mezi mluvčími různě vzdálenými od mikrofonu. 72 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2014 1.3 SPECIÁLNí FUNKCE: LIMITER, AGC, LOW CUT Většina nahrávacích přístrojů nabízí škálu speciálních funkcí, umožňujících dále modifikovat přijímaný signál. Představíme zde tři standardní funkce, které pomáhají automaticky eliminovat deformace zvukové vlny (viz předchozí oddíl) ataké potlačit některé nežádoucí zvuky. Udalších funkcí, zde nezmíněných, doporučujeme silnou obezřetnost. Je lepší se vždy držet pravidla „nepoužívat nic navíc, pokud pro to nemám dobrý důvod“. Výrobce totiž obvykle nabízí různé efekty, které mohou mít na zvukový signál podobně zásadní anevratný účinek jako převedení barevné fotografie na černobílou. Funkce Limiter automaticky zeslabuje příliš hlasitý vstupní signál. Vokamžiku, kdy vlna narazí na práh hlasitosti, začne se místo jednoduchého odstřihnutí (viz předchozí oddíl) stlačovat jakoby pod pístem. Frekvence vlny tedy zůstává nezměněna, ovšem amplituda se sníží. Vzávislosti na typu limiteru (který je vpřístroji pevně nastaven) může být tato změna okamžitá (viz obrázek 6), nebo postupná. Když se amplituda vrátí do normálu, přístroj snížení hlasitosti postupně zruší apokračuje vnahrávání podle původního nastavení. Funkce se dobře uplatní při krátkodobém zvýšení hlasitosti projevu nebo při neočekávatelných, ale nevyhnutelných rušivých zvucích, jako je zakašlání, vyjeknutí dítěte vpozadí atd. obrázek 6: Limiter. Amplituda vlny je po dosažení maxima okamžitě snížena, takže je deformována jen ve fázi III (srov. sobrázkem 4). Když se intenzita vstupního signálu ve fázích VII–VIII sníží na původní hodnotu, limiter ještě krátce pokračuje ve snižování hlasitosti, než amplitudu postupně zvýší. Funkce AGC, příp. ALC („Automatic Gain Control / Automatic Level Control“ neboli automatická kontrola příjmu) jednoduše řečeno vyrovnává úroveň různě hlasitých zvuků, tedy zesiluje tiché zvuky azeslabuje silné. Na rozdíl od limiteru se tedy neaplikuje jen na příliš hlasité zvuky, ale pracuje neustále; ztoho také vyplývá, že svyužitím limiteru se logicky vylučuje (tyto dvě funkce obvykle nalezneme vnastavení společně). Při záznamu řeči pro analytické účely se AGC prakticky nepoužívá. Především může vést knechtěnému efektu posílení rušivých zvuků vtichých pasážích asoučasně nutně narušuje přirozené rozvržení nahrávané situace, které si experimentátor připraví. Jen výjimečně by mohl experimentátor uvítat vyvažování hlasitosti, např. mezi mluvčími různě vzdálenými od mikrofonu.
MAGDALENA ZíKOVÁ — JAN KřIVAN 73 Funkcí Low Cut jsou vybaveny téměř všechny nahrávací přístroje vpopisované kategorii. Jejím úkolem je potlačit nízké frekvence vsignálu. Praktické využití nachází vsituacích, kdy je řečový signál podbarven nějakým nízkofrekvenčním zvukem (hučení ledničky, větráku počítače atd.) nebo když nahráváme venku ve větru. Všechny tyto poměrně hluboké zvuky lze teoreticky odstínit právě aktivací funkce Low Cut. Přitom je ovšem třeba mít na paměti, že spolu srušivým zvukem budou nutně potlačeny ipříslušné frekvenční složky řeči, takže pokud by se nahrávka měla uplatnit jako materiál pro fonetickou analýzu, spíše než použití této funkce bychom měli najít jiné řešení, jak rušivé podbarvení odstínit (viz níže). Vpřípadě potřeby lze navíc podobných výsledků jako pomocí funkce Low Cut docílit kontrolovanými dodatečnými úpravami vaudiosoftwaru. 1.4 rOZVrŽENí NAHrÁVACí SITUACE Vpředchozích kapitolách jsme se zabývali hlavně vnitřním (technickým) vybavením rekordérů, tím, jak fungují ajaké informace pro nás snímají. Nyní můžeme postoupit ktomu, jak spřístrojem zacházet vsituaci nahrávání: kam ho umístit, jakých činností se vyvarovat ajak jednoduše kompenzovat nepříznivé nahrávací podmínky (neboť nepříznivé nahrávací podmínky jsou absolutní univerzálií terénní práce). Obecně platí, že bychom se měli snažit rekordér umístit vždy tak, abychom umožnili co nejlepší vstup zvukům, které opravdu chceme slyšet, azároveň vmaximální možné míře potlačili všechny zvuky, které slyšet nechceme. Oba požadavky nelze obvykle naplnit beze zbytku. Na praktických příkladech si ukážeme alespoň některé obvyklejší situace. Vycházíme přitom ztoho, že nahráváme ve vnitřním prostředí aže naše nároky na kvalitu nahrávky jsou relativně vysoké. Vzdálenost mezi mluvčím amikrofonem stejně jako orientace mikrofonu vzhledem kmluvčímu je pro kvalitní výstup samozřejmě zásadní. Vjaké vzdálenosti přístroj umístit, záleží na typu mikrofonu. Stranou nyní necháváme externí mikrofony (viz oddíl 2), které mohou být instalovány vbezprostřední blízkosti mluvčího, atím odstínit ruchy zokolí. Ukompaktních rekordérů sinterními mikrofony lze za základní pozici považovat tu, vníž přístroj spočívá na stabilním místě (nejčastěji na stole) cca 50–70 cm od každého zrespondentů, ideálně tak, aby každý zmikrofonů mířil na jednoho zmluvčích. Izde však existují rozdíly. Některé přístroje mají mikrofony tzv. všesměrové, znichž každý může snadno snímat více mluvčích najednou. (Otypech mikrofonů viz podrobněji voddílu 2.) Jiné typy rekordérů, stzv. směrovými mikrofony, jsou oproti tomu navrženy tak, že každý zmikrofonů plně snímá jen část okolí adovolí tak plnohodnotně zaměřit jen jednoho, maximálně dva mluvčí. (Ukázky prostorového záběru mikrofonů viz oddíl 2.2.) Řečové záznamy pořízené směrovými mikrofony na jedné straně avšesměrovými na druhé se při stejné pozici přístroje amluvčích značně liší, proto je potřeba vědět, jaký mikrofon je vpřístroji zabudován, avkaždém případě provést zkušební nahrávku. Poškození nahrávky může způsobit povrch stolu— pokud je hladký, bez ubrusu, přístroj spolehlivě posbírá všechny zvuky, které se stolem šíří: od náhodného zavadění ostůl nohou (malé zemětřesení) přes nenechavé poklepávání na desku stolu nebo na stole postavený hrneček až po dolévání čaje, míchání lžičkou atd. Navíc,
80 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2014 tech jsou přitom pro pozdější využití nahrávky nezbytné, neboť poskytují základní parametry nutné pro zahrnutí získaného materiálu do jakéhokoli výzkumného vzorku. Pracovní rutina spjatá snahráváním by proto měla striktně obsahovat zaznamenání základních údajů, které se krespondentovi vztahují: a) jméno akontakt, b) datum amísto, kdy akde byla nahrávka pořízena, c) jméno osoby, která nahrávku pořizovala, akontakt na ni (ne vždy je pořizovatel nahrávky jejím jediným uživatelem), d) minimálně základní charakteristiky respondenta, mezi něž patří přibližný věk, dosažené vzdělání, místo původu, tj. oblast, ve které strávil dětství (nikoli nutně místo narození), místo původu jeho rodičů ajeho jazykové znalosti azkušenosti (dlouhodobé pobyty vcizích zemích atd.). Všechny získané informace jsou samozřejmě soukromé ajako stakovými snimi musíme nakládat. Stejnou pozornost jako osobním datům respondentů je přitom třeba věnovat isamotné nahrávce. Při volbě pirátské strategie utajeného nahrávání (která není předmětem tohoto článku) je respondentův dodatečný souhlas samozřejmostí (!), ale ivjiných, méně odvážných případech je respondentův písemný souhlas sbudoucím využitím nahrávky standardní praxí. Všechny potenciálně citlivé informace (jména osob amíst) by měly být znahrávky odstraněny (nejlépe jejich zamaskováním pomocí uměle vygenerovaného tónu), zejména pokud bude nahrávka dále šířeji využívána. Pozornost by měla být věnována izpůsobu pojmenování zvukového souboru. Pokud je nahrávka určena pro širší využití, zásadně ji neoznačujeme jménem respondenta, např. Adam_Neposkvrněný.wav. Zetického ipraktického hlediska je vhodné vytvořit pro každou nahrávku systematický, apřitom netriviální kód, který zachytí základní rysy respondenta (pohlaví, regionální původ) asoučasně zastře jeho identitu. Vygenerovaná šifra by měla být komplexnější než pouhé iniciály nahrávané osoby. Ve studiích či publikacích pak knahrávkám odkazujeme rovněž prostřednictvím jim přiřazených kódů— průhledné kódování je vodborných kruzích vesměs považováno za neprofesionální faux pax. Při prezentaci nahrávek se pak skutečná jména nahrazují falešnými; publikum na to bývá upozorněno. Seznamy jmen respondentů spolu spřiřazenými kódy ajiné potenciálně citlivé informace by zároveň měly být uchovány odděleně od nahrávek samotných, nejlépe na jiném počítači, nebo alespoň vjiném adresáři. 5. SPONTANEITA PROJEVU Závěrem bychom se rádi dotkli otázky, co lze vlastně považovat za spontánní projev ajak takový projev získat vpodmínkách, které přirozenosti vyjadřování zpodstaty nepřejí. Názory lingvistů na toto téma se různí; někteří jakoukoli regulaci nahrávané situace odmítají aza jedině spontánní projev považují takový, který byl nahrán bez předchozího vědomí respondenta (samozřejmě sjeho dodatečným souhlasem; viz Benešová— Waclawičová, 2014),9 jiní jako spontánní označují iprojevy, které vznikly vnahrávacím studiu, tedy pro většinu mluvčích ve výsostně nepřirozeném prostředí (samozřejmě při adekvátním nastavení nahrávací situace; viz Ernestus, 2000, 9 Podle dalších lingvistů (Meyerhoff et al., 2011, s. 143) je však nahrávání bez předchozího souhlasu jednoznačně neetické.
MAGDALENA ZíKOVÁ — JAN KřIVAN 81 s. 90–91). Existují ipokusy míru spontánnosti projevu exaktně popsat pomocí akustických alingvistických nástrojů (viz Dufour et al., 2010). Obecně se dá říci, že nároky na spontaneitu projevu jsou vnegativní úměře knárokům na kvalitu záznamu: nahrávání vpřirozeném prostředí vutajení garantuje sice maximálně přirozený projev, nese ssebou ovšem výrazná rizika pro kvalitu akustického výstupu. Na druhé straně vprostředí nahrávacího studia či sheadsetovým mikrofonem docílíme často výborné kvality, rezignujeme ovšem na plně spontánní projev. Samozřejmě jako všude záleží na tom, co od nahrávky především očekáváme. Vsouladu sdůrazem kladeným doposud na kvalitu výstupu nahrávání se vtomto bodě kloníme spíš kvelkorysejšímu pojetí spontaneity ajsme přesvědčeni, že iztechnicky manipulované, akusticky „dobře ošetřené“ situace může vzejít vysoce přirozený výstup. Artificiálnost podmínek, za kterých záznam vzniká, je ovšem třeba kompenzovat jinými strategiemi. Sheadsetem na hlavě nebo ve zvukotěsné nahrávací kabině je většina mluvčích zcela přirozeně nesvá, avdůsledku toho bojuje srůznými typy externích iinterních normativních tlaků. Protože tyto normativní síly plynou především zcizosti prostředí anezvyklosti situace, která narušuje běžné vyjadřovací návyky mluvčího, je třeba je kompenzovat nějakým spolehlivě důvěrným prvkem. Jedním znečekaně spolehlivých katalyzátorů spontaneity rozhovoru je angažování blízké osoby, se kterou je respondent vdlouholetém přátelském poutu (viz již systematický přístup Labova, 1972, s. 210). Nejenže se mluvčí výrazně rychleji zbaví přirozených zábran, ale oba navíc sdílejí společné znalosti, při hovoru čerpají ze společných témat avneposlední řadě znají své individuální řečové návyky, ať už artikulační, nebo formulační. Každý znich si proto může dovolit úspornější, redukovanější vyjadřování— to, které ve formálně nastavených rozhovorech těžko hledáme. Samozřejmě lze tohoto postupu využít jen pro určité účely asnutnou výhradou, že striktně spontánního, nekontrolovaného projevu jím nedosáhneme. Naším úmyslem není navrhovanou metodu prosazovat jako jedinou možnou, ale spíš na základě vlastní praktické zkušenosti upozornit na její překvapivě vysokou účinnost, samozřejmě za současného respektování nutných omezení sní spjatých. 6. ZÁVĚR Spontánní řeč je stále ceněnějším zdrojem lingvistických poznatků apostupně se kní přesunuje pozornost větší části lingvistických disciplín. Spomocí moderní techniky, umožňující časově, operačně ifinančně relativně nenáročný, apřitom kvalitní zvukový záznam, má lingvistika konečně příležitost revidovat klasické jazykovědné koncepty, které se po dlouhou dobu jejího vývoje utvářely téměř výlučně na materiálu psaných textů, akonfrontovat je se zcela jiným modem jazykové komunikace— komunikace, která ve skutečnosti chtě nechtě tvoří drtivou většinu naší vzájemné jazykové interakce. Každodenní přirozené vyjadřování vsobě skrývá odpovědi na otázky tradičně jen obtížně zodpověditelné: otázky po jazykové změně, po jejím vztahu kjazykové variabilitě, ale ipo jemných, tradičními pojmy lingvistiky nezachytitelných prvcích komunikace. Jako lingvisté bychom měli být schopni tuto složitou hru komunikačních znaků důvěryhodně aprofesionálně zaznamenat, byť to znamená zorien-
82 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2014 tovat se voblasti jazyku relativně vzdálené. Jazyk je ze své povahy nestálý: vprůběhu času se vyvíjí amění, nesen jedinečnými, ve svém celku neopakovatelnými projevy. Kzaznamenání každého takového projevu máme nutně jen jednu šanci. Pro mnoho jazyků současného světa to navíc může být išance poslední. LITERATURA: BENEŠOVÁ, Lucie— WACLAWIČOVÁ, Martina (2014): Korpus neformální mluvené češtiny ORAL2013. In: Václav Cvrček— Olga Richterová (eds.), Manuál práce sČnk [online]. Praha: Ústav Českého národního korpusu FF UK vPraze. Cit. 4. 2. 2014. Dostupné zWWW: <http://wiki.korpus.cz/doku. php?id=cnk:oral2013&rev=1391502113>. DUFOUR, Richard— JOUSSE, Vincent— ESTèVE, Yannick— BÉCHET, Frederic— LINARèS, Georges (2010): Spontaneous speech characterization and detection in large audio database. Příspěvek přednesený na konferenci 13th International Conference on Speech and Computer (Specom 2009). Saint Petersburg 21.–25. 6. 2009. EARGLE, John (20054): Handbook of Recording Engineering. Dordrecht: Springer. ERNESTUS, Mirjam (2000): Voice Assimilation and Segment Reduction in Casual Dutch: ACorpusBased Study of the Phonology-Phonetics Interface. Utrecht: LOT. HOWARD, David M.— ANGUS, Jamie A. S. (20094): Acoustics and Psychoacoustics. Oxford: Focal Press. LABOV, William (1972): Sociolinguistic Patterns. Philadelphia, PA: University of Pennsylvania Press. MARGETTS, Anna— MARGETTS, Andrew (2011): Audio and video recording techniques for linguistic research. In: Nicholas Thieberger (ed.), The Oxford Handbook of Linguistic Fieldwork. Oxford: Oxford University Press, s. 13–53. MEYERHOFF, Miriam— ADACHI, Chie— NANBAKHSH, Golnaz— STRYCHARZ, Anna (2011): Sociolinguistic fieldwork. In: Nicholas Thieberger (ed.), The Oxford Handbook of Linguistic Fieldwork. Oxford: Oxford University Press, s. 121–146. NATHAN, David (2009): Sound recording: microphones. In: Endangered Languages Archive [online; druhá revize 15. 5. 2009]. London: SOAS University of London. Cit. 18. 12. 2013. Dostupné zWWW: <http://www.elar-archive.org/documenting/ equipment/microphones.php>. ROSE, Jay (2003): Producing Great Sound for Digital Video. San Francisco, CA— New York, NY— Lawrence, KS: CMP Books. ZSIGA, Elizabeth C. (2013): The Sounds of Language: An Introduction to Phonetics and Phonology. Malden, MA— Oxford— Chichester: Wiley-Blackwell. Magdalena Zíková | Ústav obecné lingvistiky FF UK vPraze <
[email protected]> Jan Křivan | Ústav obecné lingvistiky FF UK vPraze <
[email protected]>