Podczas przepisywania rozmowy z pliku audio szybko okazuje się, że najwięcej trudności nie wynika z samego pisania, lecz z konieczności właściwego odczytania tego, co faktycznie zostało powiedziane. Nagranie może zawierać dłuższe przerwy, zmiany tematu, poprawianie własnych wypowiedzi lub fragmenty wypowiadane bardzo cicho. Transkrypcja nagrań wymaga zatem jednoczesnego słuchania i zapisywania informacji w sposób uporządkowany.
Przy łatwych rozmowach wystarcza zwykle rozpoznanie kolejnych wypowiedzi, jednak przy bardziej złożonym materiale dochodzi identyfikacja osób, zarządzanie kolejności a także zaznaczanie miejsc, których nie można niedwuznacznie odczytać. Ważne jest również rozróżnienie wśród zapisem dosłownym a treścią po redakcji. W pierwszym przypadku pozostawia się naturalne cechy mowy, tj. powtórzenia czy niedokończone zdania. W drugim można ograniczyć elementy utrudniające lekturę, natomiast każda ingerencja w tekst powinna mieć określony cel i nie może prowadzić do zmiany znaczenia wypowiedzi.
Duże znaczenie ma jakość samego nagrania. Plik zarejestrowany w cichym pomieszczeniu daje całkiem inne możliwości niż materiał pochodzący z miejsca, w którym słychać ruch uliczny, pracujące urządzenia lub kilka rozmów prowadzonych jednocześnie. Problematyczne bywają również nagrania z telefonu, gdy urządzenie znajduje się daleko od osoby mówiącej. W takich ustaleniach pojedyncze słowa mogą być trudne do rozpoznania, a próba odtworzenia ich tylko na podstawie kontekstu prowadzi do ryzyka błędu. W praktyce nie gorzej pozostawić oznaczenie niezrozumiałego fragmentu niż wpisać słowo, które jedynie wydaje się prawdopodobne. Przy dłuższych materiałach przydaje się także oznaczanie czasu nagrania. Daje możliwość ono szybko wrócić do dokładnie określonej wypowiedzi i porównać zapis z oryginalnym plikiem. Ma to znaczenie w szczególności wówczas, gdy dokument będzie analizowany przez osoby, które nie uczestniczyły w rozmowie.
W materiałach związanych z postępowaniem prawnym sposób opracowania zapisu może posiadać dodatkowe znaczenie. Transkrypcja do sądu powinna przedstawiać treść nagrania w sposób czytelny, niemniej jednak bez swobodnego interpretowania wypowiedzi uczestników. Nie należy poprawiać sensu zdania tylko dlatego, że rozmówca użył błędnej formy językowej albo przerwał wypowiedź w połowie (zobacz także:stenogram cennik). Jeżeli na nagraniu występuje kilka osób, konieczne jest konsekwentne oznaczanie ich wypowiedzi. Jeszcze trudniejsza sytuacja pojawia się przy mówieniu jednoczesnym, ponieważ wówczas nie zawsze da się ustalić pełną tekst obu wypowiedzi. W takim przypadku warto podkreślić nakładanie się głosów, zamiast tworzyć pozornie kompletny zapis. Znaczenie mogą posiadać też dłuższe pauzy, śmiech, podniesiony głos czy odgłosy wskazujące na reakcję uczestników, jeśli są wyraźnie słyszalne i ważne dla przebiegu rozmowy.
W współzależności od celu dokumentu używa się różnorodne sposoby przedstawiania materiału. Stenogram może być przygotowany w formie bardzo zbliżonej do rzeczywistego przebiegu rozmowy, z zachowaniem kolejności wypowiedzi i charakterystycznych elementów mowy. Przy innych zastosowaniach tekst może zostać uporządkowany tak, by łatwiej było odnaleźć dokładnie określone informacje, bez zmieniania ich znaczenia. W obu przypadkach ważna pozostaje konsekwencja przy stosowaniu oznaczeń oraz dokładne sprawdzanie nazwisk, dat, liczb i nazw własnych. To właśnie takie detale są podatne na pomyłki, zwłaszcza gdy dźwięk jest niewyraźny albo rozmówca posługuje się mało znanym określeniem. Przy pracy z nagraniem warto również pamiętać, że tekst nie oddaje wszystkich cech komunikacji ustnej. Nie każdą intonację czy emocję można niedwuznacznie opisać, dlatego zapis powinien oddzielać to, co faktycznie wynika z nagrania, od interpretacji osoby przygotowującej dokument.
Polecana strona: transkrypcja nagrań.