전체 글(28)
-
STT 엔진 교체기
벤치마크 점수만 믿다가 알게 된 것들 — 정확도, 오류 성격, 그리고 자원 병목사내 상담 녹취를 처리하는 STT 엔진을 교체하면서 겪은 과정을 정리했습니다. 결론부터 말하면, 공개 벤치마크에서 가장 높은 점수를 받은 구성이 실제 녹취에서는 가장 나빴습니다. 왜 그런 일이 벌어지는지, 그리고 그 과정에서 발견한 성능 병목까지 함께 다룹니다. 1. 벤치마크는 이겼는데 실전에서 졌다비교한 구성은 세 가지입니다. 기존 운영 중이던 레거시 구성, 현재 운영 구성, 그리고 검토 중인 신규 모델입니다.구성Public 벤치마크실제 녹취구 VAD + 구 ETRI (레거시)86.881.8Silero + 신 ETRI (현행)90.975.0Silero + Qwen3 (검토)94.884.1※ CER 기반 정확도 점수, 높을수록..
2026.08.24 -
Codex Error : Quota exceeded. Check your plan and billing details.
1. 크레딧을 다 썼거나(잔액 0) 또는 월 지출 한도(max monthly spend/usage limit)에 도달하지는 않음2. 다른 세션에서도 같은 API키를 썼음3. 문제가 발생하는 window에서 api 키를 다른 계정으로 바꿔도 같은 증상 해결방법: codex가 실행되는 위치가 /usr/local/lib/node_modules/@openai/codex 인데,의존성(codex-linux-x64)을 /usr/lib/node_modules/@openai/codex 쪽에 넣음그래서 codex가 “내 폴더 안에서 @openai/codex-linux-x64를 못 찾는다”가 계속 발생# 0) 실제 실행 codex 위치 확인(둘이 다르면 지금 문제가 재현됨) which codex ls -l $(which..
2026.02.13 -
STT / TTS의 개념 부터 응용까지 (1)
파형, 진폭, 주파수파형(waveform) 은 소리를 시간 순서대로 기록한 신호입니다. 보통 그래프로 보면 가로축은 시간, 세로축은 신호 값입니다.이때 세로축 값이 의미하는 것이 진폭(amplitude) 입니다. 진폭은 신호의 “크기”를 나타내며, 시간에 따라 얼마나 강해졌다 약해졌는지(변동)를 파형에서 확인할 수 있습니다.주파수(frequency) 는 신호가 얼마나 빠르게 반복(진동)되는지를 나타내는 값입니다(Hz). 실제 음성/음악은 하나의 주파수만 있는 게 아니라 여러 주파수 성분이 섞여 있으므로, “어떤 주파수가 얼마나 들어있는지”를 보기 위해 시간영역(파형)에서 주파수영역으로 옮겨 봅니다.스펙트럼과 스펙트로그램스펙트럼(spectrum) 은 신호를 주파수 성분으로 나눴을 때, 주파수별로 성분이 얼..
2026.02.04 -
RadGPT: A System Based on a Large Language Model That Generates Sets of Patient-Centered Materials to Explain Radiology Report Information
1. 연구 배경21세기 치료법(Cures Act, 2021.04.05 시행):환자가 자신의 건강 기록(예: 방사선 보고서)에 전자적으로 즉시 접근할 수 있도록 의무화.문제점:방사선 보고서는 의학 전문 용어가 많아 환자가 이해하기 어려움.의사의 설명 전에 보고서를 보면 환자가 불안·오해를 일으킬 수 있음.의료진에게 전화 문의 증가 → 시간 소모 및 소진(burnout)**으로 이어질 수 있음.현황:미국 성인의 평균 독해 수준은 8학년 수준.하지만 방사선 보고서 중 이 수준으로 읽을 수 있는 것은 4%에 불과.필요성:환자가 이해할 수 있도록 쉽게 풀어주는 자동화된 설명 도구 필요.대규모 언어 모델(LLM)이 그 해결책이 될 수 있음.2. 연구 목적GPT-4와 RadGraph를 활용하여 방사선 보고서를 환자 ..
2025.09.05 -
RadGraph-XL: A Large-Scale Expert-Annotated Dataset for Entity and Relation Extraction from Radiology Reports (요약)
1. 연구 배경영상의학 보고서는 환자 진료 과정에서 핵심적인 역할을 하지만, 대부분 비정형(unstructured) 텍스트 형태로 작성되어 임상 연구와 전산화된 응용에 직접 활용하기 어렵습니다.언어적 특성: 전문 용어, 복잡한 수식어, 불명확한 서술 포함.기존 자동화의 한계: 특정 질환 여부 분류는 가능했지만, 개별 임상 개체(entity)와 관계(relation) 수준의 구조적 정보 추출에는 부족.전문가 주석 비용: 고도의 도메인 지식을 가진 영상의학 전문의의 참여가 필요해 비용·시간 부담이 큼.기존의 대표적 데이터셋인 RadGraph-1.0은 흉부 X-ray 보고서만을 다루고 있어 CT, MRI 등 다양한 modality에는 적용할 수 없다는 제한이 있었습니다.2. 기존 연구 동향대규모 라벨링 데이터..
2025.09.05 -
Attention 구조 비교: MHA vs MQA vs GQA
1. 개요용어정의MHAMulti-Head Attention: Q, K, V를 모두 여러 Head로 나눠 독립적으로 계산하는 전통적인 구조MQAMulti-Query Attention: Q는 여러 개, K/V는 하나만 계산하고 모든 Head에서 공유GQAGrouped-Query Attention: Q는 여러 개, K/V는 일부 Head끼리 공유 (MQA와 MHA의 절충형) 2. 구조 비교항목MHA (기본형)MQA (속도 최적화형)GQA (절충형)Query (Q)각 Head마다 다름각 Head마다 다름각 Head마다 다름Key (K)각 Head마다 다름공통 (1개만 사용)그룹별 공유 (예: 8개 그룹)Value (V)각 Head마다 다름공통그룹별 공유KV 캐시 크기num_heads 만큼1개 (8~16배 감소)..
2025.05.30