고급과정18학점 인정

🔍 다국어 AI 데이터 구축

정식 과정명 : 다국어 AI 데이터 PM·AI Agent 평가 마스터

이수 학점

18학점

총 교육시간

315시간

교육 기간

2026.8.31(월) ~ 12.1(화)

구성

총 48일 (오프라인 32일 · 온라인 16일)

📘 과정 소개

AI 학습데이터의 수집·정제·품질관리·PM 실무를 익혀, 다국어 데이터 구축 프로젝트를 주도하고 싶은 학생에게 권장합니다.

교육 목표

기업에 즉시 투입 가능한 수준의 고숙련 '다국어 AI 데이터 PM' 및 'AI Agent 평가 전문가' 역량 체화

교육 대상

부산외국어대학교 재학생 (언어 전공자 중심)

시수 구성

오프라인 232H · 온라인 83H

이런 학생에게 권장합니다

  • AI 학습데이터의 수집·정제·품질관리 실무를 익히고 싶은 학생
  • 다국어 데이터 구축 프로젝트를 직접 주도해 보고 싶은 학생
  • 데이터 PM(프로젝트 관리) 직무를 목표로 하는 학생

📚 교과목 구성

1

다국어 AI 데이터 처리를 위한 Python 기초 및 데이터셋 활용

41H정영직

오프라인 24H · 비대면 실시간 17H

  1. 1AI 데이터셋·한·영 병렬 말뭉치 및 학습·검증·평가 데이터 이해
  2. 2Python 기본 문법과 문자열·리스트·딕셔너리 처리
  3. 3조건문·반복문·함수 및 데이터 처리 규칙 구현
  4. 4NumPy 배열·shape·dtype·reshape 및 기초 통계
  5. 5Pandas 기반 CSV 탐색·정제·분석 및 결과 저장
  6. 6PyTorch Tensor·Dataset·DataLoader와 MNIST 데이터 구조 체험
  7. 7KNN 기반 특징값·라벨·학습·평가 데이터 활용 실습
2

다국어 데이터 윤리·저작권·규제 대응

31H정영직

오프라인 12H · 비대면 실시간 19H

  1. 1글로벌 AI 규제(GDPR·EU AI Act) 및 다국어 데이터 거버넌스 이해
  2. 2글로벌 기준의 개인정보 비식별화(De-identification) 기법 실습
  3. 3AI 훈련 데이터와 저작권법·공정 이용(Fair Use) 원칙
  4. 4오픈 데이터 라이선스(CC·ODbL) 분석 및 데이터 조합 실무
  5. 5저작권·윤리적 위험 평가 체크리스트 구축
  6. 6데이터 출처 명시(Provenance) 및 계보 관리 워크플로우 설계
3

저자원 언어 AI 데이터 구축 전략

28H정영직

오프라인 12H · 비대면 실시간 16H

  1. 1저자원 언어 정의 및 데이터 구축 전략 수립
  2. 2웹 크롤링 및 다중 모달(OCR·음성) 기반 데이터 수집·전처리
  3. 3전이학습(Transfer Learning)·Few-shot 기반 소량 데이터 극복 전략
  4. 4효율적 전사(Transcription) 및 주석(Annotation) 효율화 전략
  5. 5병렬 코퍼스(Parallel Corpus) 구축 및 기계 번역 활용 실무
  6. 6데이터 품질 검증(QA) 및 벤치마크 평가
4

다국어 AI 데이터 자동화 및 파이프라인 설계

63H정영직

오프라인 32H · 비대면 실시간 31H

  1. 1데이터 자동화 개념 및 JSONL 구조 이해
  2. 2ETL·CSV·JSON·JSONL 구조와 마스터 데이터 스키마 설계
  3. 3텍스트·이미지·음성 정합성 검증 및 어노테이션 가이드라인 작성
  4. 4Python·Pandas 기반 결측·중복·형식·언어 코드 자동 검증과 정제·증강
  5. 5역번역 기반 번역 품질·문화적 맥락 검토, IAA 측정 및 데이터 편향 분석
  6. 6End-to-End 품질검증 파이프라인·로그·대시보드와 Alpy Agent·Workflow 연계
  7. 7Dataset Card 작성, Hugging Face·GitHub 패키징 및 통합 시연
5

LLM 학습용 다국어 데이터셋 설계 및 구축 전략

40H정영직

오프라인 40H

  1. 1LLM 학습용 다국어 데이터셋 아키텍처 설계 및 토크나이제이션 이해
  2. 2다국어 토크나이저 비교 및 서브워드 분할 실습
  3. 3다국어 데이터 혼합 비율 및 데이터셋 커리큘럼 설계
  4. 4다국어 데이터셋 샘플링·밸런싱 자동화
  5. 5데이터셋 카드·문서화 표준 및 편향 평가 지표 적용
  6. 6데이터셋 품질 진단 리포트 작성 및 산업별 데이터 실습(캡스톤 연계)
6

산업별 다국어 AI 데이터 프로젝트 캡스톤

112H정영직

오프라인 112H

  1. 1산업별(의료·금융·유통·제조) 데이터 요구사항 분석 및 프로젝트 착수
  2. 2데이터 수집·정제·전처리 및 주석 가이드라인 설계·적용
  3. 3품질 검증 자동화 파이프라인 구축
  4. 4데이터 증강 및 편향 완화
  5. 5중간 발표·피드백 및 데이터셋 최종 정제·명세서 작성
  6. 6파이프라인 최적화·문서화 및 통합 테스트·성능 평가
  7. 7Alpy 기반 AI Agent 구축(캡스톤 데이터셋 연동) 및 안정성 평가
  8. 8최종 보고서 작성, 포트폴리오 배포 및 최종 발표·수료

📆 달력형 일정

총 48일 (오프라인 32일 · 온라인 16일) · 총 315시간

오프라인온라인(VOD)수업 없음

20268

3
4
5
6
7
10
11
12
13
14
17
18
19
20
21
24
25
26
27
28
316H
오프라인

입문

AI 데이터셋과 Python 실행 환경

20269

16H
오프라인

Python①

문자열·리스트·딕셔너리
25H
온라인

Python②

조건문·반복문·함수
35H
온라인

NumPy

배열과 AI 데이터의 수치 표현
4
76H
오프라인

Pandas①

한·영 병렬 데이터셋 탐색
86H
오프라인

Pandas②

한·영 병렬 데이터셋 정제와 분석
95H
온라인

Tensor·Dataset

모델 입력 구조와 KNN 체험
105H
온라인

평가+브리지

Python 데이터 처리 실기평가 및 품질검증 연계
11
146H
오프라인

규제

글로벌 AI 규제와 다국어 데이터 거버넌스
156H
오프라인

비식별화

개인정보 보호 원칙과 비식별화 실무
165H
온라인

저작권

AI 훈련 데이터와 저작권·공정 이용
175H
온라인

라이선스·출처

오픈 데이터 라이선스 분석과 데이터 출처 명시
18
216H
온라인

위험·계보

저작권·윤리 위험 평가와 계보 관리 워크플로우
226H
온라인

전략 수립

저자원 언어 데이터 구축 전략
23
24
25
286H
오프라인

수집

웹 크롤링·멀티모달 데이터 수집
296H
오프라인

극복 전략

소량 데이터 극복: 전이학습·Few-shot
305H
온라인

효율화·구축

전사·주석 효율화와 병렬 코퍼스 구축

202610

15H
온라인

검증

품질 검증(QA)과 벤치마크 평가
2
5
66H
온라인

자동화 입문

데이터 자동화 개념 및 JSONL 구조 이해
75H
온라인

ETL·형식

CSV·JSON·JSONL과 데이터 스키마 설계
8
9
126H
오프라인

정합성

멀티모달 마스터 데이터 설계
136H
오프라인

어노테이션·검증

가이드라인 설계와 자동 검증
145H
온라인

번역 품질

역번역과 문화적 맥락 검증
155H
온라인

일치도·편향

IAA 측정과 데이터 편향 분석
16
196H
오프라인

자동화

데이터 정제·증강·로그 처리
206H
오프라인

파이프라인 통합

End-to-End 품질검증 파이프라인
215H
온라인

Agent 연계

Alpy 기반 데이터 품질관리 Agent와 Workflow
225H
온라인

문서화·배포

품질 모니터링, Dataset Card 및 포트폴리오 패키징
23
26
27
28
29
30

202611

28H
오프라인

평가

데이터 품질검증 파이프라인 및 포트폴리오 발표
38H
오프라인

설계 기초

LLM 데이터셋 개요와 토크나이제이션
48H
오프라인

설계① 분석

다국어 토크나이저 비교와 서브워드 분할
58H
오프라인

설계② 구성

데이터 혼합 비율과 커리큘럼 설계
6
98H
오프라인

구축·문서화

샘플링·밸런싱 자동화와 데이터셋 카드 작성
108H
오프라인

진단·연계

품질 진단 리포트와 산업별 캡스톤 주제 선정
118H
오프라인

캡스톤① 착수

프로젝트 착수 및 데이터 수집
128H
오프라인

캡스톤① 구축

데이터 정제·전처리
13
168H
오프라인

캡스톤① 구축

주석 가이드라인 설계 및 적용
178H
오프라인

캡스톤② 검증

품질 검증 자동화 파이프라인 구축
188H
오프라인

캡스톤② 검증

데이터 증강 및 편향 완화
198H
오프라인

캡스톤② 검증

중간 발표 및 피드백
208H
오프라인

캡스톤③ 고도화

데이터셋 최종 정제 및 데이터 명세서(Dataset Card) 작성
238H
오프라인

캡스톤③ 고도화

파이프라인 최적화·통합 테스트 및 성능 평가
248H
오프라인

캡스톤④ Agent

Alpy 플랫폼 이해 및 AI Agent 설계
258H
오프라인

캡스톤④ Agent

Alpy 기반 AI Agent 구축(캡스톤 데이터셋 연동)
268H
오프라인

캡스톤④ Agent

Agent 안정성 평가 및 결과 보완
278H
오프라인

캡스톤⑤ 완성

최종 보고서 작성 및 파이프라인 문서화
308H
오프라인

캡스톤⑤ 완성

포트폴리오(Hugging Face·GitHub) 최종 점검·배포 및 발표 자료 작성·리허설

202612

18H
오프라인

캡스톤⑤ 완성

과정 최종 발표·회고, 총정리 Q&A 및 수료식
2
3
4
7
8
9
10
11
14
15
16
17
18
21
22
23
24
25
28
29
30
31

🗓️ 일자별 상세

각 수업의 이론·실습 내용입니다.

일자교육형태시수교육 주제담당
8/31(월)오프라인 10:00~17:006H입문AI 데이터셋과 Python 실행 환경

[이론] AI 학습 데이터, 한·영 병렬 말뭉치, 입력·라벨 및 학습·검증·평가 데이터 개념 [실습] Colab 환경 구성, 변수·자료형·기본 입출력

정영직
9/1(화)오프라인 10:00~17:006HPython①문자열·리스트·딕셔너리

[이론] 한·영 문장쌍과 메타데이터를 Python 자료구조로 표현하는 방법 [실습] 문자열 처리와 리스트·딕셔너리 기반 병렬 데이터 다루기

정영직
9/2(수)온라인 10:00~16:005HPython②조건문·반복문·함수

[이론] 데이터 처리 규칙을 코드로 표현하는 기본 구조 [실습] 빈 문장·문장 길이·언어 문자 비율 검사 함수 작성

정영직
9/3(목)온라인 10:00~16:005HNumPy배열과 AI 데이터의 수치 표현

[이론] NumPy 배열, shape, dtype, 인덱싱, reshape 및 기초 통계 [실습] 문장 길이·단어 수를 NumPy 배열로 변환하고 통계 확인

정영직
9/7(월)오프라인 10:00~17:006HPandas①한·영 병렬 데이터셋 탐색

[이론] DataFrame·Series, CSV 구조, 행·열 선택과 조건 필터링 [실습] 병렬 데이터 CSV 불러오기, head·info·describe 확인 및 도메인별 조회

정영직
9/8(화)오프라인 10:00~17:006HPandas②한·영 병렬 데이터셋 정제와 분석

[이론] 결측값·중복·공백·문장 길이·도메인 분포 처리 [실습] 정제 전후 비교, 언어·도메인별 집계 및 정제 CSV 저장

정영직
9/9(수)온라인 10:00~16:005HTensor·Dataset모델 입력 구조와 KNN 체험

[이론] NumPy와 Tensor 비교, Dataset·DataLoader·batch 및 KNN 개념 [실습] MNIST 데이터 구조 확인, 준비된 KNN 코드 실행 및 문장 특징 기반 언어 분류 결과 비교

정영직
9/10(목)온라인 10:00~16:005H평가+브리지Python 데이터 처리 실기평가 및 품질검증 연계

[평가] 한·영 병렬 데이터 불러오기·정제·기초 분석 실기평가(과정1, 오전 2h) [연계] 글로벌 AI 규제와 다국어 데이터 거버넌스 준비(과정2, 오후 3h)

정영직
9/14(월)오프라인 10:00~17:006H규제글로벌 AI 규제와 다국어 데이터 거버넌스

[이론] 글로벌 AI 규제(GDPR·EU AI Act) 프레임워크와 다국어 데이터 윤리 [실습] 규제 프레임워크 기반 데이터 거버넌스 사례 분석

정영직
9/15(화)오프라인 10:00~17:006H비식별화개인정보 보호 원칙과 비식별화 실무

[이론] 개인정보 보호 원칙 및 비식별화(De-identification) 개념 [실습] 글로벌 기준의 개인정보 비식별화 기법 적용

정영직
9/16(수)온라인 10:00~16:005H저작권AI 훈련 데이터와 저작권·공정 이용

[이론] AI 훈련 데이터와 저작권법 및 공정 이용(Fair Use) [실습] 저작권 분쟁·공정 이용 사례 분석

정영직
9/17(목)온라인 10:00~16:005H라이선스·출처오픈 데이터 라이선스 분석과 데이터 출처 명시

[이론] 오픈 데이터 라이선스(CC·ODbL) 체계 및 출처 명시(Provenance) 개념 [실습] 라이선스 분석·데이터 조합 실무 및 출처 표기 실습

정영직
9/21(월)온라인 10:00~17:006H위험·계보저작권·윤리 위험 평가와 계보 관리 워크플로우

[이론] 저작권·윤리적 위험 평가 프레임워크 및 데이터 계보(Lineage) 관리 [실습] 위험 평가 체크리스트 구축 및 출처·계보 관리 워크플로우 설계

정영직
9/22(화)온라인 10:00~17:006H전략 수립저자원 언어 데이터 구축 전략

[이론] 저자원 언어 정의 및 데이터 부족 극복 전략 [실습] 대상 언어 선정 및 저자원 언어 구축 전략서 초안 작성

정영직
9/28(월)오프라인 10:00~17:006H수집웹 크롤링·멀티모달 데이터 수집

[이론] 웹 크롤링·OCR·음성 기반 데이터 수집 개요 [실습] 저자원 언어 웹 크롤링 및 다중 모달(OCR·음성) 데이터 수집

정영직
9/29(화)오프라인 10:00~17:006H극복 전략소량 데이터 극복: 전이학습·Few-shot

[이론] 전이학습(Transfer Learning) 및 Few-shot 전략 [실습] 소량 데이터 기반 Few-shot 주석 효율화

정영직
9/30(수)온라인 10:00~16:005H효율화·구축전사·주석 효율화와 병렬 코퍼스 구축

[이론] 전사(Transcription)·주석(Annotation) 효율화 전략 및 병렬 코퍼스·기계 번역 활용 [실습] 전사·주석 워크플로우 구축, 병렬 코퍼스 구축 및 기계 번역 적용

정영직
10/1(목)온라인 10:00~16:005H검증품질 검증(QA)과 벤치마크 평가

[이론] 데이터 품질 검증(QA) 지표 및 벤치마크 개념 [실습] 품질 검증·벤치마크 평가 수행 및 저자원 언어 구축 전략서 최종화

정영직
10/6(화)온라인 10:00~17:006H자동화 입문데이터 자동화 개념 및 JSONL 구조 이해

[이론] 데이터 자동화 개념 및 JSONL 스키마 이해 [실습] CSV·JSONL 대응 관계 확인 및 변환 구조 실습

정영직
10/7(수)온라인 10:00~16:005HETL·형식CSV·JSON·JSONL과 데이터 스키마 설계

[이론] ETL 개념, 데이터 형식 비교, 필수·선택 필드 및 다국어 인코딩 [실습] CSV→JSONL 변환, 스키마 정의 및 유효성 검사

정영직
10/12(월)오프라인 10:00~17:006H정합성멀티모달 마스터 데이터 설계

[이론] 텍스트·이미지·음성 데이터 연결, 고유 ID·파일 경로·메타데이터 관리 [실습] 마스터 CSV 구축, 누락 파일·중복 ID·불일치 데이터 자동 확인

정영직
10/13(화)오프라인 10:00~17:006H어노테이션·검증가이드라인 설계와 자동 검증

[이론] 라벨 정의, 포함·제외 기준, 예외 처리 및 검수자 판단 규칙 [실습] Python·Pandas 기반 필수 열·결측·중복·허용값·문장 길이 검증 코드 작성

정영직
10/14(수)온라인 10:00~16:005H번역 품질역번역과 문화적 맥락 검증

[이론] 의미 대응, 누락·과잉 번역, 고유명사·수치·문체·문화적 표현 검토 [실습] 번역·역번역 결과 비교, 품질 플래그 부여 및 교정 의견 작성

정영직
10/15(목)온라인 10:00~16:005H일치도·편향IAA 측정과 데이터 편향 분석

[이론] 단순 일치율, Cohen 계수 개념, 언어·도메인·문장 길이 편중 [실습] 검수자 불일치 추출, 언어별 분포 분석 및 편향 리포트 작성

정영직
10/19(월)오프라인 10:00~17:006H자동화데이터 정제·증강·로그 처리

[이론] 함수 기반 정제 단계, 합성·증강 데이터 관리 및 실행 로그 설계 [실습] 정상·오류 데이터 분리 저장, 처리 건수 집계 및 오류 로그 생성

정영직
10/20(화)오프라인 10:00~17:006H파이프라인 통합End-to-End 품질검증 파이프라인

[이론] 입력·스키마 검사·정제·검증·JSONL 변환·리포트 생성 흐름 [실습] 전체 파이프라인 통합 실행, 오류 구간 확인 및 처리 결과 검증

정영직
10/21(수)온라인 10:00~16:005HAgent 연계Alpy 기반 데이터 품질관리 Agent와 Workflow

[이론] 품질검토 프롬프트, 구조화된 출력, 단계별 데이터 처리와 평가 흐름 [실습] 데이터 오류 분류·수정 권고 Agent 구성, Workflow 실행 및 평가 결과 확인

정영직
10/22(목)온라인 10:00~16:005H문서화·배포품질 모니터링, Dataset Card 및 포트폴리오 패키징

[이론] 품질 지표 시각화, Dataset Card 구성, Hugging Face·GitHub 배포 구조 [실습] Looker Studio 대시보드 구성, Dataset Card 작성 및 결과물 패키징

정영직
11/2(월)오프라인 09:00~18:008H평가데이터 품질검증 파이프라인 및 포트폴리오 발표

[평가] 개인별 파이프라인 실행, Alpy Agent 시연, 품질 리포트·Dataset Card·포트폴리오 발표

정영직
11/3(화)오프라인 09:00~18:008H설계 기초LLM 데이터셋 개요와 토크나이제이션

[이론] LLM 학습용 다국어 데이터셋 개요 및 토크나이제이션 [실습] 토크나이제이션 기초 실습

정영직
11/4(수)오프라인 09:00~18:008H설계① 분석다국어 토크나이저 비교와 서브워드 분할

[이론] 다국어 토크나이저 특성 비교 [실습] 토크나이저 비교 및 서브워드 분할 실습

정영직
11/5(목)오프라인 09:00~18:008H설계② 구성데이터 혼합 비율과 커리큘럼 설계

[이론] 다국어 데이터 혼합 비율 및 데이터셋 커리큘럼 설계 [실습] 혼합 비율 설계 사례 분석 및 커리큘럼 설계서 작성

정영직
11/9(월)오프라인 09:00~18:008H구축·문서화샘플링·밸런싱 자동화와 데이터셋 카드 작성

[이론] 데이터셋 샘플링·밸런싱 전략, 데이터셋 카드·문서화 표준 및 편향 평가 지표 [실습] 다국어 데이터셋 샘플링·밸런싱 자동화 및 데이터셋 카드 작성

정영직
11/10(화)오프라인 09:00~18:008H진단·연계품질 진단 리포트와 산업별 캡스톤 주제 선정

[이론] 데이터셋 품질 진단 프레임워크 및 산업별(의료·금융·유통·제조) 데이터 요구사항 [실습] 데이터셋 품질 진단 리포트 작성, 산업별 데이터 실습 및 캡스톤 주제 선정

정영직
11/11(수)오프라인 09:00~18:008H캡스톤① 착수프로젝트 착수 및 데이터 수집

산업별 데이터 요구사항 확정, 수집 계획 수립 및 원천 데이터 수집

정영직
11/12(목)오프라인 09:00~18:008H캡스톤① 구축데이터 정제·전처리

결측·중복·노이즈 처리, 정규화 및 스키마 정합성 확보

정영직
11/16(월)오프라인 09:00~18:008H캡스톤① 구축주석 가이드라인 설계 및 적용정영직
11/17(화)오프라인 09:00~18:008H캡스톤② 검증품질 검증 자동화 파이프라인 구축정영직
11/18(수)오프라인 09:00~18:008H캡스톤② 검증데이터 증강 및 편향 완화정영직
11/19(목)오프라인 09:00~18:008H캡스톤② 검증중간 발표 및 피드백정영직
11/20(금)오프라인 09:00~18:008H캡스톤③ 고도화데이터셋 최종 정제 및 데이터 명세서(Dataset Card) 작성정영직
11/23(월)오프라인 09:00~18:008H캡스톤③ 고도화파이프라인 최적화·통합 테스트 및 성능 평가정영직
11/24(화)오프라인 09:00~18:008H캡스톤④ AgentAlpy 플랫폼 이해 및 AI Agent 설계정영직
11/25(수)오프라인 09:00~18:008H캡스톤④ AgentAlpy 기반 AI Agent 구축(캡스톤 데이터셋 연동)정영직
11/26(목)오프라인 09:00~18:008H캡스톤④ AgentAgent 안정성 평가 및 결과 보완정영직
11/27(금)오프라인 09:00~18:008H캡스톤⑤ 완성최종 보고서 작성 및 파이프라인 문서화정영직
11/30(월)오프라인 09:00~18:008H캡스톤⑤ 완성포트폴리오(Hugging Face·GitHub) 최종 점검·배포 및 발표 자료 작성·리허설정영직
12/1(화)오프라인 09:00~18:008H캡스톤⑤ 완성과정 최종 발표·회고, 총정리 Q&A 및 수료식정영직

📝 평가 계획

출석 및 참여도

20%

비대면 라이브 출석률 및 오프라인 실습·프로젝트 참여 성실도

과목별 실습 과제

40%

각 과목 산출물 누적 평가 — 한·영 병렬 데이터셋 기반 Python·NumPy·Pandas·Tensor 실습 결과와 정제 CSV, 개인정보 비식별화 실습 결과물과 저작권·윤리 위험 평가 체크리스트, 저자원 언어 구축 전략서와 병렬 코퍼스, 다국어·멀티모달 마스터 데이터와 자동 품질검증 코드·E2E 파이프라인·Dataset Card, LLM 데이터셋 설계서와 품질 진단 리포트

캡스톤 프로젝트

40%

최종 통합 산출물 및 최종 발표 평가 — 전주기 데이터셋 통합본(JSONL/CSV), 데이터셋 카드, 품질관리 리포트, Alpy 기반 AI Agent 및 안정성 평가 리포트, Python 데이터 처리 스크립트 패키지, Hugging Face 포트폴리오, 최종 발표(12/1)

📌 모집 안내

모집기간
2026.07.27(월) ~ 08.17(월)까지고학년 우선
추가모집
2026.08.22(토) ~ 09.04(금)까지
문의처
H동 511호 (051-509-5851~5855)
주관
부산외국어대학교 AI부트캠프사업단
다국어 AI 데이터 구축 신청하기

다른 과정도 살펴보기

🤖 다국어 AI 에이전트 개발

AI 에이전트 설계·개발·운영 및 서비스 적용