정식 과정명 : 다국어 AI 데이터 PM·AI Agent 평가 마스터
이수 학점
18학점
총 교육시간
315시간
교육 기간
2026.8.31(월) ~ 12.1(화)
구성
총 48일 (오프라인 32일 · 온라인 16일)
AI 학습데이터의 수집·정제·품질관리·PM 실무를 익혀, 다국어 데이터 구축 프로젝트를 주도하고 싶은 학생에게 권장합니다.
교육 목표
기업에 즉시 투입 가능한 수준의 고숙련 '다국어 AI 데이터 PM' 및 'AI Agent 평가 전문가' 역량 체화
교육 대상
부산외국어대학교 재학생 (언어 전공자 중심)
시수 구성
오프라인 232H · 온라인 83H
오프라인 24H · 비대면 실시간 17H
오프라인 12H · 비대면 실시간 19H
오프라인 12H · 비대면 실시간 16H
오프라인 32H · 비대면 실시간 31H
오프라인 40H
오프라인 112H
총 48일 (오프라인 32일 · 온라인 16일) · 총 315시간
입문
AI 데이터셋과 Python 실행 환경Python①
문자열·리스트·딕셔너리Python②
조건문·반복문·함수NumPy
배열과 AI 데이터의 수치 표현Pandas①
한·영 병렬 데이터셋 탐색Pandas②
한·영 병렬 데이터셋 정제와 분석Tensor·Dataset
모델 입력 구조와 KNN 체험평가+브리지
Python 데이터 처리 실기평가 및 품질검증 연계규제
글로벌 AI 규제와 다국어 데이터 거버넌스비식별화
개인정보 보호 원칙과 비식별화 실무저작권
AI 훈련 데이터와 저작권·공정 이용라이선스·출처
오픈 데이터 라이선스 분석과 데이터 출처 명시위험·계보
저작권·윤리 위험 평가와 계보 관리 워크플로우전략 수립
저자원 언어 데이터 구축 전략수집
웹 크롤링·멀티모달 데이터 수집극복 전략
소량 데이터 극복: 전이학습·Few-shot효율화·구축
전사·주석 효율화와 병렬 코퍼스 구축검증
품질 검증(QA)과 벤치마크 평가자동화 입문
데이터 자동화 개념 및 JSONL 구조 이해ETL·형식
CSV·JSON·JSONL과 데이터 스키마 설계정합성
멀티모달 마스터 데이터 설계어노테이션·검증
가이드라인 설계와 자동 검증번역 품질
역번역과 문화적 맥락 검증일치도·편향
IAA 측정과 데이터 편향 분석자동화
데이터 정제·증강·로그 처리파이프라인 통합
End-to-End 품질검증 파이프라인Agent 연계
Alpy 기반 데이터 품질관리 Agent와 Workflow문서화·배포
품질 모니터링, Dataset Card 및 포트폴리오 패키징평가
데이터 품질검증 파이프라인 및 포트폴리오 발표설계 기초
LLM 데이터셋 개요와 토크나이제이션설계① 분석
다국어 토크나이저 비교와 서브워드 분할설계② 구성
데이터 혼합 비율과 커리큘럼 설계구축·문서화
샘플링·밸런싱 자동화와 데이터셋 카드 작성진단·연계
품질 진단 리포트와 산업별 캡스톤 주제 선정캡스톤① 착수
프로젝트 착수 및 데이터 수집캡스톤① 구축
데이터 정제·전처리캡스톤① 구축
주석 가이드라인 설계 및 적용캡스톤② 검증
품질 검증 자동화 파이프라인 구축캡스톤② 검증
데이터 증강 및 편향 완화캡스톤② 검증
중간 발표 및 피드백캡스톤③ 고도화
데이터셋 최종 정제 및 데이터 명세서(Dataset Card) 작성캡스톤③ 고도화
파이프라인 최적화·통합 테스트 및 성능 평가캡스톤④ Agent
Alpy 플랫폼 이해 및 AI Agent 설계캡스톤④ Agent
Alpy 기반 AI Agent 구축(캡스톤 데이터셋 연동)캡스톤④ Agent
Agent 안정성 평가 및 결과 보완캡스톤⑤ 완성
최종 보고서 작성 및 파이프라인 문서화캡스톤⑤ 완성
포트폴리오(Hugging Face·GitHub) 최종 점검·배포 및 발표 자료 작성·리허설캡스톤⑤ 완성
과정 최종 발표·회고, 총정리 Q&A 및 수료식각 수업의 이론·실습 내용입니다.
| 일자 | 교육형태 | 시수 | 교육 주제 | 담당 |
|---|---|---|---|---|
| 8/31(월) | 오프라인 10:00~17:00 | 6H | 입문AI 데이터셋과 Python 실행 환경 [이론] AI 학습 데이터, 한·영 병렬 말뭉치, 입력·라벨 및 학습·검증·평가 데이터 개념 [실습] Colab 환경 구성, 변수·자료형·기본 입출력 | 정영직 |
| 9/1(화) | 오프라인 10:00~17:00 | 6H | Python①문자열·리스트·딕셔너리 [이론] 한·영 문장쌍과 메타데이터를 Python 자료구조로 표현하는 방법 [실습] 문자열 처리와 리스트·딕셔너리 기반 병렬 데이터 다루기 | 정영직 |
| 9/2(수) | 온라인 10:00~16:00 | 5H | Python②조건문·반복문·함수 [이론] 데이터 처리 규칙을 코드로 표현하는 기본 구조 [실습] 빈 문장·문장 길이·언어 문자 비율 검사 함수 작성 | 정영직 |
| 9/3(목) | 온라인 10:00~16:00 | 5H | NumPy배열과 AI 데이터의 수치 표현 [이론] NumPy 배열, shape, dtype, 인덱싱, reshape 및 기초 통계 [실습] 문장 길이·단어 수를 NumPy 배열로 변환하고 통계 확인 | 정영직 |
| 9/7(월) | 오프라인 10:00~17:00 | 6H | Pandas①한·영 병렬 데이터셋 탐색 [이론] DataFrame·Series, CSV 구조, 행·열 선택과 조건 필터링 [실습] 병렬 데이터 CSV 불러오기, head·info·describe 확인 및 도메인별 조회 | 정영직 |
| 9/8(화) | 오프라인 10:00~17:00 | 6H | Pandas②한·영 병렬 데이터셋 정제와 분석 [이론] 결측값·중복·공백·문장 길이·도메인 분포 처리 [실습] 정제 전후 비교, 언어·도메인별 집계 및 정제 CSV 저장 | 정영직 |
| 9/9(수) | 온라인 10:00~16:00 | 5H | Tensor·Dataset모델 입력 구조와 KNN 체험 [이론] NumPy와 Tensor 비교, Dataset·DataLoader·batch 및 KNN 개념 [실습] MNIST 데이터 구조 확인, 준비된 KNN 코드 실행 및 문장 특징 기반 언어 분류 결과 비교 | 정영직 |
| 9/10(목) | 온라인 10:00~16:00 | 5H | 평가+브리지Python 데이터 처리 실기평가 및 품질검증 연계 [평가] 한·영 병렬 데이터 불러오기·정제·기초 분석 실기평가(과정1, 오전 2h) [연계] 글로벌 AI 규제와 다국어 데이터 거버넌스 준비(과정2, 오후 3h) | 정영직 |
| 9/14(월) | 오프라인 10:00~17:00 | 6H | 규제글로벌 AI 규제와 다국어 데이터 거버넌스 [이론] 글로벌 AI 규제(GDPR·EU AI Act) 프레임워크와 다국어 데이터 윤리 [실습] 규제 프레임워크 기반 데이터 거버넌스 사례 분석 | 정영직 |
| 9/15(화) | 오프라인 10:00~17:00 | 6H | 비식별화개인정보 보호 원칙과 비식별화 실무 [이론] 개인정보 보호 원칙 및 비식별화(De-identification) 개념 [실습] 글로벌 기준의 개인정보 비식별화 기법 적용 | 정영직 |
| 9/16(수) | 온라인 10:00~16:00 | 5H | 저작권AI 훈련 데이터와 저작권·공정 이용 [이론] AI 훈련 데이터와 저작권법 및 공정 이용(Fair Use) [실습] 저작권 분쟁·공정 이용 사례 분석 | 정영직 |
| 9/17(목) | 온라인 10:00~16:00 | 5H | 라이선스·출처오픈 데이터 라이선스 분석과 데이터 출처 명시 [이론] 오픈 데이터 라이선스(CC·ODbL) 체계 및 출처 명시(Provenance) 개념 [실습] 라이선스 분석·데이터 조합 실무 및 출처 표기 실습 | 정영직 |
| 9/21(월) | 온라인 10:00~17:00 | 6H | 위험·계보저작권·윤리 위험 평가와 계보 관리 워크플로우 [이론] 저작권·윤리적 위험 평가 프레임워크 및 데이터 계보(Lineage) 관리 [실습] 위험 평가 체크리스트 구축 및 출처·계보 관리 워크플로우 설계 | 정영직 |
| 9/22(화) | 온라인 10:00~17:00 | 6H | 전략 수립저자원 언어 데이터 구축 전략 [이론] 저자원 언어 정의 및 데이터 부족 극복 전략 [실습] 대상 언어 선정 및 저자원 언어 구축 전략서 초안 작성 | 정영직 |
| 9/28(월) | 오프라인 10:00~17:00 | 6H | 수집웹 크롤링·멀티모달 데이터 수집 [이론] 웹 크롤링·OCR·음성 기반 데이터 수집 개요 [실습] 저자원 언어 웹 크롤링 및 다중 모달(OCR·음성) 데이터 수집 | 정영직 |
| 9/29(화) | 오프라인 10:00~17:00 | 6H | 극복 전략소량 데이터 극복: 전이학습·Few-shot [이론] 전이학습(Transfer Learning) 및 Few-shot 전략 [실습] 소량 데이터 기반 Few-shot 주석 효율화 | 정영직 |
| 9/30(수) | 온라인 10:00~16:00 | 5H | 효율화·구축전사·주석 효율화와 병렬 코퍼스 구축 [이론] 전사(Transcription)·주석(Annotation) 효율화 전략 및 병렬 코퍼스·기계 번역 활용 [실습] 전사·주석 워크플로우 구축, 병렬 코퍼스 구축 및 기계 번역 적용 | 정영직 |
| 10/1(목) | 온라인 10:00~16:00 | 5H | 검증품질 검증(QA)과 벤치마크 평가 [이론] 데이터 품질 검증(QA) 지표 및 벤치마크 개념 [실습] 품질 검증·벤치마크 평가 수행 및 저자원 언어 구축 전략서 최종화 | 정영직 |
| 10/6(화) | 온라인 10:00~17:00 | 6H | 자동화 입문데이터 자동화 개념 및 JSONL 구조 이해 [이론] 데이터 자동화 개념 및 JSONL 스키마 이해 [실습] CSV·JSONL 대응 관계 확인 및 변환 구조 실습 | 정영직 |
| 10/7(수) | 온라인 10:00~16:00 | 5H | ETL·형식CSV·JSON·JSONL과 데이터 스키마 설계 [이론] ETL 개념, 데이터 형식 비교, 필수·선택 필드 및 다국어 인코딩 [실습] CSV→JSONL 변환, 스키마 정의 및 유효성 검사 | 정영직 |
| 10/12(월) | 오프라인 10:00~17:00 | 6H | 정합성멀티모달 마스터 데이터 설계 [이론] 텍스트·이미지·음성 데이터 연결, 고유 ID·파일 경로·메타데이터 관리 [실습] 마스터 CSV 구축, 누락 파일·중복 ID·불일치 데이터 자동 확인 | 정영직 |
| 10/13(화) | 오프라인 10:00~17:00 | 6H | 어노테이션·검증가이드라인 설계와 자동 검증 [이론] 라벨 정의, 포함·제외 기준, 예외 처리 및 검수자 판단 규칙 [실습] Python·Pandas 기반 필수 열·결측·중복·허용값·문장 길이 검증 코드 작성 | 정영직 |
| 10/14(수) | 온라인 10:00~16:00 | 5H | 번역 품질역번역과 문화적 맥락 검증 [이론] 의미 대응, 누락·과잉 번역, 고유명사·수치·문체·문화적 표현 검토 [실습] 번역·역번역 결과 비교, 품질 플래그 부여 및 교정 의견 작성 | 정영직 |
| 10/15(목) | 온라인 10:00~16:00 | 5H | 일치도·편향IAA 측정과 데이터 편향 분석 [이론] 단순 일치율, Cohen 계수 개념, 언어·도메인·문장 길이 편중 [실습] 검수자 불일치 추출, 언어별 분포 분석 및 편향 리포트 작성 | 정영직 |
| 10/19(월) | 오프라인 10:00~17:00 | 6H | 자동화데이터 정제·증강·로그 처리 [이론] 함수 기반 정제 단계, 합성·증강 데이터 관리 및 실행 로그 설계 [실습] 정상·오류 데이터 분리 저장, 처리 건수 집계 및 오류 로그 생성 | 정영직 |
| 10/20(화) | 오프라인 10:00~17:00 | 6H | 파이프라인 통합End-to-End 품질검증 파이프라인 [이론] 입력·스키마 검사·정제·검증·JSONL 변환·리포트 생성 흐름 [실습] 전체 파이프라인 통합 실행, 오류 구간 확인 및 처리 결과 검증 | 정영직 |
| 10/21(수) | 온라인 10:00~16:00 | 5H | Agent 연계Alpy 기반 데이터 품질관리 Agent와 Workflow [이론] 품질검토 프롬프트, 구조화된 출력, 단계별 데이터 처리와 평가 흐름 [실습] 데이터 오류 분류·수정 권고 Agent 구성, Workflow 실행 및 평가 결과 확인 | 정영직 |
| 10/22(목) | 온라인 10:00~16:00 | 5H | 문서화·배포품질 모니터링, Dataset Card 및 포트폴리오 패키징 [이론] 품질 지표 시각화, Dataset Card 구성, Hugging Face·GitHub 배포 구조 [실습] Looker Studio 대시보드 구성, Dataset Card 작성 및 결과물 패키징 | 정영직 |
| 11/2(월) | 오프라인 09:00~18:00 | 8H | 평가데이터 품질검증 파이프라인 및 포트폴리오 발표 [평가] 개인별 파이프라인 실행, Alpy Agent 시연, 품질 리포트·Dataset Card·포트폴리오 발표 | 정영직 |
| 11/3(화) | 오프라인 09:00~18:00 | 8H | 설계 기초LLM 데이터셋 개요와 토크나이제이션 [이론] LLM 학습용 다국어 데이터셋 개요 및 토크나이제이션 [실습] 토크나이제이션 기초 실습 | 정영직 |
| 11/4(수) | 오프라인 09:00~18:00 | 8H | 설계① 분석다국어 토크나이저 비교와 서브워드 분할 [이론] 다국어 토크나이저 특성 비교 [실습] 토크나이저 비교 및 서브워드 분할 실습 | 정영직 |
| 11/5(목) | 오프라인 09:00~18:00 | 8H | 설계② 구성데이터 혼합 비율과 커리큘럼 설계 [이론] 다국어 데이터 혼합 비율 및 데이터셋 커리큘럼 설계 [실습] 혼합 비율 설계 사례 분석 및 커리큘럼 설계서 작성 | 정영직 |
| 11/9(월) | 오프라인 09:00~18:00 | 8H | 구축·문서화샘플링·밸런싱 자동화와 데이터셋 카드 작성 [이론] 데이터셋 샘플링·밸런싱 전략, 데이터셋 카드·문서화 표준 및 편향 평가 지표 [실습] 다국어 데이터셋 샘플링·밸런싱 자동화 및 데이터셋 카드 작성 | 정영직 |
| 11/10(화) | 오프라인 09:00~18:00 | 8H | 진단·연계품질 진단 리포트와 산업별 캡스톤 주제 선정 [이론] 데이터셋 품질 진단 프레임워크 및 산업별(의료·금융·유통·제조) 데이터 요구사항 [실습] 데이터셋 품질 진단 리포트 작성, 산업별 데이터 실습 및 캡스톤 주제 선정 | 정영직 |
| 11/11(수) | 오프라인 09:00~18:00 | 8H | 캡스톤① 착수프로젝트 착수 및 데이터 수집 산업별 데이터 요구사항 확정, 수집 계획 수립 및 원천 데이터 수집 | 정영직 |
| 11/12(목) | 오프라인 09:00~18:00 | 8H | 캡스톤① 구축데이터 정제·전처리 결측·중복·노이즈 처리, 정규화 및 스키마 정합성 확보 | 정영직 |
| 11/16(월) | 오프라인 09:00~18:00 | 8H | 캡스톤① 구축주석 가이드라인 설계 및 적용 | 정영직 |
| 11/17(화) | 오프라인 09:00~18:00 | 8H | 캡스톤② 검증품질 검증 자동화 파이프라인 구축 | 정영직 |
| 11/18(수) | 오프라인 09:00~18:00 | 8H | 캡스톤② 검증데이터 증강 및 편향 완화 | 정영직 |
| 11/19(목) | 오프라인 09:00~18:00 | 8H | 캡스톤② 검증중간 발표 및 피드백 | 정영직 |
| 11/20(금) | 오프라인 09:00~18:00 | 8H | 캡스톤③ 고도화데이터셋 최종 정제 및 데이터 명세서(Dataset Card) 작성 | 정영직 |
| 11/23(월) | 오프라인 09:00~18:00 | 8H | 캡스톤③ 고도화파이프라인 최적화·통합 테스트 및 성능 평가 | 정영직 |
| 11/24(화) | 오프라인 09:00~18:00 | 8H | 캡스톤④ AgentAlpy 플랫폼 이해 및 AI Agent 설계 | 정영직 |
| 11/25(수) | 오프라인 09:00~18:00 | 8H | 캡스톤④ AgentAlpy 기반 AI Agent 구축(캡스톤 데이터셋 연동) | 정영직 |
| 11/26(목) | 오프라인 09:00~18:00 | 8H | 캡스톤④ AgentAgent 안정성 평가 및 결과 보완 | 정영직 |
| 11/27(금) | 오프라인 09:00~18:00 | 8H | 캡스톤⑤ 완성최종 보고서 작성 및 파이프라인 문서화 | 정영직 |
| 11/30(월) | 오프라인 09:00~18:00 | 8H | 캡스톤⑤ 완성포트폴리오(Hugging Face·GitHub) 최종 점검·배포 및 발표 자료 작성·리허설 | 정영직 |
| 12/1(화) | 오프라인 09:00~18:00 | 8H | 캡스톤⑤ 완성과정 최종 발표·회고, 총정리 Q&A 및 수료식 | 정영직 |
비대면 라이브 출석률 및 오프라인 실습·프로젝트 참여 성실도
각 과목 산출물 누적 평가 — 한·영 병렬 데이터셋 기반 Python·NumPy·Pandas·Tensor 실습 결과와 정제 CSV, 개인정보 비식별화 실습 결과물과 저작권·윤리 위험 평가 체크리스트, 저자원 언어 구축 전략서와 병렬 코퍼스, 다국어·멀티모달 마스터 데이터와 자동 품질검증 코드·E2E 파이프라인·Dataset Card, LLM 데이터셋 설계서와 품질 진단 리포트
최종 통합 산출물 및 최종 발표 평가 — 전주기 데이터셋 통합본(JSONL/CSV), 데이터셋 카드, 품질관리 리포트, Alpy 기반 AI Agent 및 안정성 평가 리포트, Python 데이터 처리 스크립트 패키지, Hugging Face 포트폴리오, 최종 발표(12/1)
다른 과정도 살펴보기
🤖 다국어 AI 에이전트 개발
AI 에이전트 설계·개발·운영 및 서비스 적용