DAY 2 · 17교시 · 60분

모델 선택 종합: 4대 기술 비교 매트릭스

📚1단계: 주요 개념 설명

이번 단원의 목표

텍스트·오디오·이미지·비디오 4대 생성기술의 모델 선택을 한 표로 정리하고, 주어진 서비스 목표·장비 제약에 맞는 모델 조합을 근거를 들어 제안할 수 있다.

🗂️강의 슬라이드
슬라이드 1 / 10

마무리 — 조각을 '선택'으로 잇는다

조각을 '선택'으로 잇는다텍스트오디오이미지비디오
  • 지난 네 교시에서 텍스트·오디오·이미지·비디오 모델을 하나씩 만들고 비교했습니다.
  • 오늘은 그 선택들을 한 표에 모아 '왜 이 조합인가'를 정리합니다.
  • 핵심은 결과물이 아니라 '선택의 근거를 설명하는 힘'입니다.

🛠️2단계: 따라하기 실습

🛠 따라 만들기 · AI 바이브 코딩
우리 쇼츠 '모델 스택' 표로 정리하기

지금까지 고른 모델들을 한 표(딕셔너리)로 정리하고, 조건(속도·품질)이 바뀌면 어떻게 갈아탈지 코드로 표현합니다. Kiro로 따라 만들며 '선택의 근거'를 코드로 남겨 보세요.

🎯 완성 결과: 기본 스택과 조건별(속도형·품질형) 대체 조합을 출력하는 파이썬 스크립트
1기본 스택 딕셔너리 만들기

4대 기술의 기준 모델을 한 곳에 모읍니다.

🤖 AI에게 이렇게 시켜보세요

파이썬 딕셔너리로 쇼츠 제작 4대 기술(text/audio/image/video)의 기준 모델과 대략 VRAM, 대안 모델을 정리한 STACK을 만들어줘. text=Qwen3.5 4B, audio=Qwen 0.6B TTS, image=FLUX.1-schnell, video=이미지+moviepy 합성으로 하고, 각 항목을 보기 좋게 출력해줘.

💡 핵심 코드 설명
  • 각 칸에 '기준 모델 + 대안'을 함께 적어 두면 상황이 바뀔 때 바로 갈아탈 수 있습니다.
  • 순차 실행이므로 메모리 관건은 합계가 아니라 '가장 큰 단일 모델'임을 주석으로 남겨 보세요.
2조건별 교체 함수 만들기

'속도 우선/품질 우선'에 맞는 조합을 반환합니다.

🤖 AI에게 이렇게 시켜보세요

profile(문자열)을 받아 모델 조합을 반환하는 pick 함수를 만들어줘. speed면 가장 가벼운 조합(qwen3.5:4b, Piper, FLUX 저스텝, 합성), quality면 더 큰 조합(qwen3.5:4b /think, Chatterbox, SDXL, LTX i2v), 그 외엔 기본 스택을 반환하게 해줘.

💡 핵심 코드 설명
  • 같은 서비스라도 목표·장비가 다르면 최적 조합이 달라진다는 것을 코드로 확인합니다.
  • 정답이 하나가 아니라 '조건의 함수'라는 점이 이 캡스톤의 핵심입니다.
3내 선택 발표하기

가상 서비스 하나를 정해 조합과 근거를 말합니다.

💡 핵심 코드 설명
  • '속도형 뉴스 요약 쇼츠' 등 가상 서비스를 하나 정합니다.
  • 그 조건에 맞는 모델 조합을 고르고, 6가지 기준(크기·양자화·메모리·속도·품질·라이선스)으로 근거를 1분간 설명합니다.
🎯 스스로 해볼 미션
0 / 2 완료
내 서비스용 '모델 조합' 설계하고 발표하기

조건이 다르면 답도 다릅니다. 가상 서비스 하나를 정해 나만의 스택을 근거와 함께 제안합니다.

출발점(강사와 함께 만든 것): 강사와 함께 4대 기술 스택 표와 조건별 pick 함수를 만들었다.
✅ 완료 기준: 가상 서비스의 모델 조합과 근거를 1분간 발표하면 성공.
실습 미션 체크리스트
1개념 직관

Day 2의 마무리 캡스톤입니다. 지난 교시들에서 고른 Qwen3.5·Qwen 0.6B TTS·FLUX·(영상은 합성/LTX)를 하나의 비교 매트릭스에 모아, '왜 이 조합인가'를 6가지 기준으로 설명합니다. 나아가 장비(16GB vs 32GB+)나 목표(속도 우선 vs 품질 우선)가 바뀌면 어떤 모델로 갈아탈지 스스로 판단하는 연습을 합니다.

2실습 미션

우측 '모델 선택 도우미'에서 서비스 조건을 여러 개(속도형·품질형·보안형)로 바꿔 보고, 각 조건에 맞는 4대 기술 모델 조합과 그 근거를 정리해 발표해 보세요.

우리 쇼츠 모델 스택
# 16GB 기본 스택 (근거: 크기·속도·품질·라이선스 균형)
STACK = {
    "text":  "Qwen3.5 4B (Q4, ~2.5GB)",
    "audio": "Qwen 0.6B TTS (~4GB, 한국어 음질↑)",
    "image": "FLUX.1-schnell (Q4, ~10GB)",
    "video": "이미지+moviepy 합성 (LTX는 데모)",
}
for tech, model in STACK.items():
    print(tech, "->", model)

💡 코딩 중 막히나요? 모범 솔루션 코드

🧩3단계: 개념 검증 퀴즈

검증 챌린지 미션

4대 기술 각각의 기준 모델과 대안을 말하고, 주어진 조건(장비·목표)에 맞는 조합을 6가지 기준으로 설명할 수 있는지 점검합니다.

📝 객관식 개념 확인 (2문항)

Q1. 우리 16GB 기본 쇼츠 스택에서 '메모리 관건'이 되는 단계는?

Q2. 같은 쇼츠 서비스라도 '속도 우선'으로 바꾸면 알맞은 모델 조합은?

🔬 인터랙티브 체험 (선택)— 개념을 직접 조작하며 확인해 보세요

만들 서비스의 조건을 고르면 4대 기술의 추천 모델 조합이 바뀝니다. 아래에서 기술별 후보를 6가지 기준으로 비교해 보세요.

크기·속도·품질·라이선스의 균형. 우리 실습의 기본 조합.
텍스트
Qwen3.5 4B
오디오
Qwen 0.6B TTS
이미지
FLUX.1-schnell
비디오
이미지+합성
Qwen3.5 4B
/think로 논리 조절. 대본 기본값
메모리
~2.5GB(Q4)
속도
보통
품질/라이선스
상 · 한국어·추론↑
오픈
16GB OK
Gemma4 E4B
가볍고 지시이행이 깔끔
메모리
~3GB
속도
빠름
품질/라이선스
중상 · 톤 깔끔
오픈
16GB OK
Llama 3.x 8B
도구 생태계가 가장 넓음
메모리
~5GB(Q4)
속도
보통
품질/라이선스
중상 · 추론모드 없음
오픈
16GB OK
💡 판단 기준 6가지: 크기 · 양자화 · 16GB 적재 · 속도 · 품질 · 라이선스. 순차 실행이므로 메모리 관건은 합계가 아니라 가장 큰 단일 모델입니다.
🎉 축하합니다! 12시간의 모든 온프레미스 AI 쇼츠 자동 생성기 개발 과정을 마쳤습니다!