Day 2의 마무리 캡스톤입니다. 지난 교시들에서 고른 Qwen3.5·Qwen 0.6B TTS·FLUX·(영상은 합성/LTX)를 하나의 비교 매트릭스에 모아, '왜 이 조합인가'를 6가지 기준으로 설명합니다. 나아가 장비(16GB vs 32GB+)나 목표(속도 우선 vs 품질 우선)가 바뀌면 어떤 모델로 갈아탈지 스스로 판단하는 연습을 합니다.
모델 선택 종합: 4대 기술 비교 매트릭스
📚1단계: 주요 개념 설명
텍스트·오디오·이미지·비디오 4대 생성기술의 모델 선택을 한 표로 정리하고, 주어진 서비스 목표·장비 제약에 맞는 모델 조합을 근거를 들어 제안할 수 있다.
마무리 — 조각을 '선택'으로 잇는다
- 지난 네 교시에서 텍스트·오디오·이미지·비디오 모델을 하나씩 만들고 비교했습니다.
- 오늘은 그 선택들을 한 표에 모아 '왜 이 조합인가'를 정리합니다.
- 핵심은 결과물이 아니라 '선택의 근거를 설명하는 힘'입니다.
🛠️2단계: 따라하기 실습
지금까지 고른 모델들을 한 표(딕셔너리)로 정리하고, 조건(속도·품질)이 바뀌면 어떻게 갈아탈지 코드로 표현합니다. Kiro로 따라 만들며 '선택의 근거'를 코드로 남겨 보세요.
4대 기술의 기준 모델을 한 곳에 모읍니다.
파이썬 딕셔너리로 쇼츠 제작 4대 기술(text/audio/image/video)의 기준 모델과 대략 VRAM, 대안 모델을 정리한 STACK을 만들어줘. text=Qwen3.5 4B, audio=Qwen 0.6B TTS, image=FLUX.1-schnell, video=이미지+moviepy 합성으로 하고, 각 항목을 보기 좋게 출력해줘.
- 각 칸에 '기준 모델 + 대안'을 함께 적어 두면 상황이 바뀔 때 바로 갈아탈 수 있습니다.
- 순차 실행이므로 메모리 관건은 합계가 아니라 '가장 큰 단일 모델'임을 주석으로 남겨 보세요.
'속도 우선/품질 우선'에 맞는 조합을 반환합니다.
profile(문자열)을 받아 모델 조합을 반환하는 pick 함수를 만들어줘. speed면 가장 가벼운 조합(qwen3.5:4b, Piper, FLUX 저스텝, 합성), quality면 더 큰 조합(qwen3.5:4b /think, Chatterbox, SDXL, LTX i2v), 그 외엔 기본 스택을 반환하게 해줘.
- 같은 서비스라도 목표·장비가 다르면 최적 조합이 달라진다는 것을 코드로 확인합니다.
- 정답이 하나가 아니라 '조건의 함수'라는 점이 이 캡스톤의 핵심입니다.
가상 서비스 하나를 정해 조합과 근거를 말합니다.
- '속도형 뉴스 요약 쇼츠' 등 가상 서비스를 하나 정합니다.
- 그 조건에 맞는 모델 조합을 고르고, 6가지 기준(크기·양자화·메모리·속도·품질·라이선스)으로 근거를 1분간 설명합니다.
우측 '모델 선택 도우미'에서 서비스 조건을 여러 개(속도형·품질형·보안형)로 바꿔 보고, 각 조건에 맞는 4대 기술 모델 조합과 그 근거를 정리해 발표해 보세요.
# 16GB 기본 스택 (근거: 크기·속도·품질·라이선스 균형)
STACK = {
"text": "Qwen3.5 4B (Q4, ~2.5GB)",
"audio": "Qwen 0.6B TTS (~4GB, 한국어 음질↑)",
"image": "FLUX.1-schnell (Q4, ~10GB)",
"video": "이미지+moviepy 합성 (LTX는 데모)",
}
for tech, model in STACK.items():
print(tech, "->", model)💡 코딩 중 막히나요? 모범 솔루션 코드
🧩3단계: 개념 검증 퀴즈
4대 기술 각각의 기준 모델과 대안을 말하고, 주어진 조건(장비·목표)에 맞는 조합을 6가지 기준으로 설명할 수 있는지 점검합니다.
Q1. 우리 16GB 기본 쇼츠 스택에서 '메모리 관건'이 되는 단계는?
Q2. 같은 쇼츠 서비스라도 '속도 우선'으로 바꾸면 알맞은 모델 조합은?
만들 서비스의 조건을 고르면 4대 기술의 추천 모델 조합이 바뀝니다. 아래에서 기술별 후보를 6가지 기준으로 비교해 보세요.
~2.5GB(Q4)
보통
상 · 한국어·추론↑
오픈
~3GB
빠름
중상 · 톤 깔끔
오픈
~5GB(Q4)
보통
중상 · 추론모드 없음
오픈