AI / 데이터

머신러닝(Machine Learning)

머신러닝은 데이터에서 패턴을 학습한 모델로 새로운 입력을 예측·분류하거나 내용을 생성하는 방법입니다.

쉬운 설명

스터디 질문을 설치 문제와 사용법 질문으로 자동 분류하고 싶다고 해 볼게요. 사람이 모든 문장을 규칙으로 적는 대신, 예시 데이터로 입력과 결과 사이의 패턴을 학습시킬 수 있어요. 이렇게 학습한 모델을 새 질문에 적용하는 방법이 머신러닝이에요. 데이터를 고르고 결과를 평가하는 일은 여전히 필요하며, 모델의 답이 항상 맞는 것은 아니에요.

이런 상황에서 만나요

질문 분류기를 만드는 스터디에서 “학습 데이터와 평가 데이터를 나눠 주세요”라는 안내를 받았다고 해 볼게요. 아래는 정답을 붙인 질문으로 학습하는 지도 학습의 예시예요.

학습한 질문과 처음 보는 질문을 나눠요

설명용 화면
1학습 예시

질문: 설치가 중간에 멈춰요

정답 분류: 설치 문제

2새로운 평가 질문

질문: 프로그램을 깔다가 오류가 나요

이 질문은 학습에 사용하지 않음

3결과 대조

모델의 분류와 사람이 확인한 정답을 비교

틀린 질문과 이유를 따로 기록

  1. 1학습에 제공할 입력과 정답을 함께 준비해요.
  2. 2다른 표현에서도 구분할 수 있는지 확인해요.
  3. 3몇 개를 맞혔는지뿐 아니라 어떤 상황에서 틀리는지도 봐요.
지도 학습의 데이터 구분을 설명하는 가상 예시입니다. 실제 모델을 학습시킨 결과나 성능 수치를 뜻하지 않습니다.

모델이 학습할 예시와 성능을 확인할 예시를 구분해요. 이미 외운 질문만 잘 맞히는지, 처음 보는 표현에서도 구분하는지 확인해야 해요. 틀린 사례를 읽고 분류 기준이 모호한지, 특정 유형의 질문이 부족한지도 살펴봐요.

헷갈리기 쉬운 점

AI와 대화하면 그 자리에서 모델이 계속 학습하나요?

대화 내용을 참고해 답하는 것과 모델의 내부 값을 학습으로 바꾸는 것은 달라요. 현재 대화의 정보를 반영했다고 바로 재학습한 것은 아니에요. 대화 저장이나 서비스의 학습 활용 정책은 별도로 확인해야 해요.

학습에 쓴 데이터가 평가 데이터에 섞이면 실제보다 잘하는 것처럼 보일 수 있어요. 같은 질문을 조금 바꾼 중복이나 정답을 드러내는 정보도 주의해서 확인해요.

왜 알아야 할까요?

AI 기능을 만들 때 데이터 준비, 모델 학습, 새 입력 처리, 결과 평가를 나누어 이해할 수 있어요. 성능이 낮을 때 무조건 더 큰 모델로 바꾸기 전에 데이터와 평가 방식부터 살펴볼 수 있어요.

조금 더 자세히

정답이 붙은 예시로 학습하는 지도 학습 외에도 정답 없이 데이터 구조를 찾는 비지도 학습 등 여러 방식이 있습니다. 모든 머신러닝이 아래의 질문 분류 예시와 같은 방식으로 학습하는 것은 아닙니다.

학습은 데이터로 모델의 매개변수를 조정하는 과정이고, 추론은 준비된 모델을 새 입력에 적용하는 과정입니다. 신경망 이외의 모델도 있으며, 딥러닝은 여러 층의 신경망을 활용하는 머신러닝의 한 분야입니다.

직접 사용할 때 확인해 보세요

  • 입력과 원하는 결과를 명확히 정한다
  • 학습용과 평가용 데이터를 구분한다
  • 새로운 사례의 오답과 데이터 편향을 확인한다

관계 지도

머신러닝(Machine Learning) 중심으로 관련 개념의 정의와 관계를 한눈에 정리했습니다.
머신러닝(Machine Learning)의 정의와 관련 개념 간 관계를 설명한 계층형 그래프