BLOG인사이트
스타트업이 연구실보다 쉬울줄 알았다

안녕하세요, 디라이브에서 차량 AI 모델을 만들고 있는 김민재입니다.
디라이브에 오기 전까지는 공학 대학 학/석/박을 거치며 10년간 연구생 생활을 했습니다. 거기서 제 일은 실험이었고, 여기 와서도 제 일은 실험입니다. 하는 일은 같은데, 1년 남짓 해보니 같은 게 거의 없었습니다. 안 된 결과를 누가 판단하는지, 좋은 결과가 뭔지, 데이터가 어디서 오는지, 한 주제를 얼마나 오래 붙잡고 있는지. 처음엔 환경이 바뀌어서 그런가 했는데, 돌아보니 실험을 왜 하는지가 달랐고, 그래서 나머지가 전부 달라진 거였습니다. 연구실과 스타트업에서의 연구활동에서 제가 느낀 차이점에 대해서 말해보고자 합니다.
1. 결과가 안 나오면 물어볼 사람이 없다
박사과정 때 실험 결과가 안 좋게 나오면 하는 일은 정해져 있었습니다. 교수님께 가져갑니다. 왜 안 나온 것 같은지 같이 보고, 조건을 바꿔 다시 할지, 접고 다른 걸 할지 논의합니다. 결정은 교수님이 하시고, 저는 그 결정을 기다렸다가 움직였습니다. 안 된 결과를 들고 가는 게 부담스럽긴 해도, 다음에 뭘 할지는 제 몫이 아니었습니다.
제가 디라이브에 와서 처음 한 일이 차량 파운데이션 모델을 만드는 일이였습니다. 모델을 키우고 학습 데이터를 키우면 얼마나 오르는지 보는 실험이었습니다. 저도 그렇고 주변도 그렇고, 크게 하면 오를 거라고 생각했습니다. 결과는 기대만큼 오르지 않았습니다. 모델 크기와 데이터 크기를 바꿔가며 여러 조합을 돌렸는데, 어느 조합도 기대한 만큼 나오지 않았습니다.
여기서 습관대로 결과를 정리해서 보고했습니다. 보고는 됐는데, 그 다음이 없었습니다. 안 나왔다는 건 다들 알게 됐지만, 그래서 다음에 뭘 할지 정해줄 사람이 없었습니다. 그게 제 일이었습니다. 저한테 실험을 시킨 사람도 저고, 안 나온 이유를 찾을 사람도 저고, 접을지 계속할지 정할 사람도 저였습니다.
그래서 처음으로 결과를 교수님 눈으로 봤습니다. 왜 안 됐는지 칸을 하나씩 뜯어보니 모델이 나쁜 게 아니라 모델을 쓰는 방식이 문제였습니다. 학습된 모델을 그대로 얹으면 이득이 없었는데, 같은 모델을 출발점으로 삼아 다시 학습시키니 학습 데이터가 클수록 이득이 커졌습니다. 그 결과로 "큰 모델" 줄을 지우고 "채널 늘리기" 줄을 위로 올렸습니다. 지금 저희 데이터 수집 우선순위가 "더 오래"가 아니라 "더 많은 채널"인 건 그때 제가 정한 겁니다.
2. 결과가 좋으면 논문부터 떠올랐다
올여름에 차종을 모르는 차에서 CAN 신호를 받아, 어떤 신호가 속도이고 어떤 게 조향각인지 자동으로 알아내는 실험을 했습니다. 학습 모델이 규칙 기반보다 잘 맞혔습니다. 결과를 보자마자 든 생각은 "이거 논문으로 써볼까"였습니다. 박사과정 때 습관이 그대로 남아 있었던 겁니다. 거기서는 결과가 좋으면 다음 할 일이 논문이었고, 논문이 실적이었으니까요.
그런데 회의에서 나온 질문은 논문 얘기가 아니었습니다. 이걸 누가 쓰느냐였습니다. 답은 차에 하네스 물리러 나가는 팀원이었습니다. 그분한테 필요한 건 논문이 아니라, 수집하는 동안 앱 화면에 신호 이름이 저절로 채워지는 기능이었습니다. 그래서 논문은 접고 그날 수집 앱에 붙였습니다.
붙이고 보니 반전이 있었습니다. 저희 고객 차량은 대부분 현대·기아라서, 학습 모델보다 이미 알려진 해독표를 가져다 맞는지 검증하는 쪽이 훨씬 정확했습니다. 학습 모델은 해독표에 없는 신호에만 쓰는 보조 역할로 내려갔습니다. 논문으로는 나쁜 소식입니다. 주인공이 조연이 됐으니까요. 툴로는 좋은 소식입니다. 1분만 달리면 신호 대부분이 확정됩니다.
계획서를 쓸 때도 같은 데서 걸렸습니다. 얼마 전 과제 계획서를 썼는데, 손 가는 대로 쓰니 연구실 계획서가 나왔습니다. 이 기술이 왜 새로운지, 어떤 문제가 아직 안 풀렸는지, 이걸 하면 논문이 나오고 세상에 뭐가 더 나아지는지. 박사과정 때는 그렇게 써야 했고, 그게 좋은 계획서였습니다.
여기서는 그렇게 쓰면 안 통합니다. 읽는 분이 궁금한 건 이게 돈이 되느냐, 그리고 시장이 이미 준비돼 있느냐입니다. 누가 사는지, 얼마나 사는지, 지금 쓰겠다는 고객이 있는지. "아직 아무도 안 해본 기술"이라는 문장은 연구실에서는 강점이었는데, 여기서는 "아직 검증이 안 됐다"로 읽힙니다. 그래서 요즘 계획서는 기술 설명을 뒤로 보내고, 첫 장에 고객과 시장을 씁니다.
연구실에서 결과의 가치는 "새로운가"로 정해졌습니다. 여기서는 "이걸로 뭘 팔 수 있나, 시장이 지금 있나"로 정해집니다. 실험도 계획서도 같은 기술인데, 어느 쪽이 좋은 소식인지가 뒤집힙니다.
3. 데이터를 받는 사람에서 만드는 사람으로
박사과정 때 데이터는 병원에서 왔습니다. 촬영은 병원에서 하고, 저는 넘어온 데이터를 후처리하는 데서부터 시작해서 의미 있는 결과를 뽑는 것까지가 일이었습니다. 하루 종일 컴퓨터 앞에 앉아 있었고, 데이터가 어떻게 찍혔는지는 프로토콜 문서로만 알았습니다.
여기서는 그 앞단이 전부 제 일이 됐습니다. 처음 몇 달은 공개 데이터로 모델을 만들었는데, 결과가 좋을수록 물음표가 커졌습니다. 남의 장비, 남의 나라 도로에서 찍힌 데이터로 된 게 우리 장비, 한국 도로에서도 될까. 그 물음표는 컴퓨터 앞에서는 못 지웁니다. 그래서 아반떼에 직접 하네스를 물리고 부산 도심과 부산에서 광주까지 고속도로를 달려서 데이터를 받았습니다. 그렇게 받은 데이터는 전체 학습 데이터의 0.3%도 안 되는데, 지난 1년 어떤 결과보다 그 데이터가 준 확신이 컸습니다.
수집을 직접 하니 수집 계획도 제 일이었습니다. 새 차종에서 30분 시운전 데이터를 받았는데 신호 여덟 개 중 세 개만 확정됐습니다. 데이터가 나빠서가 아니라 차가 천천히만 달려서 조향과 제동이 거의 없었던 겁니다. 그래서 다음 주행은 "60km/h 넘게, 차선 유지 켜고, 가감속 섞어서"로 부탁드렸고, 그 데이터에서는 여섯 개가 확정됐습니다. 데이터 수집이 녹화가 아니라 주행 계획이라는 걸 그때 배웠습니다.
받은 데이터를 맞추는 일도 만만치 않았습니다. 학습 데이터의 절반 넘게 차지하던 차종의 스로틀 채널이 통째로 비어 있던 걸 몇 달 뒤에야 알았습니다. 신호 이름 하나를 잘못 참조한 거였고, 모델 코드는 멀쩡했습니다. 지난 1년 시간을 세어 보면 모델을 만든 시간보다 데이터를 받고, 맞추고, 의심한 시간이 깁니다. 처음엔 이게 본업이 아닌 것 같아 이상했는데, 지금은 여기서 연구자의 본업이 거기서부터라고 생각합니다.
4. 다음 달에 뭘 하고 있을지 모른다
박사과정 때는 논문 하나를 쓰려고 주제 하나를 6개월에서 1년씩 붙잡고 있었습니다. 오늘 하는 일이 다음 달에도 같은 일이었고, 그게 당연했습니다. 깊이 파려면 그래야 했습니다.
여기 와서 지난 두 달 달력을 세어 봤습니다. 7월엔 차량 신호 파운데이션 모델을 만들고 있었습니다. 7월 말에 GPS만 있는 차에서 CAN 신호를 생성하는 모델을 시작했고, 8월 중순엔 법인 차량이 몇 대 필요한지 계산하는 배차 시뮬레이션을 짰습니다. 8월 18일 하루에 관제 화면용 챗봇과 CAN 자동 해독 툴을 둘 다 시작했습니다. 그 주에 영업 자료를 만들었고, 8월 말엔 새 GPS 단말 데이터를 정제했고, 9월 초엔 정부 과제 공고를 검토하다가 아예 공고를 자동으로 읽어주는 봇을 만들었습니다. 지난주엔 공공데이터 과제 지원서를 썼고, 지금은 이 글을 쓰고 있습니다.
처음엔 이게 불안했습니다. 하나도 제대로 끝낸 게 없는 것 같았습니다. 연구실 기준으로는 두 달에 열 개 주제를 건드린 사람은 아무것도 안 한 사람입니다.
그런데 지내다 보니 이 생태계가 원래 그렇게 돌아가는 거였습니다. 고객이 바뀌고, 과제 공고가 뜨고, 단말이 새로 오고, 옆 팀이 뭔가 필요해집니다. 회사가 작으니 그때마다 손이 비는 사람이 저입니다. 하나를 6개월 붙잡고 있으면 그 사이에 회사가 필요한 게 세 번은 바뀝니다.
대신 일하는 방식을 바꿨습니다. 실험은 1~2주 안에 답이 나오게 작게 자릅니다. 6개월 뒤에 답이 나오는 실험은 그때 회사가 그 답이 필요가 없을수도 있습니다. 그리고 한 일은 전부 다음 일의 재료가 되게 남깁니다. 실제로 CAN 생성 모델 만들 때 그린 도로 지도가 배차 시뮬레이션에 그대로 들어갔고, GPS 정제하면서 만든 데이터가 파운데이션 모델 검증에 쓰였습니다. 주제는 열 개인데 재료는 하나로 쌓입니다.
마치며
네 가지를 적고 보니 결국 한 가지였습니다. 연구실에서 실험은 논문을 위해 했고, 여기서 실험은 회사가 다음에 뭘 할지 정하기 위해 합니다. 그래서 안 된 결과를 들고 갈 사람이 없고, 좋은 결과가 논문이 아니라 쓸 사람과 시장으로 판단되고, 데이터를 받는 게 아니라 만들어야 하고, 한 주제를 오래 붙잡을 수가 없었습니다.
오기 전에는 스타트업에 가면 연구를 덜 하게 될 줄 알았습니다. 1년 해보니 덜 하는 게 아니라 다르게 하는 거였습니다. 박사과정 때 배운 것 중 여기서 그대로 쓰는 건 실험을 설계하고 결과를 의심하는 법이고, 새로 배운 건 그 실험을 왜 하는지를 먼저 묻는 겁니다.
연구실에서 스타트업을 고민하시는 분이나, 스타트업에서 연구자를 찾으시는 분께 참고가 되면 좋겠습니다. 다르게 겪으신 분이 있으면 그 이야기도 듣고 싶습니다. 차량 데이터로 무엇을 판단하고 싶으신지 있으시면 편하게 문의해 주세요.