Genffice 전문업무APP · 데모

Genffice 연구검증 게이트를 지난 논문 조각

오믹스 표 세 장을 올리면 공통 ID로 병합해 전처리·학습·평가·모델 비교·재현 확인까지 열 단계를 돌리고, 검증 관문 셋을 모두 지난 타깃만 논문에 붙일 LaTeX 표·그림·본문 절을 한국어와 영어로 정리합니다. 근거가 모자라면 아무것도 내지 않습니다.

데모 주소 science-pro.app.genver.online 자료 범위 고객 제공 동봉 데이터(test_dataset 3장) · 화면에서 올린 표 2026년 10월

왜 필요한가

모델을 돌리는 도구는 이미 많습니다. 문제는 그 점수를 논문의 주장으로 써도 되는지를 연구자가 직접 확인해야 한다는 점입니다.

점수는 주장이 아니다

가장 높은 점수의 모델을 찾는 것과, 그 점수가 기준선(아무것도 배우지 않은 모델)과 통계적으로 구분되는지 확인하는 것은 다른 일입니다. 교차검증의 폴드는 서로 독립이 아니어서 보통의 검정을 쓰면 p 값이 작게 나옵니다.

성능이 어디서 왔는지 모른다

표본이 적고 피처가 많은 오믹스 자료에서는 높은 점수가 생물학적 신호가 아니라 집단 표지(어느 집단인지를 알려 주는 변수)에서 올 수 있습니다. 블록을 떼어 보기 전에는 알 수 없습니다.

표와 본문의 숫자가 갈라진다

실험을 다시 돌리면 표는 바뀌는데 본문에 손으로 적은 숫자는 그대로 남습니다. 같은 시드로 다시 돌렸을 때 같은 값이 나오는지도 따로 확인해야 합니다.

누가 쓰나

오믹스 자료로 예측 모델을 만들고 그 결과를 논문에 싣는 연구팀이 주 대상입니다. (사용자 유형은 앱의 시연 팀 구성에서 가져왔습니다.)

연구원 · 제1저자

표를 올리고 단계 01–06의 설정(ID 컬럼, 전처리, X·Y, 교차검증, 모델)을 고른 뒤, 통과한 타깃의 표·그림·본문 절을 원고에 붙입니다.

책임연구원 · 교신저자

관문 판정과 절편 실험 결과를 보고 어느 결론을 논문에 쓸 수 있는지, 무엇을 한계로 밝혀야 하는지 판단합니다.

통계 자문

보정된 검정, 다중비교 보정, 관문이 실제로 본 관찰값(하한·개선폭·유의수준)을 확인합니다.

논문을 쓰는 사람은 앱 없이 자기 노트북에서 같은 파이프라인을 명령줄로 돌릴 수도 있고, Genffice 플랫폼에 설치된 경우 플랫폼의 AI직원이 같은 연구건을 일곱 단계로 밟을 수 있습니다.

네 단계로 끝까지

화면의 단계는 넷이고, 그 안의 파이프라인은 열 단계입니다. 자료가 바뀌면 그 전에 만든 결론은 낡은 것으로 표시되어 지금 자료의 결론처럼 보이지 않습니다.

1자료표 세 장 · 블록 · 공통 표본
2파이프라인수집부터 조판까지 열 단계
3관문타깃마다 관문 셋 판정
4조각통과한 타깃의 표·그림·본문 절
요청하신 기능담당 단계이 서비스가 하는 일
① 세 파일을 공통 ID로 병합자료 · 파이프라인 01–03표마다 방향(행이 표본인지 피처인지)과 ID 컬럼을 판정하고, 필요하면 전치한 뒤 세 표의 교집합으로 표본을 확정합니다. 이름이 잘못 붙은 ID 컬럼도 잡아냅니다.
② 머신러닝 파이프라인 수행파이프라인 01–09전처리, X·Y 지정, 반복 층화 교차검증, 회귀 9종·분류 7종 모델과 기준선 학습, 평가, 모델 비교·절편 실험, 같은 시드 재실행까지 돌리고 단계마다 무엇을 골랐고 무엇을 버렸는지 기록합니다.
③ 논문에 넣을 LaTeX 표·그림관문 → 조각관문 셋을 지난 타깃만 표·그림·방법·결과·한계 절을 만듭니다. 본문 숫자는 수치 매크로로 참조해 표와 갈라지지 않습니다.
④ 한글 · 영문 각각조각같은 조각과 그림을 한국어판과 영어판으로 따로 냅니다.
⑤ 발표 슬라이드 · 설명 영상이 앱 밖이 앱의 파이프라인은 조각에서 끝납니다. 슬라이드·영상은 Genffice의 형제 앱이 같은 실행 기록(run.lock)을 읽어 만드는 몫으로 나누었습니다 — 아래 「한계와 다음 단계」.

화면으로 보기 — 동봉 데이터(test_dataset) 시연 회차

고객이 검증용으로 준 표 세 장(환경 메타데이터 · 미생물 군집 · 대사체)을 이 앱으로 실제로 돌린 회차를 따라갑니다. 연구 질문은 앱의 시연 문장 「장내 미생물 조성과 대사체로 표본 유형을 가릴 수 있는가」이고, 타깃은 넷(시료 유형 · 채취 시기 · 염분 · RPP)입니다. 시연은 서버에서 다시 계산하지 않고 그 회차의 기록을 보여 줍니다.

STEP 1 — 자료

세 표를 무엇으로 묶어야 하나

① 병합

  • 표마다 ID 컬럼과 방향을 판정합니다. 미생물 표는 ASV가 행이라 전치합니다.
  • 대사체 표의 ID 컬럼 이름이 Compound_Name으로 잘못 붙어 있는 것을 잡아내고, 그 판단을 기록에 남깁니다.
  • 자료가 스스로 말하지 못하는 것은 결측으로 접지 않고 한계로 따로 적습니다.
시연 회차 결과
표 3장 · 공통 표본 95개 (메타데이터 110 · 미생물 110 · 대사체 95 — 대사체 표에 없는 15개 제외)
시료 유형 7클래스(A 35 · 나머지 10씩) · 채취 시기 STK 77 대 LTK 18
따로 적은 한계 3건 — 두 분류 타깃의 연관 Cramér's V 0.63 등
자료 화면
자료 화면 — 표 크기·결측 칸과 함께, 단계 04가 찾아낸 「이 자료가 말하지 못하는 것」이 아래에 붙습니다.
STEP 2 — 파이프라인

열 단계는 무엇을 골랐고 무엇을 버렸나

① 병합 ② ML 파이프라인

  • 준비 · 실험 · 검증 · 산출 네 국면에 열 단계가 놓입니다. 단계마다 걸린 시간과 낸 것이 보입니다.
  • 누수를 만들 수 있는 자리 셋을 지킵니다 — 스케일링은 폴드 안에서, 유병률 필터·CLR은 병합 뒤에, 타깃 컬럼은 X에서 제외.
  • 시드는 42로 고정이고 바꾸는 칸이 없습니다.
시연 회차 결과
10/10 단계 · 실행 시간 1분 32초(단계별 합)
모델 적합 792회 (폴드 20 × 모델 전부) · 재현 해시 25건
파이프라인 화면
파이프라인 흐름 — 검증 국면을 지나지 못한 타깃은 산출 국면이 표도 그림도 만들지 않습니다.
STEP 2 — 단계 상세

내 표로 설정을 바꾸면 무엇이 달라지나

① 병합 ② ML 파이프라인

  • 단계 01–06에는 고를 칸이 있습니다 — 파일 방향, ID 컬럼, 전처리 모듈, 유병률 하한, CLR, 이상값, Y 타깃, X 블록, 겹 수·반복, 모델.
  • 「새 연구」에서 표를 올려 착수하면 서버가 그 표로 01–05를 다시 돌려 결과를 바로 보여 줍니다(동봉 데이터 기준 1–2초).
  • 고를 수 없는 것(시드, 관문 기준, 폴드 밖 정규화 등)은 잠긴 칸과 이유로 보입니다.
단계 03 (파일병합·추가전처리) 예시
내부 조인 · 110 → 95 (제외 15) · 피처 242 (미생물 111 · 대사체 65 · 환경 메타데이터 66)
유병률 하한 10% · CLR 변환 · 이상값 IQR 1.5 절단
단계 상세 화면
단계 상세 — 가운데는 이 표로 나온 것, 오른쪽은 고를 수 있는 설정입니다.
STEP 3 — 관문

이 점수를 논문에 써도 되나

② ML 파이프라인 ③ LaTeX 표·그림

  • 타깃마다 관문 셋을 판정합니다 — 성능(하한과 기준선 대비 개선폭) · 비교(보정 p 값으로 유의, 절편 실험 완주) · 재현(같은 시드 재실행 지표 완전 일치).
  • 통과한 판정에도 하한·개선폭·유의수준을 관찰값과 나란히 보여 줍니다.
시연 회차 결과 — 판정 4 · 통과 4 · 차단 0 · 재지 않은 타깃 0
시료 유형 f1_macro 0.944 ≥ 하한 0.40, 기준선 대비 +0.867 ≥ 0.15 · 보정 p = 1.34e-05 통과
채취 시기 0.813 · 염분 r2 0.637 · RPP r2 0.435 통과
관문 화면
관문 판정 — 관문마다 「무엇을 보고」 통과했는지와 절편 실험 막대가 함께 나옵니다.
STEP 3 — 관문 · 대조군

관문이 정말 막기는 하나

③ LaTeX 표·그림

  • 이번 회차는 네 타깃이 모두 통과했습니다. 통과만 보이면 관문을 믿을 근거가 없으므로, 타깃과 피처가 무관한 자료로 한 판 더 실제로 돌린 기록을 함께 싣습니다.
  • 막힌 회차는 표·그림·본문 절을 하나도 만들지 않고, 내보내기는 거절(HTTP 409)됩니다.
대조군 회차 결과 — 네 타깃 전부 차단
시료 유형 0.382(하한 0.40) · 채취 시기 0.497(하한 0.60) · 염분 −0.222 · RPP −0.203(하한 0.10)
조각은 관문·자료 표 15건에서 멈춤 · 내보내기 409
대조군 카드
대조군 카드 — 막힌 이유와 점수를 감추지 않고 그대로 보여 줍니다.
STEP 3 — 실험 결과

성능은 어느 자료에서 왔나

② ML 파이프라인

  • 모델 순위는 폴드 점수의 평균 ± 표준편차, 홀드아웃 점수, 1등과의 보정 p 값으로 보여 줍니다. 기준선 모델도 순위에서 빼지 않습니다.
  • 절편 실험은 피처 블록 단위로 「그 블록만 썼을 때」를 다시 돌립니다.
시료 유형 예시
1위 의사결정나무 분류 0.944 ± 0.063 · 기준선 0.077
전체 0.944 → 환경 메타데이터만 0.769 · 미생물+대사체 0.507
→ 이 성능은 오믹스 프로파일이 아니라 집단 표지에서 왔을 수 있고, 그 사실이 한계 절에 실립니다.
실험 결과 화면
실험 결과 — 막대는 「뺀 블록」이 아니라 「쓴 블록」의 점수입니다.
STEP 4 — 조각

논문에는 무엇을 붙이나

③ LaTeX 표·그림 ④ 한·영

  • 수치 매크로, 모델 순위·절편·관문 표, 결과·한계 본문 절, 그림 스니펫을 LaTeX 조각으로 냅니다. 완성 논문이 아니라 삽입용 조각입니다.
  • 한국어·English를 눌러 같은 조각의 두 언어판을 봅니다. 그림도 언어별 글꼴로 따로 그립니다.
  • 묶음(zip)·요약(md)·원자료(json)로 내보냅니다. 원본 CSV와 학습된 모델 파일은 담지 않고, 출처는 run.lock의 해시가 말합니다.
시연 회차 결과
조각 51건 · 그림 22장(언어별) — 통과한 네 타깃의 것만
한계 절: 피처 대 표본 비 2.55 · 메타데이터 블록 의존 · 두 타깃의 연관(V = 0.63)
조각 화면
조각 화면 — 누르면 LaTeX 본문이 열립니다. 본문은 숫자를 다시 적지 않고 매크로를 참조합니다.
언제든 — AI직원

말로 맡기고 진행을 따라간다

② ML 파이프라인

  • 3열 입력창에 「관문 판정 보여줘 — 막히면 어떻게 되는지까지」처럼 적으면 해당 단계가 돌고, 진행·도구 사용·판단이 대화창에 순서대로 쌓입니다.
  • 이 앱 안에는 대화 모델이 없습니다. 데모의 입력창은 시연 대본을 고르는 손잡이이고, 화면 아래에 그 사실을 적어 둡니다. 실제 AI직원은 Genffice 플랫폼 쪽에서 같은 연구건을 일곱 단계(연구 열기 · 자료 · 상태 · 실행 · 기준 · 조각 · 내보내기)로 밟습니다.
AI직원 화면
AI직원(시연 대본) — 「관문이 셋입니다. 하나라도 막히면 그 타깃의 표와 그림은 쓰이지 않습니다」로 시작해 타깃별 판정을 이어 갑니다.

믿을 수 있게 만든 원칙

이 업무에서 가장 위험한 오답은 검증을 지나지 않은 표가 근거까지 붙은 채 논문에 들어가는 것입니다. 읽는 사람은 그 표를 검증된 결론으로 믿습니다.

⛔

막히면 내지 않는다

관문 셋 중 하나라도 막히면 그 타깃의 표와 그림은 만들지 않고, 통과한 것이 없으면 내보내기를 거절합니다. 막히는 것이 고장이 아니라 산출물입니다.

🔒

기준을 바꾸는 손이 없다

관문 하한과 개선폭은 코드 상수이고, 시드는 42로 고정입니다. 통과할 때까지 기준이나 시드를 바꿔 가며 돌리는 길을 막았습니다.

≠

폴드는 독립이 아니다

반복 교차검증에는 보정된 대응 t-검정을 쓰고, 여러 모델 비교에는 BH 보정을 거친 p 값을 보고합니다.

▦

성능의 출처를 가른다

블록 단위 절편 실험과 지문화·교락 진단으로 성능이 집단 표지에서 왔을 가능성을 재고, 그 결과를 한계 절에 자동으로 싣습니다.

?

모르는 것을 0으로 접지 않는다

재지 않은 타깃, 자료가 말하지 못하는 것은 「값이 낮다」가 아니라 따로 적습니다. 막힌 타깃의 점수도 감추지 않습니다.

#

숫자는 한 곳에서

본문은 수치 매크로를 참조하고, 모든 숫자는 실행 기록(run.lock)의 해시로 어느 자료·설정에서 나왔는지 추적됩니다.

이 앱은 AI 모델을 한 번도 부르지 않습니다. 판정은 산술이고 조각의 문장은 템플릿입니다. AI는 플랫폼의 AI직원이 단계를 밟고 결과를 옮길 때만 쓰입니다.

자료 범위

시연은 고객이 검증용으로 준 동봉 데이터 세 장을 실제로 돌린 회차입니다. 「새 연구」에서는 연구자가 올린 표(CSV·TSV·TXT)로 돕니다.

공통 표본
95개

표 3장(메타데이터 · 미생물 군집 · 대사체)의 교집합

피처
242개

미생물 111 · 대사체 65 · 환경 메타데이터 66

모델
16종

회귀 9 · 분류 7, 타깃마다 기준선 모델 함께

산출물
51건

LaTeX 조각 51건 · 그림 22장, 한국어·영어 각각

한계와 다음 단계

화면만 만든 목업이 아니라 파이프라인과 관문이 실제로 도는 시제품입니다. 그러나 논문 작업에 그대로 쓰기 전에 채워야 할 것이 있습니다.

실제로 동작하는 것

실물 파이프라인

「새 연구」에서 표를 올리면 서버가 그 표로 열 단계를 실제로 돌립니다. 단계 01–05는 설정을 바꿀 때마다 다시 계산해 보여 줍니다.

관문 · 대조군

관문 판정은 매 실행 산술로 계산합니다. 대조군 카드는 지어낸 화면이 아니라 무관한 자료로 실제로 돌려 전부 막힌 회차입니다.

한·영 조각 · 내보내기

통과한 타깃의 LaTeX 조각과 그림을 두 언어로 만들고, 묶음·요약·원자료로 내려받습니다.

아직 채워야 할 것

항목지금 상태실제 서비스에 필요한 것
검증 자료
동봉 자료 1벌
앱의 동작은 고객이 준 동봉 데이터(공통 표본 95개)와 테스트용 합성 자료로만 확인했습니다. 다른 오믹스 자료로 돌려 본 적이 없습니다. 연구팀의 실제 자료 여러 벌로 돌려 ID 판정·전처리·관문이 의도대로 동작하는지 확인합니다.
판단 범위
관문 셋까지
성능·비교·재현만 판정합니다. 생물학적 해석, 외부 검증 코호트, 표본 수의 적정성은 판단하지 않고 진단 결과를 한계 절에 적을 뿐입니다. 외부 검증 자료를 넣는 단계와, 해석은 연구자가 쓰도록 비워 두는 원고 구조를 검토합니다.
관문 기준값
앱이 정한 값
타깃별 하한(0.40 · 0.60 · 0.10)과 개선폭은 개발 때 정한 코드 상수입니다. 분야 표준과 맞춰 본 적이 없습니다. 통계 자문과 함께 타깃 유형별 기준을 정하고, 바꾼 근거를 기록합니다.
모델 설정
고정 설정
모델 16종은 정해 둔 설정으로 학습합니다. 하이퍼파라미터 탐색은 하지 않습니다. 누수가 없도록 중첩 교차검증 안에서 탐색하는 선택지를 더합니다.
조각 품질
검토용 조각
LaTeX는 정적 검사만 하고 서버에서 컴파일하지 않습니다. 본문 절의 문장은 템플릿이라 연구자가 다듬어야 합니다. 대상 학술지 양식에서 컴파일 확인, 원고 담당자의 문장 검토 절차를 둡니다.
슬라이드 · 영상
이 앱 밖
요청 ⑤(발표 슬라이드·설명 영상)는 이 앱에서 만들지 않습니다. 이 앱에는 형제 앱의 주소도 연결도 없습니다. 플랫폼에서 AI직원이 같은 run.lock을 문서·슬라이드·영상 앱으로 넘기는 흐름을 연결합니다.
재현 환경
판 의존
같은 시드라도 라이브러리 판이 다르면 수가 조금 달라집니다(동봉 회차 염분 R² 0.637 대 이전 판 0.626). 배포 이미지의 라이브러리 판을 고정하고, 판을 올릴 때 동봉 회차를 다시 짓습니다.
실행 자원
한 번에 1건
한 컨테이너에서 동시에 한 실행, 코어 둘만 씁니다. 동봉 자료 기준 단계별 합 1분 32초입니다. 자료 규모와 사용자 수에 맞춰 실행 대기열과 코어 상한을 조정합니다.
접근 · 보안
로그인 없음
단독 데모에는 로그인이 없습니다. 앱 토큰을 설정하면 계산을 쓰는 경로만 잠기고, 화면과 읽기 경로는 열려 있습니다. 올린 자료는 서버 볼륨에 남습니다. 기관 계정 로그인, 연구건별 접근 분리, 미발표 자료 보관·삭제 정책을 갖춥니다.
전문가 검증
미실시
관문 판정과 조각을 외부 통계 전문가나 고객 연구팀이 검수한 적이 없습니다. 대표 연구 몇 건으로 판정·조각을 검수하고, 틀린 곳을 기준과 템플릿에 반영합니다.
플랫폼 연결
단독 데모
이 데모 주소에서는 앱이 단독으로 돌고 3열 입력창은 시연 대본입니다. AI직원 일곱 단계는 Genffice 플랫폼 설치에서만 동작합니다. 고객 플랫폼에 업무 단계로 등록해 드라이브 자료 선택·산출물 카드와 함께 씁니다.
모든 결과는 참고용입니다. 어떤 결과를 논문의 주장으로 쓸지에 대한 최종 판단은 연구 책임자와 공동저자가 검토해 내려야 합니다.

다음 단계 제안

1단계 · 신뢰 확보

실제 자료와 기준 검토. 연구팀의 자료 여러 벌로 돌려 보고, 통계 자문과 관문 기준값을 정해 근거와 함께 기록합니다.

2단계 · 분석 범위

탐색과 외부 검증. 중첩 교차검증 안의 하이퍼파라미터 탐색, 외부 검증 자료 단계, 학술지 양식 컴파일 확인을 더합니다.

3단계 · 연결

플랫폼과 형제 앱. 로그인과 함께 플랫폼에 등록하고, AI직원이 같은 실행 기록을 문서·슬라이드·영상 앱으로 넘기게 합니다.