Executive Summary
제약회사가 가장 늦게까지 내놓지 않는 자산 가운데 하나가 단백질과 후보 약물이 어떻게 맞물려 있는지를 찍어 둔 구조 데이터다. 어떤 분자를 어느 자리에 붙여 봤는지가 그대로 드러나기 때문이다. 그 데이터를 다섯 회사가 같은 모델 하나를 가르치는 데 썼다는 소식을 네이처가 9월에 전했다. 이 글은 회사들이 무엇을 내놓고 무엇을 끝까지 쥐고 있었는지, 그리고 합치기 전에 먼저 맞춰야 했던 것이 무엇인지를 본다.
다섯 회사가 밖에 내놓은 적 없는 구조 20,167건으로 학습을 마친 모델은 시험용 구조에서 단백질과 약물이 맞닿는 자리를 높은 품질로 맞힌 비율이 52.1%였다. 공개 데이터베이스만으로 배운 같은 계열 모델은 35.6%에 그쳤다. 더 눈에 띄는 결과는 그다음이다. 다섯 회사 가운데 어느 한 곳의 데이터만으로 따로 학습시킨 모델도 이 합친 모델을 넘지 못했다. 다만 이 수치는 아직 동료심사를 거치지 않았다. 연합학습을 주관한 회사가 자사 블로그에 올린 기술 리포트가 유일한 출처다.
4절까지는 공개된 자료를 따라간다. 무슨 일이 있었는지, 원본을 내보내지 않고 어떻게 합쳤는지, 수치가 어디까지 말해 주는지, 그리고 아직 열려 있지 않은 것이 무엇인지가 거기 있다. 5절은 그 과정을 데이터가 합쳐질 수 있는 형태였는지의 관점에서 읽는 이 글의 해석이다.
주요 수치
출처: 아페리스 기술 리포트. 첫 카드의 맥락 설명만 네이처 기사에서 가져왔다.
20,167건
학습에 들어간 비공개 구조
공개 데이터베이스에 있는 약물 비슷한 분자와의 결합 구조는 1만 건 안팎이라는 것이 참여사 임원의 추정이다
35.6% → 52.1%
맞닿는 자리를 높은 품질로 맞힌 구조의 비율
공개 데이터로만 학습한 같은 계열 모델과 합친 모델을 같은 시험 집합에서 견준 값이다
1,056건
성능을 잰 시험용 구조
각 회사가 자기 구조의 5%를 떼어 남겼고, 같은 연구 과제에서 나온 구조는 통째로 한쪽에만 넣었다
0건
회사 밖으로 나간 원본 구조
중앙으로 모인 것은 학습을 마친 모델 파라미터이고, 구조 파일 자체는 각사 환경에 남았다
경쟁 회사 다섯 곳이 같은 AI를 가르쳤다
네이처가 9월에 전한 소식의 주인공은 AI 구조생물학 네트워크, 줄여서 AISB라 부르는 제약업계 모임이다. 네이처는 이 네트워크 참여사로 애브비와 아스텍스를 비롯한 여러 제약사를 꼽았고, 이번 학습에 실제로 구조 데이터를 낸 곳은 다섯 곳이다. 연합학습 인프라를 만드는 독일 회사 아페리스가 공개한 명단을 따르면 애브비, 존슨앤드존슨, 아스텍스, 브리스톨 마이어스 스퀴브, 다케다다. 앞의 두 곳이 2025년 3월에 먼저 시작했고 나머지 세 곳이 같은 해 10월에 합류했다.
가르친 대상은 오픈폴드3다. 컬럼비아대 모하메드 알쿠라이시 교수 연구실이 구글 딥마인드의 알파폴드3를 오픈소스로 다시 구현한 모델이고, 단백질과 약물 후보 분자가 함께 있을 때 서로 어떤 모양으로 맞물리는지를 예측한다. 이 계열 모델은 지금까지 공개 단백질 구조 데이터베이스인 PDB로 배웠다. PDB에는 실험으로 밝혀낸 구조가 20만 건 넘게 쌓여 있다.
문제는 그 20만 건의 구성이다. 아스텍스에서 계산화학과 정보를 맡고 있는 폴 모텐슨은 네이처에 PDB 안에서 약물 비슷한 분자와 결합한 상태로 찍힌 구조는 1만 건 정도일 것이라고 말했다. 신약 연구가 실제로 궁금해하는 상황은 바로 그 1만 건 쪽인데, 모델이 배운 재료의 대부분은 다른 종류의 구조다. 학습에 쓰인 분자와 많이 다른 분자를 만나면 이 계열 모델의 정확도가 급격히 떨어진다는 사실은 올해 5월 학술지 Nature Structural & Molecular Biology에 실린 스위스 바젤대 연구진의 평가에서 확인됐고, 네이처는 데이터가 모자란다는 대목의 근거로 그 논문을 각주에 달았다.
아페리스 리포트에는 그 부족의 크기가 더 구체적으로 적혀 있다. 알파폴드3가 학습을 끊은 시점 이후 PDB에는 구조가 7만 건 가까이 더 쌓였지만 대부분은 보조인자, 대사물질, 이온, 결정화에 쓰는 첨가물이다. 승인 약물이나 임상 단계 약물이 들어 있는 공개 구조는 1만 600건 남짓이고, 그중 그 시점 이후에 들어온 것은 3,000건 정도다. 이번에 다섯 회사가 내놓은 2만여 건은 전부 진행 중인 신약 개발 과제에서 나온 화합물이어서, 학습에 쓸 수 있는 약물 관련 구조를 대략 세 배로 늘렸다.
그리고 그 모자란 부분이 어디에 있는지는 업계가 오래전부터 알고 있었다. 애브비에서 계산 신약개발을 이끄는 존 카라니콜라스가 네이처에 한 말이 그대로 그 사정이다. "PDB에 없는 데이터가 정확히 우리 사내 데이터에 있는 데이터다." 제약사는 후보 물질 하나를 붙잡고 수백 번씩 구조를 찍는다. 잘 붙은 것도 있고 엉뚱하게 붙은 것도 있는데, 그 기록은 논문으로 나가지 않고 회사 안에 남는다. 어느 단백질의 어느 자리를 누가 노리고 있는지가 드러나는 자료라 밖으로 내보낼 이유가 없었다. 그렇게 쌓인 금고 전체가 얼마나 큰지는 아무도 모른다. 다 합치면 PDB보다 많을 것이라는 추정도 있다고 네이처는 전했다.
이번에 달라진 것은 그 자료를 내보내지 않은 채로 학습에만 쓰는 방식을 다섯 회사가 함께 돌려 봤다는 점이다. 연합학습으로 제약사 데이터를 묶어 보려는 시도 자체가 처음은 아니다. 앞선 대규모 시도들도 회사를 가로지르는 학습이 된다는 것까지는 보였지만 성능 개선은 크지 않았다고 아페리스는 썼다. 다섯 회사가 오픈폴드3 프리뷰2를 함께 손보는 데는 열 주가 채 걸리지 않았고, 그사이 구조 파일이 회사 밖으로 나간 적은 없다. 결과로 나온 모델에는 AISB-1-Fed라는 이름이 붙었다.
데이터를 내보내지 않고 합치는 법
쓰인 방법은 연합학습이다. 데이터를 한곳에 모아 놓고 모델을 돌리는 대신, 모델을 데이터가 있는 곳으로 보낸다. 다섯 회사는 각자 자기 서버 안에서 오픈폴드3를 몇 걸음씩 학습시키고, 그렇게 바뀐 모델 파라미터만 아페리스가 운영하는 수집 지점으로 올린다. 수집 지점은 다섯 벌의 파라미터를 평균 내 하나의 모델로 만들고, 그 모델을 다시 다섯 회사에 내려보낸다. 이 왕복을 여러 번 반복한다.
이 구조에서 중앙은 숫자 덩어리만 손에 쥔다. 아페리스는 수집 지점이 받은 것은 구조가 아니라 파라미터였다고 리포트에 적었다. 원본 구조 파일은 학습 내내 각 회사 환경 안에 있었고, 파라미터를 거꾸로 풀어 구조를 되살릴 수 없도록 설계했다고 덧붙였다. 사내 데이터를 내놓는 일과 사내 데이터로 무언가를 가르치는 일을 갈라 놓은 셈이다.
학습에 들어간 재료가 사내 데이터만은 아니다. 공개 데이터베이스 PDB의 2025년 11월 19일 시점 자료도 섞었다. 계산은 엔비디아의 cuEquivariance 커널로 가속하고 아마존웹서비스의 P5 인스턴스 여러 대에 분산해 돌렸다. 기술적으로 새로 발명된 부분은 없다시피 하다. 연합학습이라는 방식 자체는 병원 영상이나 휴대전화 입력기에서 이미 여러 해 쓰였다.
파라미터만 오가면 정말 안전한지는 이 계획이 알려졌을 때부터 나온 질문이다. 한 업계 뉴스레터는 비싼 사내 데이터로 학습시킨 모델을 통째로 나눠 갖는 것이 데이터를 나눠 갖는 것보다 나은 결정인지는 미묘한 문제라고 적었다. 아페리스는 완성된 모델을 공격해 보는 것으로 답했다. 학습 데이터를 복원해 내는 공격과 특정 구조가 학습에 들어갔는지 알아내는 공격을 공격자 쪽에 유리한 조건으로 걸었고, 다섯 회사 어느 쪽에서도 의미 있는 위험은 나오지 않았다. 뒤쪽 공격은 이미 그 구조를 3차원까지 손에 쥔 사람만 시도할 수 있고 성공해도 그 구조가 학습에 쓰였다는 사실 하나만 알려 준다는 점도 리포트에 적혀 있다. 기술로 막지 않은 자리는 계약이 맡았다. 역설계와 복원 시도를 금지하는 조항, 데이터를 맡은 쪽과 모델을 만드는 쪽과 인프라를 돌리는 쪽의 역할을 서로 분리하는 조항이 걸려 있다.
이 사례에서 새로운 것은 알고리즘이 아니라 합의다. 서로 경쟁하는 다섯 회사가 같은 모델을 가르치기로 하고, 그러려면 각자의 데이터가 어떤 모양이어야 하는지까지 맞췄다. 기술이 준비된 지는 오래됐고, 늦게 도착한 쪽은 규칙이었다.
공개 모델도, 혼자 만든 모델도 앞섰다
성능은 1,056개의 단백질-리간드 구조에서 쟀다. 다섯 회사가 각각 자기 구조의 5%를 학습에서 빼 두고 시험용으로 남겼는데, 떼어내는 단위를 구조 하나가 아니라 연구 과제 하나로 잡았다. 같은 과제에서 나온 구조들은 서로 닮아 있어서, 하나는 학습에 넣고 다른 하나로 시험하면 모델이 이미 본 것을 다시 맞히는 셈이 된다. 그 지름길을 막아 둔 설계다.
잣대는 두 가지다. 하나는 단백질과 약물 분자가 맞닿는 자리의 모양을 얼마나 정확하게 그렸는지이고, 다른 하나는 약물 분자를 단백질의 어느 위치에 놓았는지다. 둘 다 구조마다 기준선을 넘었는지 아닌지로 판정하고, 기준선을 넘은 구조가 전체에서 몇 %인지를 점수로 삼는다. 첫 번째 잣대의 기준선은 접촉면 점수 0.8이고, 두 번째는 실제 위치와의 어긋남 2옹스트롬이다. 평균 점수를 쓰지 않은 데는 이유가 있다. 이 시험 집합에서 접촉면 점수는 0.2 아래와 0.9 위로 갈라져 몰리고 가운데는 거의 비어 있다. 아주 잘 맞히거나 아예 틀리거나 둘 중 하나라는 뜻이다. 28%가량이 0.2 아래에 몰려 있고 또 28%가량이 0.9 위에 몰려 있다는 것이 리포트가 적은 분포다.
| 모델 | 맞닿는 자리를 높은 품질로 그린 구조의 비율 | 약물 분자를 제자리에 놓은 구조의 비율 |
|---|---|---|
| AISB-1-Fed (다섯 회사 연합학습) | 52.1% | 46.8% |
| Boltz-2 (공개 모델) | 40.9% | 36.5% |
| 오픈폴드3 프리뷰2 (공개 데이터로만 학습) | 35.6% | 28.9% |
1,056개 시험용 구조 기준. 출처: 아페리스 기술 리포트. 같은 표에 프로테닉스 계열 두 모델도 비교 대상으로 올라 있다.
표에서 오픈폴드3 프리뷰2는 연합학습을 시작하기 전의 출발점이다. 그런데 출발점과 도착점만 견주면 함정이 하나 남는다. 연합 모델은 다섯 회사의 사내 구조뿐 아니라 더 최근까지의 공개 데이터도 함께 먹었기 때문에, 성적 차이가 사내 데이터에서 온 것인지 새 공개 데이터에서 온 것인지가 섞인다. 아페리스는 그 둘을 떼어 놓으려고 대조군을 하나 더 만들었다. 같은 출발점 모델에 사내 구조는 빼고 공개 PDB만, 대신 비교 모델들과 같은 최신 시점까지 먹여 학습시킨 모델이다. 연합 모델은 이 대조군도 뚜렷이 앞섰다. 성적을 가른 것이 사내 구조라는 주장은 이 대조군 위에 서 있다. 모든 비교에는 부트스트랩으로 95% 신뢰구간을 붙였고, 연합 모델의 구간은 어느 비교 모델과도 겹치지 않았다.
가장 가까이 따라온 공개 모델인 Boltz-2와 견주면 두 잣대 모두에서 11%포인트 안팎 앞섰다. 단백질끼리 맞물린 자리가 함께 찍힌 443개 구조만 따로 보면 격차가 더 벌어져, 연합 모델은 62.6%를 기록했고 비교 대상 모델들은 38.8%에서 40.9% 사이에 머물렀다. 이번 학습에 함께한 알쿠라이시는 네이처에 이 결과를 두고 "이 데이터를 전부 더하면 성능이 꽤 크게 올라간다"고 말했다.
이 글이 더 눈여겨본 대목은 공개 모델과의 격차가 아니라 그다음 비교다. 아페리스는 합친 모델이 공개 모델뿐 아니라 참여사 한 곳의 데이터만으로 손본 어떤 모델보다도 나았다고 적었고, 카라니콜라스도 네이처에서 같은 점을 짚었다. 각 회사가 자기 금고만 열어서는 도달하지 못한 자리에 다섯이 함께 열었을 때 닿았다는 뜻이다. 회사마다 쥐고 있는 구조가 서로 다른 빈칸을 메워 줬다는 해석이 가능해진다.
다만 회사별 단독 모델이 몇 %였는지는 공개되지 않았다. 아페리스는 참여사 승인 없이는 회사별 성능을 밝힐 수 없다고 적었다. 그래서 "합친 쪽이 낫다"는 사실까지는 확인되지만 "얼마나 나은지"는 바깥에서 확인할 방법이 없다. 수치의 출처가 연합학습을 주관한 회사 자신이라는 점도 같이 놓고 읽어야 한다. 앞에서 인용한 카라니콜라스와 모텐슨을 비롯해 다섯 회사의 연구자들이 이 리포트의 공저자로 이름을 올렸다.
아직 열려 있지 않은 것들
이 결과는 논문이 아니다. 아페리스 블로그에 실린 기술 리포트가 전부이고, 연구진은 동료심사 학술지에 논문을 내겠다고만 밝혔다. 학습에 쓴 구조도, 완성된 모델의 가중치도 공개되지 않는다. 바깥에 나와 있는 것은 집계된 점수뿐이다.
리포트가 스스로 달아 둔 단서도 읽을 만하다. 성능을 잰 1,056건은 학습 데이터를 낸 바로 그 다섯 회사에서 떼어 낸 구조다. 바깥 기관이 새로 마련한 시험이 아니라 참여사가 자기 데이터의 일부를 남겨 둔 시험이라는 뜻이다. 회사들 사이에 비슷한 구조가 얼마나 겹치는지를 재는 일 자체가 서로의 데이터를 볼 수 없는 구조에서는 어렵다는 점도 연구진이 인정한다. 시험 집합이 제약사의 단백질-리간드 데이터 쪽으로 일부러 기울어 있다는 단서도 붙어 있다. 이 성적은 참여사가 실제로 다루는 표적에서 모델이 얼마나 쓸 만한지를 보여 주지, 화학 전반을 얼마나 이해하는지를 보여 주지는 않는다.
완성된 모델을 누가 쓰게 되는지는 네트워크 쪽 설명에 나와 있다. 한 과제가 만들어 낸 모델의 가중치는 그 과제에 참여한 회사들의 것이고, 원래 각자 갖고 있던 권리와 이번에 새로 생긴 권리는 계약으로 구분해 둔다. 회원사는 초대를 받아 들어온다. 이 계획이 알려진 2025년 10월에 한 업계 뉴스레터는 가중치가 오픈소스로 풀린다는 언급을 어디에서도 찾지 못했다면서, 데이터를 낸 회사들끼리만 나눠 쓰는 편이 합리적이고 다른 회사가 네트워크에 들어올 동기도 된다고 봤다. 예상대로 굳은 셈이다. 같은 글은 기반이 된 오픈폴드3와 새로 만들어진 모델 사이의 관계를 두고 읽은 자료마다 설명이 모호했다고도 했다. 오픈소스 모델에서 갈라져 나왔지만 오픈소스로 돌아가지는 않는 줄기가 하나 생겼다.
이번에 맞춘 데이터 형식도 다섯 회사 안에서만 통하는 약속이다. 업계 전체가 쓰는 공통 규격이 생긴 것은 아니다. 다만 뒤에 들어오는 회사가 같은 고생을 처음부터 되풀이하지는 않는다. 한 회사에서 걸린 형식 문제를 고치면 그 해법을 전원에게 적용했고, 그렇게 쌓인 작업 흐름 덕분에 신규 합류가 훨씬 빨라졌다고 아페리스는 설명했다. 규격은 업계가 아니라 이 네트워크 안에 쌓이고 있다.
검증된 범위도 좁다. 이번 시험은 단백질과 약물이 어떤 모양으로 맞물리는지에 관한 것이다. 그 분자가 실제로 얼마나 강하게 붙는지를 예측하는 문제는 다음 과제로 남았다. 약효를 가르는 쪽은 오히려 후자다.
같은 부족을 정반대 방식으로 메우려는 시도도 굴러가고 있다. 네이처는 영국 정부가 최대 800만 파운드, 약 1,080만 달러를 대는 오픈바인드 사업을 나란히 소개했다. 이쪽은 부족한 결합 구조를 새로 만들어 공개해 버리는 방식이고, 지난달 수백 건을 풀었으며 수천 건이 더 준비 중이다. 알쿠라이시 본인은 이번 결과가 오히려 그런 공개 데이터셋을 더 만들어야 할 이유를 키웠다고 네이처에 밝혔다. AISB는 빈칸을 각자 쥔 채 모델만 공유하고, 오픈바인드는 빈칸 자체를 공공재로 채운다. 두 길이 나란히 가고, 한쪽에 참여한 사람이 다른 쪽의 필요를 먼저 꺼낸다.
페블러스가 이 소식을 주목하는 이유
이 사례에서 모델 구조는 바뀌지 않았다. 다섯 회사가 손본 것도, 비교 대상이 된 공개 모델도 같은 오픈폴드3 계열이다. 달라진 것은 무엇을 먹였느냐뿐이고, 성적은 그 한 가지에서 갈렸다. 우리가 결합 부위를 못 짚는 신약 예측 AI에서 다룬 문제, 그리고 성공 사례만 배운 모델의 과대평가에서 살핀 대표성 결함이 같은 뿌리에서 나온다는 점이 이번 결과로 한 번 더 드러났다.
그런데 이 사례의 나머지 절반은 성적표 앞에 있다. 아페리스 리포트는 학습을 시작하기 전에 무엇을 해야 했는지까지 기록했다. "각 회사는 수십 년에 걸쳐 자사만의 사내 형식과 관행으로 구조를 쌓아 왔고, 그래서 그것을 회사 간에 일관되고 기계학습에 쓸 수 있는 상태로 만드는 일은 결코 자동으로 되지 않았다." 데이터를 합치자는 합의가 이뤄진 뒤에도, 합쳐지는 상태로 만드는 작업이 따로 남아 있었다는 이야기다.
리포트에 나오는 준비 작업을 묶으면 네 가지다. 먼저 각사 구조를 공유 형식으로 옮기면서 분자를 기술하는 방식, 결정 분해능 값, 단백질 사슬 라벨, 리간드와 단백질이 맞닿는 면의 주석을 같은 규칙으로 맞췄다. 다음으로 모든 구조가 그 공유 규칙을 지켰는지 검사했다. 그리고 전체 구조를 학습 파이프라인에 한 번 통째로 흘려보내는 예행 연습으로 실제로 돌아가는지 확인했다. 마지막으로 어느 구조에서 문제가 생겼을 때, 그 구조에 미리 붙여 둔 익명 식별자만 소유사에 돌려줬다. 어느 회사의 무엇이 잘못됐는지를 아페리스도 다른 참여사도 알 수 없는 구조다.
우리가 AI-Ready Data를 이야기할 때 드는 조건이 여기에 그대로 있다. 같은 항목을 같은 이름과 같은 단위로 적는 일, 이 값이 어디에서 어떤 조건으로 나왔는지를 함께 남기는 일, 누가 무엇까지 볼 수 있는지를 미리 정해 두는 일이다. 평소에는 나중으로 미뤄도 표가 나지 않는 일들이다. 데이터를 남과 합치려는 순간 미뤄 둔 만큼이 그대로 비용이 된다. 다섯 회사가 열 주가 채 안 되는 기간에 끝냈다고 할 때, 그 시계는 첫 연합학습을 돌린 날부터 재기 시작한다. 앞에서 본 준비 작업은 그 안에 들어 있지도 않다.
네트워크가 스스로 적어 둔 방침도 같은 쪽을 가리킨다. 연합학습 알고리즘은 단순하게 두고, 데이터를 주고받는 면을 일관되게 만들고, 실제 운영 조건에서 평가한다는 세 줄이다. 플랫폼을 댄 아페리스가 자기 몫으로 꼽은 일도 기술만이 아니다. 회사들 사이에 과학적 견해를 맞추는 일, 일정을 짜는 일, 계약과 승인을 받아 내는 일이 나란히 들어간다. 데이터 관리 주체가 자기 데이터 위에서 어떤 계산을 돌려도 되는지를 스스로 정한다는 조항도 네트워크 설명에 붙어 있다.
한국 현장으로 옮겨도 물음의 모양은 같다. 우리 회사가 파트너사나 같은 업종의 다른 회사와 데이터를 합치자는 제안을 받았을 때, 합의가 되면 바로 시작할 수 있는 상태인가. 과학자들이 AI에 끝내 넘기지 않는 것들이 있듯, 회사에도 끝까지 내보내지 않을 데이터가 있다. 이번 사례가 보여 준 것은 그 경계를 지키면서도 합치는 길이 있다는 사실과, 그 길에도 준비가 필요하다는 사실이다. 다음 네 가지를 확인해 보면 현재 위치가 대략 나온다.
- 같은 항목이 부서마다 다른 이름, 다른 단위로 적히고 있지는 않은가. 한 회사 안에서 갈리는 이름은 다른 회사와는 더 갈린다.
- 데이터마다 언제, 어떤 장비로, 어떤 조건에서 나왔는지가 함께 남아 있는가. 값만 있고 맥락이 없으면 합친 뒤에 무엇이 잘못됐는지 되짚을 수 없다.
- 우리 데이터 전체를 학습 파이프라인에 한 번 태워 본 적이 있는가. 예행 연습 없이 시작하면 문제가 학습 도중에 드러난다.
- 바깥과 주고받아야 할 때, 원본을 가리고 필요한 정보만 돌려주는 방법이 정해져 있는가. 이 규칙이 없으면 합의는 기술이 아니라 법무에서 멈춘다.
AISB의 결과가 얼마나 단단한지는 동료심사와 후속 검증이 판가름한다. 수치가 어느 쪽으로 정리되든 이 사례에서 남는 것은 그 앞의 준비다. 데이터를 합치자는 결정은 회의실에서 나지만, 정작 합쳐지느냐는 그 전에 몇 해 동안 해 둔 것이 정한다.
여기까지 읽어 주셔서 감사하다. 이 글이 인용한 사실은 네이처 기사와 아페리스 기술 리포트에서 누구나 확인할 수 있다. 여러분의 회사에서는 다른 조직과 데이터를 모으자는 이야기가 나왔을 때 무엇이 가장 먼저 발목을 잡았는지 나눠 주시면 좋겠다.
참고문헌
주 출처
- 1.Callaway, E. (2026). "Drug firms' secret data supercharge AI protein models." Nature. nature.com — 이 글의 핵심 훅
- 2.Javer, A., Gautier, N., Irwin, B. W. J. et al. (2026). "Federated Training Dramatically Improves the Accuracy of Protein-Ligand Co-folding on Private Pharma Structures." Apheris 기술 리포트. apheris.com — 정량 수치의 원출처
학술 논문
- 3.Škrinjar, P. et al. (2026). "Evaluating generalization in protein-ligand cofolding methods." Nature Structural & Molecular Biology 33, 782–794. DOI:10.1038/s41594-026-01797-5 — 낯선 분자를 만났을 때 정확도가 급락하는 현상의 실증
- 4."More protein-ligand data are needed for AlphaFold-like models to enable drug discovery." (2026). Current Opinion in Structural Biology. sciencedirect.com — 구조 예측은 강하나 결합 친화도 예측은 약하다는 배경 맥락
공식 발표·업계 보도
- 5.Apheris (2025). "AISB Network Expands Federated OpenFold3 Initiative with Three New Pharma Contributors." apheris.com — 아스텍스·BMS·다케다 합류 발표
- 6.Apheris. "AI Structural Biology (AISB) Network." apheris.com — 모델 소유권·회원 초대제 조항
- 7."Three more pharmas join OpenFold3 AI consortium." (2025). pharmaphorum. pharmaphorum.com
- 8."Secure AI Collaboration Will Fine-Tune OpenFold3 with Proprietary Data." (2025). Genetic Engineering & Biotechnology News. genengnews.com
- 9."Openfold3 and the AISB — Is federated the new open source?" (2025). Scaling Biotech (Substack). scalingbiotech.substack.com — 비판적 분석, 계보 투명성·업계 표준 부재 지적