Đằng sau hành trình ấy là gần một thập kỷ bền bỉ xây dựng nền tảng dữ liệu gene của người Việt - một nghiên cứu cơ bản nay trở thành công cụ phục vụ nhiệm vụ tri ân mang ý nghĩa đặc biệt của đất nước.
Từ ý tưởng xây dựng ngân hàng gene người Việt đến nền tảng định danh liệt sĩ bằng ADN
Gần 8 năm trước, Tiến sĩ Võ Sỹ Nam từ Mỹ trở về Việt Nam tham gia lãnh đạo dự án giải mã gene người Việt theo lời mời của Giáo sư Vũ Hà Văn tại Viện Nghiên cứu Dữ liệu lớn thuộc tập đoàn Vingroup. Họ cùng chung một mục tiêu: xây dựng một cơ sở dữ liệu gene của người Việt, tạo nền tảng cho các nghiên cứu và ứng dụng trong tương lai.
Nền tảng này đã được hiện thực hóa thông qua dự án VN1K - nghiên cứu xây dựng nguồn dữ liệu hệ gene và kiểu hình quy mô lớn đầu tiên của người Việt, đồng thời phát triển hệ gene tham chiếu quần thể dành riêng cho người Việt. Kết quả nghiên cứu vừa được công bố trên tạp chí khoa học uy tín hàng đầu thế giới Nature Communications trong bài báo "VN1K is a pangenome-informed multi-omics and phenomics resource for the Vietnamese population".
Từ nền tảng dữ liệu này, nhiều ứng dụng đã bước đầu được phát triển. Một trong số đó là VinGenChip - con chip sinh học giải mã gene đầu tiên được thiết kế dựa trên dữ liệu VN1K, triển khai tại GeneStory, công ty do Giáo sư Vũ Hà Văn, Tiến sĩ Võ Sỹ Nam đồng sáng lập cùng với một số thành viên khác với sự đầu tư chính từ tập đoàn Vingroup. VinGenChip có khả năng đọc đồng thời hàng chục nghìn biến thể gene, giúp định danh cá thể, xác định huyết thống, dự đoán nguy cơ bệnh, khả năng đáp ứng thuốc, hay nghiên cứu di truyền học.
“Đặc biệt, đây cũng là một trong những nền tảng công nghệ đang được ứng dụng trong Chiến dịch 500 ngày đêm tìm kiếm, quy tập và xác định danh tính hài cốt liệt sĩ mà Nhà nước đang triển khai, góp phần nâng cao hiệu quả đối sánh ADN giữa hài cốt liệt sĩ và thân nhân”, Tiến sĩ Nam cho biết.
Nếu xây dựng cơ sở dữ liệu hệ gene người Việt là công việc khoa học tiến hành trong nhiều năm, thì xây dựng Ngân hàng Gene thân nhân liệt sĩ trong chiến dịch 500 ngày đêm là bước chuyển hóa trực tiếp mô hình đó thành một hệ thống phục vụ nhiệm vụ quốc gia. Trong mô hình này, GeneStory là một trong những đơn vị trực tiếp tham gia cùng Nhà nước và Bộ Công an, từ công tác thu thập mẫu, xử lý dữ liệu ADN, phát triển công nghệ phân tích gene đến xây dựng các giải pháp phục vụ quá trình đối chiếu, xác định quan hệ huyết thống.
Theo Giáo sư Vũ Hà Văn, để triển khai được một chương trình có quy mô lớn như vậy, yếu tố quan trọng đầu tiên là phải xây dựng được một nguồn dữ liệu ADN đủ lớn và có tính đại diện.
Từ khi chiến dịch được phát động, cán bộ Công ty GeneStory đã có mặt tại nhiều địa điểm thu mẫu trên cả nước để đồng hành cùng cán bộ chiến sĩ trong lực lượng Công an cả nước. Có thời điểm, đội ngũ triển khai đồng thời tại khoảng 10-15 điểm thu mẫu, với mỗi tỉnh có từ 4-5 điểm đặt tại các huyện, xã để tạo thuận lợi cho thân nhân đến cung cấp mẫu ADN.
Chỉ trong hơn một tháng đầu triển khai, chương trình đã thu thập được gần 100.000 mẫu và thống kê rà soát được thông tin của hơn 300.000 thân nhân liệt sĩ. Từ dữ liệu này, các nhà khoa học đã xác định được danh tính hơn 30 liệt sĩ, trong tổng số chỉ khoảng hơn 100 mẫu hài cốt được đưa vào đối chiếu.
“Đây là một tỷ lệ rất cao so với trước đây. Trước kia, có những giai đoạn phải xét nghiệm hàng trăm mẫu hài cốt mới xác định được một vài trường hợp. Hiện nay, nhờ có dữ liệu gene thân nhân lớn hơn và công nghệ phân tích tốt hơn, tỷ lệ xác định đã tăng lên đáng kể”, Giáo sư Văn chia sẻ.
Thuật toán và dữ liệu gene người Việt mở lời giải cho bài toán xác định danh tính liệt sĩ
Theo Giáo sư Vũ Hà Văn, điểm khác biệt lớn nhất của chương trình là thay đổi hoàn toàn phương thức tìm kiếm so với cách làm truyền thống. Theo đó, các nhà khoa học xây dựng trước một ngân hàng gene định danh của thân nhân các liệt sĩ, sau đó dùng dữ liệu này để tìm kiếm và xác định danh tính các hài cốt chưa rõ thông tin.
“Xác định danh tính liệt sĩ bằng ADN theo chương trình Ngân hàng Gene là một bài toán khoa học đặc biệt phức tạp, bởi đây không chỉ là câu chuyện giải mã một mẫu ADN riêng lẻ mà là bài toán tìm kiếm trong một hệ thống dữ liệu quy mô rất lớn”, Giáo sư Văn chia sẻ thêm.
Khi có một mẫu hài cốt liệt sĩ chưa xác định được danh tính, các nhà khoa học phải thực hiện nhiều bước liên tiếp: từ tách chiết ADN trong mẫu hài cốt, giải mã thông tin ADN, sau đó so sánh với dữ liệu ADN của tất cả thân nhân trong ngân hàng gene để tìm kiếm mối quan hệ huyết thống. Thân nhân có thể là những người có quan hệ trực hệ như cha mẹ, con cái; hoặc trong nhiều trường hợp có thể là những người họ hàng xa hơn qua nhiều thế hệ.
Tuy nhiên, thách thức lớn nhất nằm ở quy mô của bài toán. Nếu ngân hàng gene được xây dựng cho khoảng 500.000 gia đình liệt sĩ chưa xác định được danh tính, trong đó mỗi gia đình có thể có nhiều thân nhân tham gia cung cấp mẫu ADN, thì câu hỏi đặt ra là làm thế nào để từ một mẫu hài cốt chưa rõ thông tin có thể tìm ra trong hàng trăm nghìn, thậm chí hàng triệu mẫu dữ liệu, đâu là trường hợp có khả năng quan hệ huyết thống phù hợp nhất.
Theo Tiến sĩ Võ Sỹ Nam, để giải quyết bài toán này, công nghệ giải mã thông tin ADN chỉ là một phần. Yếu tố quan trọng không kém là các thuật toán phân tích và xác định quan hệ huyết thống được xây dựng dựa trên đặc điểm di truyền của chính quần thể người Việt. Khi một mẫu ADN từ hài cốt được đưa vào hệ thống, thuật toán sẽ tiến hành so sánh đối chiếu với toàn bộ dữ liệu trong ngân hàng gene thân nhân, đánh giá mức độ phù hợp giữa các mẫu và xếp hạng khả năng quan hệ huyết thống.
Cụ thể hơn, dự án này sử dụng một phương pháp mới là phân tích SNP (Single Nucleotide Polymorphism) - tức các điểm biến đổi đơn nucleotide trong bộ gene, để bổ sung vào các phương pháp truyền thống trong xác định danh tính hài cốt liệt sĩ.
Việc nhanh chóng xác định danh tính liệt sĩ thông qua xét nghiệm ADN thân nhân liệt sĩ là một chương trình rất đặc biệt. GeneStory, được thành lập từ nền tảng nghiên cứu của dự án 1.000 hệ gene người Việt, vinh dự được tham gia cùng chương trình. Đây vừa là một trách nhiệm rất lớn, vừa là niềm vui và niềm tự hào đối với tất cả các thành viên của công ty.
Giáo sư Vũ Hà Văn
Trước đây để định danh liệt sĩ các nhà khoa học thường phân tích ADN ty thể (mtDNA) - loại ADN được truyền theo dòng mẹ. Ưu điểm của mtDNA là có số lượng bản sao lớn trong tế bào và bền vững hơn ADN nhân qua thời gian, do đó có thể hữu ích trong những trường hợp mẫu hài cốt bị phân hủy nhiều. Tuy nhiên, hạn chế của phương pháp này là khả năng phân giải chưa cao, bởi nhiều người có cùng dòng mẹ có thể mang những đặc điểm mtDNA tương tự nhau.
Trong khi đó, công nghệ SNP có khả năng phân tích nhiều điểm biến đổi trong toàn bộ hệ gene, giúp tăng độ chính xác khi xác định quan hệ huyết thống. Tuy nhiên, thách thức lớn nhất của phương pháp này là việc phân tích dữ liệu từ mẫu hài cốt lâu năm, bởi ADN trong những mẫu này thường đã bị phân hủy, mất đi một phần thông tin di truyền.
Ở Việt Nam, phần lớn các hài cốt liệt sĩ đã được chôn cất cách đây 50-60 năm. Trong điều kiện chiến tranh, việc mai táng khi đó còn nhiều hạn chế. Cùng với khí hậu nóng ẩm của Việt Nam, ADN trong hài cốt thường bị phân hủy rất nhiều theo thời gian.
Do đó, theo Tiến sĩ Nam, không phải mẫu hài cốt nào cũng còn đủ điều kiện để tách chiết ADN và thực hiện xét nghiệm. Ngay cả với những mẫu có thể phân tích, tỷ lệ thành công và độ chính xác cũng phụ thuộc rất lớn vào công nghệ, quy trình xử lý mẫu và phương pháp phân tích.
Trong bối cảnh đó, dữ liệu hệ gene quần thể người Việt đóng vai trò như một bộ tham chiếu quan trọng. Khi đã biết được tần suất xuất hiện của các biến thể SNP trong quần thể người Việt từ cơ sở dữ liệu của hàng nghìn, hàng chục nghìn hệ gene, hệ thống có thể sử dụng những phần dữ liệu còn lại trong mẫu hài cốt để tính toán xác suất quan hệ huyết thống, ngay cả khi mẫu ADN không còn nguyên vẹn.
“Dữ liệu gene quần thể giúp mở rộng khả năng phân tích trong những trường hợp khó nhất - khi mẫu hài cốt đã bị ảnh hưởng nghiêm trọng bởi thời gian và điều kiện môi trường”, Tiến sĩ Nam phân tích.
Giá trị lớn nhất của phương pháp này nằm ở khả năng tìm kiếm “bất kỳ”. Khi ngân hàng gene đủ lớn và các thuật toán đủ mạnh, dữ liệu ADN từ một mẫu hài cốt bất kỳ có thể được đưa vào hệ thống, so sánh với hàng trăm nghìn, thậm chí hàng triệu dữ liệu ADN của thân nhân, từ đó tìm kiếm mối liên hệ huyết thống nếu tồn tại.
Đó chính là sự thay đổi căn bản trong cách tiếp cận bài toán xác định danh tính liệt sĩ. Và cũng là minh chứng rõ ràng cho giá trị lâu dài của việc xây dựng nền tảng dữ liệu hệ gene người Việt.
Làm chủ công nghệ gene Việt phục vụ Ngân hàng Gene thân nhân liệt sĩ
Đóng góp trực tiếp của dự án 1.000 hệ gene người Việt vào chương trình xác định danh tính liệt sĩ thể hiện ở nhiều khía cạnh, từ cơ sở vật chất, năng lực xét nghiệm đến các công nghệ phân tích dữ liệu gene phù hợp với người Việt. Một trong những yêu cầu quan trọng nhất của bài toán này là phải có hệ thống phòng thí nghiệm đủ năng lực để xử lý số lượng mẫu rất lớn.
Trong quá trình triển khai dự án VN1K và các nghiên cứu tiếp theo, GeneStory đã xây dựng một phòng thí nghiệm đạt chuẩn về công nghệ gene. GeneStory hiện là đơn vị có phòng thí nghiệm được cả Bộ Y tế, Bộ Quốc phòng và Bộ Công an công nhận đủ điều kiện tham gia công tác xây dựng ngân hàng Gene thân nhân nhằm xác định danh tính liệt sĩ.
Để được công nhận, phòng thí nghiệm phải đáp ứng nhiều yêu cầu nghiêm ngặt về hệ thống quản lý chất lượng, trang thiết bị, quy trình chuyên môn, bảo mật dữ liệu và các tiêu chuẩn kỹ thuật liên quan.
“Việt Nam hiện vẫn còn hàng trăm nghìn liệt sĩ chưa xác định được danh tính. Nếu tính cả mẫu của thân nhân và mẫu hài cốt thì tổng số xét nghiệm cần thực hiện có thể lên tới hàng triệu mẫu. Vì vậy, bắt buộc phải có một hệ thống phòng thí nghiệm đủ lớn, đủ chuẩn và vận hành bài bản”, Giáo sư Văn chia sẻ.
Bên cạnh năng lực phòng thí nghiệm, GeneStory cũng đang phát triển các công nghệ phân tích gene dựa trên dữ liệu người Việt để phục vụ quá trình đối chiếu ADN giữa hài cốt và thân nhân.
VinGenChip là con chip sinh học giải mã gene đầu tiên được thiết kế dựa trên dữ liệu hệ gene người Việt. Với khả năng đọc đồng thời số lượng lớn biến thể di truyền có giá trị định danh, công nghệ này góp phần nâng cao độ chính xác trong đối sánh dữ liệu giữa mẫu ADN thân nhân và hài cốt, đồng thời giảm đáng kể chi phí so với nhiều giải pháp nhập khẩu.
Theo Giáo sư Vũ Hà Văn, việc phát triển công nghệ dựa trên dữ liệu của chính người Việt giúp nâng cao độ phù hợp khi ứng dụng thực tế.
“Thí dụ, khi người Mỹ tìm kiếm danh tính quân nhân, họ sử dụng các loại chip được thiết kế dựa trên dữ liệu của người Mỹ, vì vậy độ chính xác rất cao đối với người Mỹ. Nếu chúng ta sử dụng chính các loại chip đó cho người Việt thì chi phí cao hơn, có thể gấp 3-4 lần so với công nghệ chúng tôi đang phát triển. Đồng thời, độ chính xác chưa chắc đã tốt bằng vì dữ liệu nền của người Việt có những điểm khác biệt”, ông phân tích.
Nếu hoàn thiện, công nghệ này được kỳ vọng giúp giảm đáng kể chi phí xét nghiệm so với giải pháp nhập khẩu, đồng thời duy trì độ chính xác tương đương, thậm chí cao hơn trong một số trường hợp.
Việc ứng dụng VinGenChip trên nền tảng dữ liệu hệ gene người Việt được kỳ vọng sẽ góp phần nâng cao hiệu quả xác định danh tính hài cốt liệt sĩ còn thiếu thông tin, phục vụ một nhiệm vụ có ý nghĩa đặc biệt về lịch sử, chính trị và nhân văn. Đây cũng là minh chứng cho khả năng chuyển hóa kết quả nghiên cứu khoa học thành các công nghệ phục vụ những nhu cầu thực tiễn của đất nước.
Tiến sĩ Võ Sỹ Nam
Theo Tiến sĩ Võ Sỹ Nam - người lãnh đạo quá trình thiết kế VinGenChip, hiện nay các nhà khoa học đã xây dựng được những thuật toán khá chính xác nhằm xác định huyết thống dựa trên xác suất xuất hiện của các biến thể gene trong từng cộng đồng.
Một biến thể gene có thể phổ biến ở quần thể này nhưng hiếm gặp ở quần thể khác. Vì vậy, việc sử dụng dữ liệu gene của người Việt trong thiết kế của VinGenChip giúp các thuật toán đánh giá chính xác hơn khi so sánh ADN giữa hài cốt và thân nhân.
“Khi dữ liệu ADN từ một mẫu hài cốt được đưa vào hệ thống, thuật toán có thể so sánh với hàng trăm nghìn mẫu thân nhân, đánh giá mức độ phù hợp và xếp hạng khả năng quan hệ huyết thống trên cơ sở các SNP đã được thiết kế trong VinGenChip. Một trường hợp có thể đạt mức độ phù hợp rất cao, trong khi những trường hợp khác có mức độ tương đồng thấp hơn. Dựa trên các tính toán xác suất, hệ thống có thể xác định đâu là trường hợp có khả năng là thân nhân thực sự. Chính dữ liệu gene người Việt được xây dựng từ nhiều năm trước đã tạo ra nền tảng quan trọng cho bài toán này”, Tiến sĩ Nam chia sẻ.
Cuộc chạy đua với thời gian để trả lại tên cho các liệt sĩ
Trong chiến dịch 500 ngày đêm xây dựng Ngân hàng Gene thân nhân liệt sĩ, nhiệm vụ quan trọng đầu tiên là thu thập mẫu ADN của thân nhân. Đây là công việc cần triển khai thần tốc vì nhiều thân nhân liệt sĩ, đặc biệt là những người thuộc thế hệ cha mẹ, hiện đã tuổi cao.
“Chúng tôi đã thấy có những trường hợp người mẹ đã ngoài 90 tuổi; thậm chí có trường hợp tháng trước chúng tôi vừa lấy mẫu, sang tháng sau người đó đã qua đời”, Giáo sư Văn xúc động nói.
Chương trình xây dựng Ngân hàng Gene thân nhân liệt sĩ đang hướng tới việc thu thập dữ liệu ADN của thân nhân thuộc khoảng 500.000 gia đình liệt sĩ chưa xác định được danh tính. Song song với đó, các mẫu hài cốt liệt sĩ chưa có thông tin cũng sẽ được xét nghiệm, giải mã ADN và đưa vào hệ thống đối chiếu. Từ đó, hệ thống có thể tìm ra những trường hợp có khả năng quan hệ huyết thống cao nhất, hỗ trợ quá trình xác định danh tính một cách khoa học và có hệ thống.
“GeneStory cùng với một số đơn vị chuyên môn khác như Viện Hàn lâm Khoa học và Công nghệ Việt Nam, Viện Pháp y Quân đội (Bộ Quốc phòng), Viện Pháp y Quốc gia (Bộ Y tế), Viện Khoa học Hình sự (Bộ Công an) và một số đơn vị liên quan đang được giao nghiên cứu, hoàn thiện các phương pháp xét nghiệm ADN từ hài cốt nhằm nâng cao tỷ lệ thành công, góp phần thực hiện hiệu quả nhiệm vụ xác định danh tính liệt sĩ”, Giáo sư Văn chia sẻ thêm.
Từ một công trình nghiên cứu cơ bản về di truyền học quần thể, dữ liệu hệ gene người Việt đang được chuyển hóa thành ngân hàng gene, thuật toán phân tích và các công nghệ phục vụ xác định danh tính liệt sĩ trên quy mô quốc gia. Điều đó cho thấy giá trị của khoa học không chỉ nằm ở những công bố quốc tế hay các sản phẩm công nghệ, mà còn ở khả năng giải quyết những bài toán lớn của đất nước. Những đầu tư bền bỉ cho nghiên cứu nền tảng hôm nay có thể tạo nên những giá trị nhân văn sâu sắc trong nhiều năm sau, góp phần khép lại hành trình chờ đợi của hàng trăm nghìn gia đình và nối lại những ký ức còn dang dở của lịch sử.
Dự án xây dựng hệ gene người Việt được khởi xướng từ năm 2018 tại Viện Nghiên cứu Dữ liệu lớn (nay thuộc Trường đại học VinUni), với mục tiêu xây dựng nguồn dữ liệu hệ gene quy mô lớn dành riêng cho người Việt và thúc đẩy các ứng dụng của di truyền học trong chăm sóc sức khỏe cũng như các lĩnh vực phục vụ cộng đồng.