Các công cụ kỹ thuật số mang đến nhiều cơ hội hơn cho khoa học cộng tác giải quyết các thách thức toàn cầu – nhưng thường thì dữ liệu có giá trị cần thiết để thông báo rằng công việc vẫn nằm ngoài tầm với của các nhà nghiên cứu.
Dữ liệu có thể bị chôn vùi trong một bộ sưu tập không thể tìm kiếm, được mã hóa bằng thuật ngữ đặc biệt hoặc theo cách không dễ dàng sử dụng với dữ liệu khác - hoặc không dễ sử dụng vì các nhà khoa học không thể xác minh thông tin chi tiết về dữ liệu, như nguồn gốc hoặc các điều khoản sử dụng.
“Đây là một vấn đề thực sự đã tồn tại từ lâu đời như chính khoa học vậy,” giải thích Simon Hodson, giám đốc điều hành của Ủy ban Dữ liệu (CODATA) của Hội đồng Khoa học Quốc tế (ISC), hoạt động nhằm cải thiện tính khả dụng và khả năng sử dụng dữ liệu.
Những vấn đề dữ liệu này có thể hạn chế các cơ hội nghiên cứu và lãng phí thời gian và tiền bạc. Theo nghiên cứu được Ủy ban Châu Âu công bố vào năm 2018, việc dọn dẹp dữ liệu kém chất lượng để có thể sử dụng được là nhiệm vụ tốn nhiều thời gian nhất đối với một dự án phân tích dữ liệu trung bình và có thể chiếm tới 80% tổng công sức.
Thế giới thần tiên dự án, một sự hợp tác giữa CODATA và Hội đồng Khoa học Quốc tế (ISC), đã giải quyết vấn đề này. Dự án nhằm mục đích "làm cho dữ liệu hoạt động" bằng cách khuyến khích việc áp dụng CÔNG BẰNG Nguyên tắc dữ liệu (có thể tìm thấy, có thể truy cập, có thể tương tác, có thể tái sử dụng), thúc đẩy quản lý dữ liệu và nghiên cứu tốt hơn được hỗ trợ bởi phân tích hỗ trợ máy.
Với dự án kết thúc, CODATA đặt mục tiêu tiếp tục và mở rộng sáng kiến với WorldFAIR+, bao gồm các đối tác mới và các nghiên cứu điển hình quốc tế đưa những bài học kinh nghiệm rút ra trong dự án WorldFAIR kéo dài hai năm vào thực tế.
Giai đoạn mới sẽ được cấu trúc như một "liên bang" các dự án, cung cấp một khuôn khổ cho sự hợp tác, nơi các nhà khoa học có thể chia sẻ chuyên môn kỹ thuật và xây dựng dựa trên công trình của nhau. CODATA đang mời các đối tác tiềm năng đề xuất các nghiên cứu điển hình và tham gia.
Công việc ban đầu của CODATA cung cấp cơ sở cho WorldFAIR bắt đầu vào năm 2017, với sự hỗ trợ từ ISC và nguồn tài trợ từ Hiệp hội Khoa học và Công nghệ Trung Quốc. Công việc hình thành đó bao gồm các hội thảo dẫn đến việc phát triển ba nghiên cứu tình huống, mỗi nghiên cứu tập trung vào việc sử dụng dữ liệu trong một lĩnh vực cụ thể: bệnh truyền nhiễm, quy hoạch đô thị và giảm thiểu rủi ro thiên tai. Trong giai đoạn đầu của dự án, CODATA cũng đã phát triển quan hệ đối tác quan trọng với Sáng kiến Tài liệu Dữ liệu (IDD).
Dựa trên những nỗ lực này, CODATA đã bảo đảm tài trợ từ Ủy ban châu Âu cho WorldFAIR. Dự án hỗ trợ 11 nghiên cứu điển hình kiểm tra việc sử dụng dữ liệu trong nhiều lĩnh vực khác nhau – bao gồm di sản văn hóa, vật liệu nano và khoa học đại dương. Các nghiên cứu điển hình trải dài trên 13 quốc gia, bao gồm Brazil, Kenya, New Zealand và Hoa Kỳ
Những bài học kinh nghiệm từ dự án đã hình thành cơ sở cho 11 kiến nghị Chính sách để cải thiện việc sử dụng và tính khả dụng của dữ liệu cho khoa học và dẫn đến sự phát triển của Khung khả năng tương tác giữa các miền (CDIF), nhằm mục đích làm cho dữ liệu từ các lĩnh vực khoa học khác nhau có thể tương tác với nhau hơn.
Đồng thời, CODATA đã công bố mới Thuật ngữ quản lý dữ liệu nghiên cứu, cung cấp các định nghĩa rõ ràng về các thuật ngữ được sử dụng trong lĩnh vực này; các thuật ngữ đó hiện đã được xuất bản dưới dạng máy có thể đọc được “Từ vựng FAIR”, và sẽ sớm được cung cấp trực tuyến ở định dạng dễ đọc hơn.
Mỗi một trong 11 nghiên cứu điển hình cũng tạo ra riêng của họ báo cáo và hướng dẫn để sử dụng dữ liệu, nhằm đưa ra các khuyến nghị có liên quan đến nhiều lĩnh vực khoa học khác nhau.
Một trong những nghiên cứu điển hình được xem xét đa dạng sinh học nông nghiệp, tập trung vào quá trình thụ phấn – một lĩnh vực mà mô hình mô tả và phân loại dữ liệu vẫn đang được xác định. Dựa trên dữ liệu và thông tin đầu vào từ các đồng nghiệp trên khắp thế giới, các nhà nghiên cứu từ nửa tá quốc gia – Brazil, Kenya, Argentina, Hoa Kỳ, Vương quốc Anh và Hà Lan – đã phát triển một hướng dẫn toàn diện và bộ công cụ để biết dữ liệu liên quan đến cách thức tương tác giữa thực vật và loài thụ phấn.
Đây là một chủ đề cực kỳ cụ thể nhưng lại có liên quan đến hầu hết mọi nơi, với các nhà khoa học trong nhiều lĩnh vực khác nhau - những người hiện có thể hưởng lợi từ cách tiếp cận dữ liệu thống nhất, chuẩn mực, giúp dễ dàng tiếp thu công trình của đồng nghiệp và đẩy nhanh quá trình nghiên cứu của riêng họ.
“Chuyển từ các phương pháp tiếp cận đa dạng và các sáng kiến riêng lẻ sang dữ liệu tương tác thụ phấn thực vật FAIR có sẵn rộng rãi cho các nhà khoa học và người ra quyết định sẽ cho phép phát triển các nghiên cứu tích hợp giúp tăng cường hiểu biết của chúng ta về sinh học loài, hành vi, sinh thái, vật lý học và tiến hóa”, viết các nhà nghiên cứu đã làm việc trên nghiên cứu trường hợp.
Trong một nghiên cứu trường hợp khác, các nhà nghiên cứu đã xem xét giảm rủi ro thiên tai. Họ viết rằng: “Do biến đổi khí hậu và gia tăng dân số có thể làm tăng cả mức độ nghiêm trọng và tần suất của thảm họa, nhu cầu về dữ liệu đáng tin cậy để đưa ra phản ứng của chúng ta trở nên cấp thiết hơn bao giờ hết”.
Các nhà khoa học và các cơ quan quốc gia và quốc tế làm việc về rủi ro thiên tai nhìn lại quá khứ để ước tính tác động của các sự kiện có thể xảy ra trong tương lai và hiểu cách giảm thiểu và phục hồi sau đó. Họ cũng sử dụng dữ liệu liên tục được tạo ra bởi các cảm biến trên trái đất và trên vệ tinh, do các nguồn công cộng và tư nhân quản lý.
Nhưng trong nghiên cứu tình huống, các nhà nghiên cứu thấy khó có được loại thông tin cần thiết để đưa ra đánh giá chính xác, vì phần lớn dữ liệu có liên quan không phù hợp với các nguyên tắc dữ liệu FAIR. Thông tin quan trọng thường bị thiếu – như số người bị thương trong thảm họa hoặc sự kiện diễn ra nhanh như thế nào. Trong các trường hợp khác, các cơ quan quốc gia sử dụng phương pháp riêng của họ để tính toán các điểm dữ liệu quan trọng mà không hiển thị công việc của họ, khiến những người khác khó so sánh.
Dựa trên nghiên cứu sâu rộng của mình, nhóm nghiên cứu trường hợp đã đưa ra một loạt khuyến nghị về các hoạt động giúp đưa ra các quyết định chính sách dựa trên bằng chứng dễ dàng hơn trong lĩnh vực ngày càng cấp bách này - "một bước cơ bản hướng tới việc xây dựng các cộng đồng và quốc gia an toàn hơn, kiên cường hơn", họ viết.
Các nhà nghiên cứu của Liên minh quốc tế về hóa học thuần túy và ứng dụng (IUPAC) đã thực hiện một nghiên cứu điển hình nhằm tìm hiểu cách thức dữ liệu và thuật ngữ liên quan đến hóa chất có thể được sử dụng dễ dàng hơn cho cả con người và máy móc.
IUPAC có hơn một thế kỷ kinh nghiệm triệu tập các nhà hóa học để xác định và chuẩn hóa cách các nhà khoa học trong lĩnh vực này làm việc và thảo luận về hóa chất. Nhưng khi các công cụ kỹ thuật số - và ngày càng nhiều AI và công nghệ liên quan - cung cấp những cách thức làm việc mới, nghiên cứu trường hợp IUPAC đã xem xét cách các tiêu chuẩn đó có thể hiệu quả hơn và giúp các nhà khoa học khác dễ dàng sử dụng lại dữ liệu hóa học hơn.
Một trong những sản phẩm của nghiên cứu điển hình là “sách dạy nấu ăn”, một nguồn tài nguyên hướng dẫn mở giúp các nhà khoa học – bao gồm sinh viên, giáo viên và chuyên gia đang đi làm – hiểu cách làm việc với dữ liệu hóa học và cách làm cho dữ liệu của họ dễ tiếp cận hơn với người khác.
Dự án cũng mô tả một giao thức kỹ thuật số mở mới đầy tham vọng có thể kết nối nhiều cơ sở dữ liệu hóa học toàn cầu khác nhau lại với nhau, cho phép các nhà khoa học tìm và truy cập dữ liệu chỉ bằng một truy vấn - và tương tự, kiểm tra xem dữ liệu của họ có thể đọc được bằng máy hay không.
Hodson giải thích rằng việc tập hợp các nhà khoa học lại để thảo luận về dữ liệu họ tạo ra và cố gắng hiểu cách những người khác xử lý dữ liệu của họ là điều vô cùng bổ ích.
Và bằng cách đặt ra các tiêu chuẩn và định nghĩa rõ ràng, các nhà khoa học không chỉ hỗ trợ cho nghiên cứu hiện tại mà còn giúp các thế hệ sau dễ dàng hơn trong việc phát triển công trình của họ - có thể theo những cách mà các tác giả ban đầu có thể chưa bao giờ nghĩ đến, ông nói thêm.
Ông cho biết: “Một điều chúng tôi nhận thấy ở WorldFAIR chính là việc có những cuộc trò chuyện như thế này, tập hợp tất cả các nghiên cứu điển hình trong một phòng và để họ nói về dữ liệu của họ, về những gì họ làm, về cách thức hoạt động và cách họ mô tả dữ liệu - và trong một số trường hợp, xác định được những kết nối mà chúng tôi chưa hẳn đã hình dung trước”.
Hình ảnh của Taylor Vick on Unsplash.
Trách nhiệm công ty
Thông tin, ý kiến và khuyến nghị được trình bày trong blog của chúng tôi là của từng người đóng góp và không nhất thiết phản ánh các giá trị và niềm tin của Hội đồng Khoa học Quốc tế.