VƯỜN ƯƠM DỮ LIỆU: NƠI DỮ LIỆU ĐƯỢC NUÔI DƯỠNG, PHÁT TRIỂN

Trong nhiều năm, dữ liệu chủ yếu được nhìn nhận như một sản phẩm phát sinh trong quá trình quản lý nhà nước và hoạt động sản xuất, kinh doanh của doanh nghiệp. Mỗi bộ, ngành, địa phương xây dựng một hệ thống cơ sở dữ liệu riêng; mỗi doanh nghiệp hình thành một kho dữ liệu phục vụ nhu cầu nội bộ. Tuy nhiên, phần lớn các nguồn dữ liệu này vẫn tồn tại dưới dạng phân tán, thiếu tiêu chuẩn thống nhất, khó liên thông, chia sẻ và chưa được khai thác đúng với giá trị vốn có.  

 

Trong thực tiễn, dữ liệu thô hiếm khi có thể sử dụng ngay. Chúng tồn tại dưới nhiều định dạng khác nhau, chất lượng không đồng đều và khó tích hợp với các nguồn dữ liệu khác. Nếu đưa trực tiếp vào các hệ thống trí tuệ nhân tạo (AI) hoặc các nền tảng phân tích dữ liệu, kết quả đầu ra sẽ thiếu chính xác. Điều đó cũng lý giải nguyên tắc cốt lõi trong phát triển AI hiện nay: chất lượng của AI phụ thuộc trước hết vào chất lượng của dữ liệu.

Chính vì vậy, trước khi trở thành nguồn lực cho AI hay nền kinh tế dữ liệu, dữ liệu cần trải qua một quá trình ươm tạo có hệ thống. Đó là chuỗi công việc từ thu thập, làm sạch, chuẩn hóa, gắn nhãn, tích hợp đa nguồn, đánh giá chất lượng đến bảo đảm tính pháp lý, bảo vệ quyền riêng tư và thiết lập cơ chế chia sẻ, khai thác an toàn. Đây không chỉ là quá trình xử lý kỹ thuật mà còn là quá trình gia tăng giá trị, biến dữ liệu từ những thông tin rời rạc thành một nguồn tài nguyên có thể tái sử dụng, chia sẻ và tạo ra giá trị.

Theo cách tiếp cận đó, Vườn ươm dữ liệu chính là môi trường nơi dữ liệu được nuôi dưỡng, hoàn thiện và phát triển. Từ những tập dữ liệu phân tán, chưa đồng nhất, dữ liệu được chuyển hóa thành các tài sản dữ liệu có chất lượng cao, sẵn sàng phục vụ quản trị quốc gia, đổi mới sáng tạo, phát triển AI và hình thành các sản phẩm, dịch vụ số mới.

Ban Truyền thông (tổng hợp từ nghiên cứu của các chuyên gia)