Các mô hình AI chỉ có thể tạo ra kết quả đáng tin cậy khi được huấn luyện trên những bộ dữ liệu sạch, đầy đủ, có cấu trúc và được chuẩn hóa. Ngược lại, dữ liệu phân mảnh, thiếu chuẩn hoặc sai lệch sẽ làm giảm đáng kể hiệu quả của AI, thậm chí tạo ra các kết quả thiếu chính xác.
Các vườn ươm dữ liệu không chỉ là nơi lưu chuyển dữ liệu mà còn là nhà máy xử lý và nâng cao chất lượng dữ liệu trước khi đưa vào phục vụ nghiên cứu, huấn luyện mô hình AI và phát triển các ứng dụng thông minh.
Bài học nổi bật từ các mô hình quốc tế là không quốc gia nào phát triển vườn ươm dữ liệu chỉ bằng nỗ lực của Nhà nước hoặc doanh nghiệp riêng lẻ. Singapore xây dựng hệ sinh thái dữ liệu dựa trên sự phối hợp giữa khu vực công, doanh nghiệp công nghệ, các viện nghiên cứu và trường đại học.
Trong khi đó, Liên minh châu Âu thúc đẩy các không gian dữ liệu chung, nơi dữ liệu được chia sẻ theo các chuẩn thống nhất giữa nhiều ngành, nhiều quốc gia và nhiều chủ thể khác nhau. Hoa Kỳ thì phát huy vai trò dẫn dắt của khu vực tư nhân trong đổi mới sáng tạo, với sự tham gia mạnh mẽ của các doanh nghiệp công nghệ, quỹ đầu tư và các trung tâm nghiên cứu.
Nhìn từ kinh nghiệm quốc tế có thể thấy, dù triển khai theo cách thức nào thì các mô hình này cũng đều dựa trên một nguyên tắc chung, đó là dữ liệu chỉ phát huy giá trị khi được kết nối trong một hệ sinh thái mở, có sự tham gia của nhiều chủ thể.
Trong đó, cơ quan nhà nước đóng vai trò kiến tạo thể chế và cung cấp dữ liệu công; doanh nghiệp đóng góp dữ liệu sản xuất, kinh doanh và nhu cầu thị trường; các trường đại học, viện nghiên cứu phát triển công nghệ; còn các quỹ đầu tư hỗ trợ thương mại hóa các sản phẩm dữ liệu. Chính sự kết nối này giúp dữ liệu được lưu thông, bổ sung giá trị lẫn nhau và hình thành các mô hình kinh doanh mới.
Ban Truyền thông (tổng hợp từ nghiên cứu của các chuyên gia)
