Edge Computing xử lý dữ liệu như thế nào?
- Edge Computing là gì?
- Quy trình Edge Computing xử lý dữ liệu
- Vì sao xử lý gần thiết bị giúp giảm độ trễ?
- Edge Computing xử lý dữ liệu khác cloud như thế nào?
- Không phải mọi dữ liệu đều nên xử lý tại biên
- Edge Computing có tự động bảo mật dữ liệu tốt hơn không?
- Ví dụ về luồng xử lý dữ liệu tại biên
- Cách phân chia xử lý giữa thiết bị, edge và cloud
Thay vì gửi toàn bộ dữ liệu thô tới một trung tâm đám mây ở xa, hệ thống biên có thể lọc, chuẩn hóa, phân tích và phản hồi tại chỗ. Chỉ những dữ liệu cần lưu trữ lâu dài, tổng hợp hoặc phân tích chuyên sâu mới tiếp tục được chuyển lên đám mây.
Vì vậy, Edge Computing không nhất thiết thay thế cloud computing. Hai mô hình thường phối hợp với nhau: biên xử lý tác vụ cần phản hồi nhanh hoặc phụ thuộc vào dữ liệu cục bộ, còn đám mây đảm nhận lưu trữ quy mô lớn, quản trị tập trung và các phép phân tích cần nhiều tài nguyên.
Edge Computing là gì?
Edge Computing là một kiến trúc điện toán phân tán, trong đó quá trình xử lý được đặt tại hoặc gần “biên” của mạng — nơi thiết bị, người dùng và hệ thống vật lý tạo ra dữ liệu.
“Gần” ở đây không chỉ mang ý nghĩa khoảng cách địa lý. Nó còn thể hiện số chặng mạng, thời gian truyền dữ liệu và mức độ phụ thuộc vào đường kết nối tới trung tâm dữ liệu. Một máy chủ đặt trong nhà máy có thể được coi là tài nguyên biên vì nó xử lý dữ liệu ngay trong mạng nội bộ. Trong mạng di động, ứng dụng cũng có thể chạy trên hạ tầng Multi-access Edge Computing gần mạng truy cập.
NIST mô tả Edge Computing là cách thu thập và xử lý dữ liệu tại chỗ hoặc trong trung tâm dữ liệu biên gần đó nhằm cải thiện hiệu năng mạng. ETSI xác định môi trường Multi-access Edge Computing có khả năng cung cấp tài nguyên điện toán tại biên mạng, với đặc điểm nổi bật là độ trễ thấp, băng thông cao và khả năng tiếp cận thông tin mạng theo thời gian thực.
Một hệ thống Edge Computing thường có ba tầng:
· Thiết bị đầu cuối: Cảm biến, camera, robot, điện thoại, phương tiện hoặc máy móc tạo dữ liệu
· Nút biên: Gateway, máy tính công nghiệp, máy chủ tại chỗ hoặc hạ tầng biên của nhà mạng
· Đám mây hoặc trung tâm dữ liệu: Nơi lưu trữ dài hạn, quản lý tập trung và thực hiện các tác vụ quy mô lớn
Ranh giới giữa các tầng không cố định. Tùy năng lực phần cứng, yêu cầu phản hồi và chính sách dữ liệu, cùng một tác vụ có thể được xử lý trên thiết bị, tại máy chủ biên hoặc trên đám mây.

Quy trình Edge Computing xử lý dữ liệu
Quá trình xử lý tại biên thường diễn ra theo một chuỗi từ thu nhận dữ liệu đến phản hồi và đồng bộ.
Thu nhận dữ liệu từ nguồn
Dữ liệu được tạo ra bởi thiết bị ở hiện trường, chẳng hạn:
· Camera tạo luồng hình ảnh
· Cảm biến đo nhiệt độ hoặc độ rung
· Máy móc ghi nhận trạng thái vận hành
· Thiết bị đeo thu thập tín hiệu hoạt động
· Ứng dụng di động phát sinh vị trí và yêu cầu tương tác
Dữ liệu có thể đến liên tục dưới dạng luồng hoặc phát sinh theo từng sự kiện. Ở bước này, hệ thống thường gắn dấu thời gian, định danh thiết bị và thông tin ngữ cảnh để phục vụ xử lý sau đó.
Tiền xử lý tại thiết bị hoặc gateway
Không phải dữ liệu nào cũng cần được giữ nguyên và gửi đi. Thiết bị hoặc gateway có thể thực hiện các thao tác ban đầu như:
· Loại bỏ bản ghi lỗi hoặc trùng lặp
· Chuyển đổi dữ liệu về cùng định dạng
· Nén dữ liệu
· Lọc nhiễu
· Tổng hợp nhiều mẫu thành giá trị đại diện
· Ẩn hoặc loại bỏ trường dữ liệu nhạy cảm không cần thiết
Tiền xử lý làm giảm khối lượng dữ liệu mà các bước tiếp theo phải tiếp nhận. Chẳng hạn, một cảm biến đo hàng trăm lần mỗi giây có thể chỉ gửi giá trị trung bình, giá trị cực đại và các mẫu bất thường thay vì truyền toàn bộ bản ghi.
Phân tích trên nút biên
Sau khi được chuẩn hóa, dữ liệu được đưa vào luật xử lý, thuật toán phân tích hoặc mô hình học máy chạy tại biên.
Nút biên có thể:
· So sánh dữ liệu với ngưỡng vận hành
· Phát hiện sự kiện bất thường
· Phân loại hình ảnh hoặc âm thanh
· Kết hợp dữ liệu từ nhiều cảm biến
· Đánh giá trạng thái hiện tại của thiết bị
· Ước tính hành động cần thực hiện
Đây là điểm khác biệt cốt lõi của Edge Computing: dữ liệu có thể tạo ra kết quả hữu ích ngay gần nguồn phát sinh mà không phải chờ một hệ thống ở xa hoàn thành toàn bộ quá trình.
Ra quyết định và phản hồi cục bộ
Kết quả phân tích có thể kích hoạt hành động tại chỗ. Ví dụ, hệ thống có thể gửi cảnh báo, điều chỉnh một tham số vận hành hoặc chuyển ứng dụng sang chế độ an toàn.
Việc phản hồi cục bộ làm giảm phần thời gian dành cho truyền dữ liệu tới cloud và chờ kết quả quay trở lại. 3GPP cũng đưa Edge Computing vào kiến trúc 5G nhằm hỗ trợ thời gian phản hồi nhanh hơn và cho phép ứng dụng sử dụng năng lực tính toán gần người dùng.
Tuy nhiên, xử lý tại biên không bảo đảm một mức độ trễ cố định. Độ trễ thực tế còn phụ thuộc vào năng lực thiết bị, số chặng mạng, tải hệ thống, giao thức truyền, vị trí nút biên và thời gian chạy thuật toán.
Lưu trữ tạm thời và đồng bộ với cloud
Sau khi xử lý cục bộ, hệ thống quyết định dữ liệu nào cần được giữ lại hoặc gửi lên đám mây. Thông thường, cloud sẽ nhận:
· Kết quả đã tổng hợp
· Sự kiện bất thường
· Dữ liệu cần lưu trữ dài hạn
· Dữ liệu dùng để huấn luyện hoặc cập nhật mô hình
· Nhật ký phục vụ quản trị và kiểm toán
· Thông tin cần đối chiếu giữa nhiều địa điểm
Cách xử lý có chọn lọc này giúp hạn chế việc truyền toàn bộ dữ liệu thô qua mạng. Google Cloud mô tả mô hình biên lai ghép là cách xử lý một số dịch vụ gần nguồn dữ liệu và chỉ gửi dữ liệu được chọn lên cloud, qua đó có thể giảm nhu cầu về đường truyền, dung lượng xử lý và chi phí truyền dữ liệu.
Cloud cũng có thể gửi ngược cấu hình, chính sách, phiên bản phần mềm hoặc mô hình học máy mới xuống các nút biên. Vì vậy, luồng dữ liệu giữa edge và cloud thường là hai chiều.
Vì sao xử lý gần thiết bị giúp giảm độ trễ?
Trong mô hình xử lý tập trung, một yêu cầu thường phải đi qua các bước:
1. Thiết bị gửi dữ liệu vào mạng
2. Dữ liệu đi qua mạng truy cập và mạng lõi
3. Trung tâm dữ liệu tiếp nhận và xử lý
4. Kết quả quay trở lại thiết bị
Mỗi bước đều bổ sung thời gian chờ. Khoảng cách truyền dẫn, số thiết bị trung gian, tình trạng tắc nghẽn và thời gian xử lý tại máy chủ cùng tạo nên độ trễ tổng thể.
Edge Computing rút ngắn một phần đường đi này. Khi ứng dụng chạy trên gateway hoặc máy chủ gần mạng truy cập, dữ liệu không nhất thiết phải đi tới một khu vực cloud ở xa rồi quay lại. ETSI coi độ trễ thấp và tính gần người dùng là những đặc điểm chính của môi trường Multi-access Edge Computing.
Lợi ích rõ nhất xuất hiện ở các tác vụ có vòng phản hồi ngắn, chẳng hạn phát hiện lỗi thiết bị, phân tích video trực tiếp hoặc điều khiển một quy trình tại chỗ. Với các tác vụ không nhạy cảm về thời gian như lập báo cáo cuối tháng, việc chuyển xử lý ra biên có thể không tạo ra nhiều giá trị.
Edge Computing xử lý dữ liệu khác cloud như thế nào?
Khác biệt chính không nằm ở loại thuật toán mà nằm ở vị trí thực thi, phạm vi dữ liệu và cách phân phối tài nguyên.
|
Tiêu chí |
Edge Computing |
Cloud Computing |
|
Vị trí xử lý |
Gần thiết bị hoặc nguồn dữ liệu |
Trung tâm dữ liệu tập trung |
|
Phản hồi |
Phù hợp với tác vụ cần phản hồi nhanh |
Phụ thuộc đường truyền tới cloud |
|
Dữ liệu truyền qua mạng |
Có thể chỉ gửi dữ liệu đã lọc hoặc tổng hợp |
Thường tiếp nhận lượng dữ liệu lớn hơn |
|
Năng lực tính toán |
Bị giới hạn bởi phần cứng tại biên |
Có khả năng mở rộng tài nguyên lớn |
|
Quản trị |
Phân tán trên nhiều địa điểm |
Tập trung và đồng nhất hơn |
|
Kết nối gián đoạn |
Có thể tiếp tục một số chức năng cục bộ |
Dịch vụ phụ thuộc cloud có thể bị ảnh hưởng |
|
Phân tích liên địa điểm |
Hạn chế nếu chỉ nhìn dữ liệu cục bộ |
Thuận lợi cho tổng hợp dữ liệu toàn hệ thống |
Edge phù hợp với quyết định cục bộ và nhạy cảm với thời gian. Cloud phù hợp với việc tổng hợp dữ liệu, huấn luyện mô hình lớn, lưu trữ dài hạn và điều phối nhiều địa điểm.
Kiến trúc hiệu quả thường không chọn một trong hai. Nó phân chia khối lượng công việc: những bước cần tốc độ hoặc tính tự chủ được đặt ở biên, còn những bước cần năng lực lớn và tầm nhìn toàn hệ thống được chuyển lên cloud.
Không phải mọi dữ liệu đều nên xử lý tại biên
Đưa tác vụ ra biên tạo ra lợi ích nhưng cũng làm hệ thống phân tán hơn. Mỗi nút có thể khác nhau về phần cứng, phiên bản phần mềm, điều kiện mạng và năng lực bảo trì.
Một tác vụ phù hợp để xử lý tại biên khi có một hoặc nhiều điều kiện sau:
· Cần phản hồi nhanh tại hiện trường
· Dữ liệu thô có dung lượng rất lớn
· Kết nối tới cloud không liên tục
· Chỉ một phần nhỏ dữ liệu có giá trị lâu dài
· Dữ liệu cần được lọc hoặc giảm thiểu trước khi rời khỏi địa điểm
· Hành động phải tiếp tục ngay cả khi mất kết nối bên ngoài
Ngược lại, cloud thường phù hợp hơn khi tác vụ cần lượng tài nguyên tính toán lớn, phải kết hợp dữ liệu từ nhiều vùng hoặc cần quản lý tập trung nghiêm ngặt.
Phần cứng biên cũng có thể gặp lỗi thường xuyên hơn hạ tầng trung tâm và không phải địa điểm nào cũng có đội ngũ kỹ thuật tại chỗ. Vì vậy, ứng dụng biên cần được thiết kế để chịu được kết nối chập chờn, đồng bộ muộn và tình trạng một số nút tạm thời không hoạt động.
Edge Computing có tự động bảo mật dữ liệu tốt hơn không?
Xử lý cục bộ có thể giúp giảm lượng dữ liệu phải truyền khỏi nơi phát sinh. Chẳng hạn, hệ thống camera có thể gửi số lượng đối tượng đã phát hiện thay vì tải toàn bộ video lên cloud. Tuy nhiên, điều đó không đồng nghĩa Edge Computing mặc nhiên an toàn hơn.
Hệ thống biên mở rộng số lượng điểm cần bảo vệ. Các nút có thể được đặt tại cửa hàng, nhà máy, trạm viễn thông hoặc địa điểm khó kiểm soát vật lý. Mỗi nút cần được quản lý về:
· Xác thực thiết bị và dịch vụ
· Mã hóa dữ liệu khi lưu trữ và truyền tải
· Kiểm soát quyền truy cập
· Cập nhật phần mềm và bản vá
· Quản lý khóa và chứng chỉ
· Ghi nhật ký và phát hiện bất thường
· Xóa dữ liệu khi thiết bị ngừng sử dụng
Vì vậy, lợi ích về giảm truyền dữ liệu chỉ trở thành lợi ích bảo mật khi đi kèm kiến trúc bảo vệ phù hợp. Việc lưu dữ liệu cục bộ thiếu kiểm soát hoặc để nút biên chạy phần mềm lỗi thời có thể tạo thêm rủi ro.
Ví dụ về luồng xử lý dữ liệu tại biên
Xét một hệ thống giám sát độ rung của máy công nghiệp:
1. Cảm biến liên tục tạo mẫu độ rung
2. Gateway loại bỏ dữ liệu lỗi và tính các đặc trưng cần thiết
3. Mô hình tại biên so sánh tín hiệu hiện tại với trạng thái vận hành bình thường
4. Khi phát hiện bất thường, hệ thống cảnh báo cho bộ phận vận hành
5. Một đoạn dữ liệu liên quan đến sự kiện được lưu lại
6. Kết quả, nhật ký và mẫu bất thường được đồng bộ lên cloud
7. Cloud tổng hợp dữ liệu từ nhiều máy để phân tích xu hướng và cải thiện mô hình
8. Phiên bản mô hình mới được phân phối trở lại các gateway
Trong luồng này, edge chịu trách nhiệm phát hiện và phản hồi nhanh. Cloud cung cấp khả năng quan sát toàn hệ thống và cải tiến dài hạn. Nếu mất kết nối internet, gateway vẫn có thể tiếp tục phân tích tại chỗ, nhưng dữ liệu tổng hợp chỉ được đồng bộ sau khi kết nối phục hồi.
Cách phân chia xử lý giữa thiết bị, edge và cloud
Việc chọn vị trí xử lý nên dựa trên yêu cầu của từng bước thay vì chuyển toàn bộ ứng dụng ra biên.
Xử lý ngay trên thiết bị
Phù hợp với thao tác đơn giản, cần phản hồi tức thời hoặc phải hoạt động độc lập. Đổi lại, thiết bị thường có giới hạn về bộ xử lý, bộ nhớ và năng lượng.
Xử lý tại gateway hoặc máy chủ biên
Phù hợp khi cần kết hợp dữ liệu từ nhiều thiết bị hoặc chạy thuật toán vượt quá năng lực của từng thiết bị. Đây cũng là vị trí thuận lợi để chuẩn hóa giao thức và kiểm soát dữ liệu trước khi gửi ra ngoài.
Xử lý trên cloud
Phù hợp với phân tích lịch sử, tổng hợp nhiều địa điểm, lưu trữ quy mô lớn, huấn luyện mô hình và quản trị tập trung.
Một thiết kế hợp lý cần cân bằng ít nhất bốn yếu tố: thời gian phản hồi, lượng dữ liệu truyền, tài nguyên tính toán và khả năng vận hành hệ thống phân tán. Đặt quá nhiều tác vụ ở cloud có thể làm tăng phụ thuộc vào kết nối; đặt quá nhiều ở edge lại làm tăng chi phí phần cứng và độ phức tạp quản trị.
Edge Computing xử lý dữ liệu bằng cách đưa một phần chu trình thu thập, lọc, phân tích và ra quyết định đến gần thiết bị tạo dữ liệu. Cơ chế này rút ngắn đường truyền của các tác vụ cần phản hồi nhanh, giảm lượng dữ liệu thô gửi lên cloud và cho phép một số chức năng tiếp tục hoạt động khi kết nối bên ngoài không ổn định.
Giá trị của Edge Computing không đến từ việc chuyển mọi hoạt động ra khỏi cloud. Giá trị nằm ở cách phân chia đúng tác vụ: edge giải quyết những gì cần tính cục bộ, nhanh và có chọn lọc; cloud đảm nhận lưu trữ, quản trị và phân tích ở quy mô lớn.
Hỏi đáp về Edge Computing
Edge Computing có phải là một thiết bị cụ thể không?
Không. Đây là một mô hình kiến trúc. Tài nguyên biên có thể là chính thiết bị đầu cuối, gateway, máy tính công nghiệp, máy chủ tại cơ sở hoặc hạ tầng biên của nhà mạng.
Edge Computing có cần kết nối internet không?
Không phải mọi chức năng đều cần internet liên tục. Một hệ thống có thể xử lý và phản hồi cục bộ khi mất kết nối, sau đó đồng bộ dữ liệu khi mạng phục hồi. Tuy nhiên, các chức năng phụ thuộc cloud vẫn cần kết nối.
Edge Computing có thay thế cloud computing không?
Thông thường là không. Edge và cloud đảm nhận các phần khác nhau của chu trình dữ liệu và thường được triển khai cùng nhau.
Dữ liệu nào nên được gửi lên cloud?
Các nhóm phổ biến gồm dữ liệu cần lưu trữ lâu dài, kết quả tổng hợp, sự kiện bất thường, nhật ký quản trị và dữ liệu phục vụ phân tích trên nhiều thiết bị hoặc địa điểm.
Edge Computing luôn có độ trễ thấp hơn cloud không?
Không phải trong mọi trường hợp. Lợi thế phụ thuộc vào vị trí nút biên, hiệu năng phần cứng, tải xử lý, cấu trúc mạng và thuật toán. Một nút biên quá tải vẫn có thể phản hồi chậm hơn một dịch vụ cloud được kết nối tốt.
