Microsoft và Nvidia muốn biến laptop thành “máy chủ AI cá nhân”

HÙNG NGUYỄN

VHO - Microsoft và Nvidia đang đưa AI từ trung tâm dữ liệu về PC, với laptop có thể chạy model hơn 120 tỷ tham số ngay trong máy và chỉ dùng cloud khi cần.

Trong nhiều năm, phần lớn trải nghiệm AI tạo sinh phụ thuộc vào những trung tâm dữ liệu khổng lồ.

Người dùng nhập yêu cầu trên laptop nhưng phần việc nặng được xử lý ở máy chủ từ xa.

Microsoft và Nvidia đang muốn thay đổi mô hình đó bằng một thế hệ Windows PC đủ mạnh để AI có thể chạy ngay trên thiết bị.

Microsoft và Nvidia muốn biến laptop thành “máy chủ AI cá nhân” - ảnh 1
Hình minh họa.

Khi laptop không chỉ gửi câu hỏi lên cloud

Microsoft và Nvidia vừa trình bày một bước tiến mới trong chiến lược AI trên máy tính cá nhân, với trọng tâm là đưa nhiều tác vụ trí tuệ nhân tạo từ đám mây về chạy trực tiếp trên Windows PC.

Tại sự kiện ở San Francisco ngày 7/10, lãnh đạo hai công ty mô tả Windows trong tương lai theo mô hình “hybrid intelligence” - trí tuệ lai giữa thiết bị và đám mây.

Điều này khác với cách nhiều người đang sử dụng chatbot hiện nay.

Khi một người đặt câu hỏi cho AI qua trình duyệt, yêu cầu thường được gửi qua Internet tới trung tâm dữ liệu. GPU ở đó thực hiện suy luận rồi kết quả mới được chuyển trở lại màn hình.

Với AI cục bộ, một phần hoặc toàn bộ quá trình đó có thể diễn ra ngay trong chiếc laptop.

Ví dụ, người dùng muốn AI tìm kiếm trong hàng nghìn tài liệu nội bộ, phân tích một bộ mã nguồn, chuyển giọng nói thành văn bản hoặc tạo hình ảnh có thể thực hiện công việc bằng phần cứng trong máy mà không nhất thiết gửi toàn bộ dữ liệu ra bên ngoài.

Microsoft không cho rằng cloud sẽ biến mất.

Hướng phát triển mới là để Windows quyết định công việc nào phù hợp với thiết bị và công việc nào cần sức mạnh từ trung tâm dữ liệu.

Một nhiệm vụ nhỏ, đòi hỏi phản hồi nhanh hoặc liên quan tới dữ liệu nhạy cảm có thể được xử lý cục bộ. Khi yêu cầu quá lớn đối với phần cứng máy tính, hệ thống có thể chuyển sang model trên cloud.

Đây là lý do Microsoft gọi mô hình này là hybrid intelligence.

GitHub Copilot cũng đang được phát triển theo hướng tương tự. Trong tương lai, công cụ có thể xác định một nhiệm vụ lập trình nên được giao cho model chạy trên PC hay chuyển tới model mạnh hơn trên cloud, dựa trên yêu cầu về hiệu năng, chi phí và độ trễ.

Lợi ích dễ thấy đầu tiên là quyền riêng tư.

Nếu một doanh nghiệp muốn AI phân tích hợp đồng, tài liệu kỹ thuật hoặc mã nguồn nội bộ, việc có thể chạy model ngay trên thiết bị giúp giảm lượng dữ liệu cần gửi tới máy chủ bên ngoài.

Đây không đồng nghĩa AI cục bộ mặc nhiên an toàn tuyệt đối. Máy tính vẫn cần được bảo vệ khỏi mã độc, tài khoản bị xâm nhập hoặc ứng dụng có quyền truy cập quá rộng.

Nhưng về kiến trúc, dữ liệu không phải rời khỏi thiết bị cho mọi tác vụ sẽ mở ra thêm lựa chọn đối với những tổ chức có yêu cầu nghiêm ngặt về dữ liệu.

Lợi ích thứ hai là độ trễ.

Một model chạy trong máy không phải chờ đường truyền Internet cho từng vòng xử lý. Với những công việc cần AI thực hiện liên tục nhiều bước, thời gian chờ mạng có thể được giảm đáng kể.

Người dùng cũng có khả năng tiếp tục sử dụng một số chức năng AI ngay cả khi mất kết nối mạng, tùy thuộc ứng dụng và model đã được cài đặt.

Lợi ích thứ ba liên quan tới chi phí.

Với doanh nghiệp hoặc lập trình viên sử dụng AI ở quy mô lớn, mỗi lần gọi model cloud đều có thể phát sinh chi phí tính toán. Chạy những tác vụ phù hợp trên phần cứng đã mua giúp giảm số lần phải trả tiền cho tài nguyên cloud.

Nvidia mô tả thế hệ PC mới như một cách đưa phần mềm AI vốn được phát triển cho máy chủ xuống máy tính cá nhân.

RTX Spark hỗ trợ CUDA, hệ sinh thái phần mềm mà nhiều ứng dụng AI và GPU chuyên dụng đã sử dụng. Điều này giúp nhà phát triển dễ đưa model từ môi trường máy chủ xuống PC hơn thay vì phải viết lại toàn bộ quy trình.

Surface Laptop Ultra cho thấy laptop AI có thể mạnh đến đâu

Thiết bị nổi bật nhất trong chiến lược mới là Surface Laptop Ultra.

Microsoft gọi đây là chiếc Surface Laptop mạnh nhất hãng từng sản xuất, được thiết kế từ đầu quanh nền tảng Nvidia RTX Spark.

Chip này kết hợp GPU dựa trên kiến trúc Blackwell RTX với CPU Nvidia Grace và bộ nhớ hợp nhất.

Cấu hình cao nhất có tới 128 GB bộ nhớ hợp nhất. Thay vì CPU và GPU sử dụng những vùng bộ nhớ hoàn toàn tách biệt như trên nhiều PC truyền thống, tài nguyên có thể được phân bổ linh hoạt hơn cho tác vụ cần thiết.

Microsoft công bố Surface Laptop Ultra đạt tới một petaflop hiệu năng AI và có khả năng chạy cục bộ những model vượt 120 tỷ tham số.

Đây là con số đáng chú ý bởi các model cỡ lớn trước đây thường gắn với máy trạm hoặc máy chủ có GPU chuyên dụng.

Việc đưa chúng vào một laptop cho thấy ranh giới giữa máy tính cá nhân và hệ thống AI chuyên dụng đang dần thu hẹp.

Tuy nhiên, số tham số không phải thước đo duy nhất quyết định một model thông minh đến đâu.

Khả năng chạy một model lớn còn phụ thuộc cách model được tối ưu, mức lượng tử hóa, kích thước context và lượng bộ nhớ mà các ứng dụng khác đang sử dụng.

Do đó, “chạy model 120 tỷ tham số” không có nghĩa Surface Laptop Ultra có thể thay thế mọi model AI cao cấp đang vận hành trong những cụm GPU khổng lồ.

Ý nghĩa thực tế hơn là người dùng chuyên nghiệp có thể đưa nhiều workload trước đây phụ thuộc server về PC.

Lập trình viên có thể dùng model local để phân tích codebase, tìm nguyên nhân build thất bại hoặc đề xuất bản sửa.

Người làm sáng tạo có thể chạy AI tạo ảnh, xử lý video và những workflow 3D ngay trên máy.

Nhà nghiên cứu có thể thử nghiệm model hoặc làm inference trên dữ liệu riêng mà không cần thuê GPU cloud cho từng bước nhỏ.

Surface Laptop Ultra có giá khởi điểm 2.599,99 USD tại Mỹ và bắt đầu bán từ ngày 16/10.

Đây rõ ràng không phải laptop đại trà.

Mức giá cùng cấu hình cho thấy Microsoft trước hết nhắm tới nhà phát triển, kỹ sư AI, người sáng tạo nội dung và các nhóm chuyên môn cần sức mạnh tính toán cao.

Cấu hình cao cấp có thể lên tới 128 GB bộ nhớ hợp nhất. Máy cũng được thiết kế hệ thống tản nhiệt lớn hơn để duy trì hiệu năng khi các workload AI hoặc đồ họa hoạt động liên tục.

Bên cạnh laptop, Microsoft còn giới thiệu Surface RTX Spark Dev Box.

Thiết bị nhỏ gọn này giống một máy trạm AI đặt trên bàn, sử dụng cùng nền tảng RTX Spark, có tới 128 GB bộ nhớ hợp nhất và được thiết kế để chạy liên tục.

Lập trình viên có thể dùng nó để inference, thử nghiệm và đánh giá model tại chỗ rồi chỉ dùng tài nguyên cloud cho những tác vụ cần quy mô lớn hơn.

Nvidia còn đưa RTX Spark tới nhiều đối tác PC như Acer, Asus, Dell, HP, Lenovo, MSI và Gigabyte.

Điều đó cho thấy Microsoft và Nvidia không xem Surface Laptop Ultra như một sản phẩm đơn lẻ mà muốn tạo cả một lớp PC Windows dành cho local AI.

Xa hơn nữa là DGX Station for Windows.

Đây là hệ thống máy trạm đặt bàn sử dụng nền tảng Nvidia Grace Blackwell Ultra, với 748 GB bộ nhớ coherent và hiệu năng AI được Nvidia công bố tới 20 petaflops ở FP4.

Nếu Surface Laptop Ultra hướng tới việc đưa AI lớn vào laptop, DGX Station thể hiện bước tiếp theo: đưa sức mạnh vốn gắn với trung tâm dữ liệu xuống ngay bàn làm việc.

AI chạy trong máy cũng cần một “hàng rào” mới

Sức mạnh phần cứng chỉ giải quyết một nửa bài toán.

Nếu AI agent có thể chạy liên tục trong máy, đọc dữ liệu, mở ứng dụng và thực hiện hành động thay con người, Windows phải kiểm soát chúng khác với phần mềm truyền thống.

Microsoft vì thế đồng thời đưa Microsoft Execution Containers, hay MXC, sang trạng thái phát hành chính thức.

Có thể hình dung MXC như một vùng làm việc cách ly dành cho AI agent.

Thay vì cho agent chạy với toàn bộ quyền của người đang sử dụng máy tính, Windows có thể đặt nó vào một môi trường bị giới hạn và quản lý những tài nguyên mà agent được phép tiếp cận.

Mục tiêu là trả lời ba câu hỏi ngày càng quan trọng: agent nào đã thực hiện hành động, nó được phép truy cập thứ gì và doanh nghiệp có thể dừng hoặc giới hạn nó ra sao.

Đây là vấn đề đặc biệt đáng chú ý khi AI chuyển từ chatbot sang agent.

Một chatbot trả lời sai thường tạo ra một đoạn văn sai trên màn hình.

Một agent hoạt động sai có thể chỉnh sửa file, chạy mã, truy cập hệ thống hoặc thực hiện hàng loạt thao tác trước khi con người nhận ra.

Microsoft cho biết những khả năng tương lai của Windows còn sử dụng Microsoft Entra để phân biệt hoạt động do người dùng thực hiện với hoạt động của agent.

Điều này quan trọng với doanh nghiệp bởi nhật ký hệ thống cần xác định rõ một hành động được thực hiện bởi nhân viên hay bởi AI của nhân viên đó.

Khi kết hợp MXC với AI local, Microsoft đang cố tạo hai lớp song song.

Một lớp cung cấp sức mạnh để agent hoạt động ngay trên PC.

Lớp còn lại kiểm soát agent đó.

Đây cũng là lý do chiến lược local AI không chỉ xoay quanh tốc độ.

Nếu một agent xử lý thông tin nhạy cảm ngay trong thiết bị, chạy trong môi trường cách ly và chỉ được trao đúng quyền cần thiết, doanh nghiệp có thể dễ chấp nhận đưa AI vào quy trình công việc hơn.

Đối với người dùng phổ thông, những laptop có khả năng chạy model hơn 100 tỷ tham số vẫn còn đắt và chưa phải nhu cầu thiết yếu.

Phần lớn người dùng văn phòng hiện nay có thể tiếp tục sử dụng AI cloud trên những máy tính thông thường mà không thấy lý do rõ ràng để mua laptop 2.599 USD.

Local AI trở nên hấp dẫn hơn với những trường hợp đặc biệt: dữ liệu cần giữ kín, Internet không ổn định, lượng công việc AI đủ lớn để chi phí cloud trở nên đáng kể hoặc ứng dụng đòi hỏi phản hồi gần tức thì.

Điều này cũng giải thích vì sao Microsoft không chọn chiến lược “local thay cloud”.

Hãng đặt cược vào hybrid.

Laptop sẽ xử lý những gì nó làm tốt nhất, trong khi trung tâm dữ liệu tiếp tục đảm nhiệm những model và workload vượt quá giới hạn thiết bị.

Nếu hướng đi này thành công, khái niệm AI PC có thể thay đổi đáng kể.

Thế hệ Copilot+ PC đầu tiên tập trung nhiều vào NPU và các tính năng như hiệu ứng camera, tìm kiếm, phụ đề hay một số tác vụ AI nhẹ.

RTX Spark đẩy khái niệm đó sang cấp độ khác: chiếc PC trở thành nơi trực tiếp chạy model lớn và agent dài hơi.

Với người làm báo, chẳng hạn, một workstation AI cục bộ về lý thuyết có thể chuyển hàng giờ ghi âm thành văn bản, tìm nhân vật trong kho ảnh, phân loại hàng nghìn tài liệu, truy vấn kho bài cũ hoặc chạy một mô hình riêng của tòa soạn mà dữ liệu không cần gửi ra hệ thống bên ngoài.

Với doanh nghiệp, một agent có thể đọc tài liệu nội bộ, phân tích mã nguồn hoặc xử lý dữ liệu khách hàng trong phạm vi thiết bị được quản trị.

Đó mới là thay đổi đáng chú ý mà Microsoft và Nvidia đang đặt cược.

Cuộc đua AI không chỉ diễn ra ở việc ai xây trung tâm dữ liệu lớn hơn nữa. Một phần cuộc chiến đang quay trở lại chiếc máy tính trên bàn và laptop trong ba lô của người dùng.

Nếu PC thực sự đủ mạnh để xử lý ngày càng nhiều AI ngay tại chỗ, cloud vẫn còn đó nhưng sẽ không còn là lựa chọn duy nhất.