Apple thử nghiệm chức năng Siri mới để thực hiện nhiều lệnh thoại cùng lúc trên thiết bị
Gã khổng lồ công nghệ đã bắt đầu giai đoạn thử nghiệm chức năng mới cho trợ lý ảo của mình, cho phép thực hiện nhiều lệnh từ một lệnh thoại duy nhất. Công cụ này thay đổi cách người dùng tương tác với các thiết bị của thương hiệu, loại bỏ nhu cầu tạm dừng giữa các yêu cầu khác nhau. Tài nguyên xử lý các câu phức tạp và xác định các hành động khác nhau trong cùng một yêu cầu, thực hiện chúng một cách tuần tự và tự động.
Bản cập nhật này là một phần của gói hiện đại hóa hệ điều hành lớn hơn, tập trung vào trí tuệ nhân tạo tổng hợp và xử lý ngôn ngữ tự nhiên. Kiến trúc phần mềm đã được tái cấu trúc để hiểu bối cảnh của các cuộc hội thoại, cho phép trợ lý lưu giữ các yêu cầu trước đó trong bộ nhớ và áp dụng thông tin này trong các tương tác tiếp theo. Sự thay đổi này thể hiện sự chuyển đổi từ mô hình lệnh cứng nhắc sang giao diện đàm thoại linh hoạt hơn.

Các nhà phát triển của công ty nỗ lực hiệu chỉnh các thuật toán để đảm bảo rằng việc thông dịch đồng thời không dẫn đến xung đột khi thực hiện. Khả năng xâu chuỗi các tác vụ đòi hỏi sức mạnh xử lý vượt trội, điều này hướng tính khả dụng của chức năng này đến phần cứng mới nhất của nhà sản xuất.
Việc triển khai diễn ra dần dần trong các phiên bản thử nghiệm của hệ điều hành dành cho thiết bị di động và máy tính. Mục tiêu chính là tinh chỉnh sự hiểu biết về ngữ nghĩa trước khi phát hành chính thức ra công chúng.
Giao diện trực quan mới thay đổi sự tương tác với hệ thống
Việc thiết kế lại trợ lý ảo bao gồm sự thay đổi đáng kể về mặt hình ảnh đối với giao diện đồ họa của thiết bị. Biểu tượng hình cầu cũ xuất hiện ở cuối màn hình khi kích hoạt công cụ đã được thay thế bằng đường viền phát sáng bao quanh toàn bộ màn hình. Tín hiệu hình ảnh này cho biết hệ thống đang lắng nghe và xử lý thông tin, tích hợp theo cách hữu cơ hơn với việc sử dụng thiết bị mà không làm gián đoạn chế độ xem ứng dụng hiện đang mở.
Ngoài thay đổi về mặt thẩm mỹ, giao diện mới cho phép tương tác văn bản một cách tự nhiên, chỉ với hai cú chạm ở cuối màn hình để mở bàn phím chuyên dụng. Người dùng có thể chuyển đổi giữa lệnh thoại và gõ một cách liền mạch, tùy thuộc vào môi trường họ đang ở. Cạnh sáng phản ứng linh hoạt với âm sắc của giọng nói và độ phức tạp của quá trình xử lý, cung cấp phản hồi trực quan ngay lập tức về trạng thái của yêu cầu đang diễn ra.
Thực hiện các nhiệm vụ chuỗi trong thói quen của người dùng
Việc thực thi các lệnh theo chuỗi cho phép một câu duy nhất kích hoạt các ứng dụng và chức năng hệ thống khác nhau. Người dùng có thể yêu cầu trợ lý chụp ảnh và trong cùng một câu, ra lệnh gửi hình ảnh đến một liên hệ cụ thể trong ứng dụng nhắn tin.
Quá trình xử lý chia câu thành các ý định riêng biệt: kích hoạt camera, chụp phương tiện, mở trình nhắn tin, định vị liên hệ và xác nhận gửi. Toàn bộ quy trình này diễn ra ở chế độ nền, đòi hỏi sự can thiệp thủ công ở mức tối thiểu.
Một ví dụ thực tế khác liên quan đến việc quản lý thông tin cá nhân, chẳng hạn như yêu cầu tìm một địa chỉ cụ thể được đề cập trong email và thêm địa chỉ đó trực tiếp vào một sự kiện trên lịch. Trợ lý chuyển dữ liệu giữa ứng dụng email và lịch một cách tự động.
Yêu cầu phần cứng để xử lý nâng cao
Việc chạy các mô hình ngôn ngữ nâng cao trực tiếp trên thiết bị yêu cầu các thành phần phần cứng cụ thể, điều này hạn chế tính mới đối với các bộ xử lý mới nhất của thương hiệu. Các chip cần chứa các đơn vị xử lý thần kinh có khả năng thực hiện hàng nghìn tỷ phép tính mỗi giây, đảm bảo rằng việc giải thích nhiều lệnh diễn ra mà không có độ trễ đáng chú ý.
Yêu cầu bộ nhớ RAM cũng đóng vai trò là yếu tố quyết định hoạt động của công cụ, vì các mô hình trí tuệ nhân tạo cần được tải vào bộ nhớ tạm thời để truy cập tức thì. Các thiết bị thế hệ trước sẽ không nhận được chức năng chuỗi lệnh đầy đủ do những hạn chế về kiến trúc vật lý này.
Xử lý cục bộ là điều cần thiết để duy trì tốc độ phản hồi mong đợi trong tương tác bằng giọng nói. Khi người dùng ra lệnh cho một chuỗi hành động, hệ thống cần giải mã âm thanh, chuyển đổi thành văn bản, xác định ý định và kích hoạt các giao diện lập trình tương ứng trong tích tắc.
Sự phụ thuộc vào phần cứng cao cấp phản ánh độ phức tạp tính toán khi xử lý ngôn ngữ tự nhiên phi cấu trúc. Công ty đã tối ưu hóa bộ xử lý của mình để xử lý cụ thể các khối lượng công việc trí tuệ nhân tạo này theo cách tiết kiệm điện năng.
Kiến trúc quyền riêng tư và bảo mật dữ liệu tại chỗ
Kiến trúc hệ thống ưu tiên xử lý thông tin cục bộ, đảm bảo rằng dữ liệu giọng nói và thông tin cá nhân được truy cập trong nhiều lệnh không rời khỏi thiết bị. Việc lập chỉ mục ngữ nghĩa và thực thi tác vụ diễn ra độc lập trên chip chính. Phương pháp kỹ thuật này ngăn không cho thông tin nhạy cảm, chẳng hạn như nội dung tin nhắn hoặc lịch hẹn, bị lộ trên các máy chủ bên ngoài trong quá trình giải thích lệnh.
Đối với những yêu cầu đòi hỏi sức mạnh tính toán lớn hơn, công ty đã phát triển cơ sở hạ tầng điện toán đám mây chuyên dụng. Dữ liệu được gửi đến các máy chủ này được xử lý mà không cần lưu trữ vĩnh viễn và được mã hóa hai đầu, chặn quyền truy cập của bên thứ ba hoặc chính nhà sản xuất. Quá trình chuyển đổi giữa xử lý cục bộ và đám mây diễn ra một cách vô hình đối với người dùng, duy trì các giao thức bảo mật bất kể mức độ phức tạp của lệnh được yêu cầu.
Hiệu chuẩn thuật toán và kiểm tra độ chính xác
Các kỹ sư phần mềm thực hiện nhiều bài kiểm tra nội bộ để đánh giá tỷ lệ thành công của trợ lý khi xử lý các hướng dẫn không rõ ràng hoặc các lệnh kép được xây dựng bằng cú pháp phức tạp. Quá trình xác thực bao gồm việc mô phỏng hàng nghìn tình huống hàng ngày trong đó trí tuệ nhân tạo cần quyết định thứ tự chính xác để thực hiện các nhiệm vụ và xác định các lỗi logic có thể xảy ra trước khi hoàn thành hành động. Nhóm phát triển giám sát các số liệu hiệu suất, chẳng hạn như thời gian phản hồi từ khi kết thúc lời nói của người dùng đến khi bắt đầu hành động đầu tiên, cũng như tính trôi chảy trong quá trình chuyển đổi giữa các ứng dụng được kích hoạt. Mục tiêu trọng tâm của giai đoạn thử nghiệm này là loại bỏ các trường hợp trong đó hệ thống chỉ thực hiện nửa đầu của lệnh và bỏ qua nửa lệnh thứ hai, một vấn đề thường gặp trong các phiên bản xử lý ngôn ngữ tự nhiên trước đây. Việc hiệu chỉnh các thuật toán ý định được điều chỉnh hàng ngày dựa trên các báo cáo sự cố do thiết bị thử nghiệm tạo ra, đảm bảo rằng phiên bản cuối cùng mang lại trải nghiệm nhất quán mà không bị gián đoạn hoạt động.
Công cụ dành cho nhà phát triển độc lập
Việc mở rộng nhiều lệnh phụ thuộc vào việc các nhà phát triển độc lập áp dụng các giao diện lập trình ứng dụng mới. Nhà sản xuất đã phát hành các công cụ cụ thể cho phép người tạo phần mềm ánh xạ các chức năng của ứng dụng của họ, giúp trợ lý có thể truy cập chúng và có thể kết hợp với các hành động từ các chương trình khác được cài đặt trên thiết bị.
Hiểu biết ngữ nghĩa và sửa lỗi theo thời gian thực
Nền tảng công nghệ của trợ lý mới dựa trên công cụ xử lý ngôn ngữ tự nhiên được viết lại hoàn toàn. Hệ thống này không còn dựa vào các cụm từ được lập trình sẵn hoặc các trình kích hoạt theo từ cụ thể để bắt đầu một hành động. Sự hiểu biết ngữ nghĩa cho phép người dùng nói thông tục, nói lắp, sửa lỗi giữa câu hoặc thay đổi ý định và hệ thống vẫn có thể trích xuất ý định cuối cùng và thực hiện chính xác nhiều lệnh được yêu cầu.
Tính linh hoạt về nhận thức này thể hiện một bước nhảy vọt về mặt kỹ thuật đáng kể trong tương tác giữa người và máy tính. Trước đây, lỗi trong công thức lệnh yêu cầu người dùng phải hủy thao tác và bắt đầu lại từ đầu. Bây giờ, trí tuệ nhân tạo sẽ phân tích ngữ cảnh của toàn bộ câu trước khi bắt đầu chuỗi hành động, xác định phần nào của hướng dẫn sẽ hủy phần trước đó. Khả năng thích ứng trong thời gian thực này đưa sự tương tác với máy đến gần hơn với cuộc trò chuyện tự nhiên của con người, giảm nhu cầu ra lệnh bằng robot và tăng hiệu quả trong việc sử dụng các công cụ của hệ điều hành.
Tranh chấp công nghệ trong lĩnh vực trợ lý ảo
Sự phát triển của những khả năng mới này phản ứng trực tiếp với những tiến bộ của các công ty cạnh tranh trong lĩnh vực công nghệ. Thị trường trợ lý ảo đã trải qua quá trình phát triển nhanh chóng với sự ra đời của các mô hình ngôn ngữ quy mô lớn, khiến các tương tác cũ trở nên lỗi thời và buộc phải cập nhật cấu trúc trên hệ thống di động.
Nhà sản xuất tìm cách lấy lại không gian trong phân khúc tự động hóa giọng nói bằng cách cung cấp khả năng tích hợp sâu mà các ứng dụng của bên thứ ba không thể đạt được do các hạn chế của hệ điều hành. Lợi thế cạnh tranh dựa trên toàn quyền kiểm soát phần cứng và phần mềm, cho phép tối ưu hóa mang lại phản hồi nhanh hơn, chính xác hơn trong quá trình sử dụng hàng ngày.







