Context bombing là gì? Khi AI dùng chính "chiêu" của tin tặc để chống lại chúng

10:57, 20/07/2026

Gần đây, ngày càng có nhiều tin tặc sử dụng các cuộc tấn công tiêm mã lệnh (prompt injection) nhằm vô hiệu hóa hệ thống phòng thủ bằng AI bên trong các mạng lưới, và cho đến nay, vẫn chưa có biện pháp cụ thể nào để ngăn chặn tình trạng này.

Kỹ thuật context bombing ( Gài bẫy ngữ cảnh) được phát triển dựa trên một chiến lược phòng thủ mạng trước đó do Tracebit tạo ra hồi đầu năm nay. (Ảnh minh họa: Unsplash).

Phần lớn các cuộc thảo luận về AI trong lĩnh vực an ninh mạng thường tập trung vào việc các nhóm tội phạm công nghệ có thể lợi dụng các mô hình AI tiên tiến để gia tăng sức mạnh tàn phá cho các cuộc tấn công. Tuy nhiên, đó mới chỉ là một nửa câu chuyện, bởi các chuyên gia bảo mật cũng đang sử dụng chính những năng lực AI này để phản công lại các mối đe dọa ngày càng tinh vi.

Một trong những ví dụ điển hình mới nhất là kỹ thuật "tiêm mã lệnh" (prompt injection). Vốn được biết đến như một mánh khóe bị tin tặc khai thác nhằm thao túng hệ thống AI hoạt động sai lệch so với mục đích ban đầu, kỹ thuật này giờ đây đang được các nhà nghiên cứu an ninh mạng tái sử dụng để làm gián đoạn chính kẻ tấn công.

Các chuyên gia tại công ty an ninh mạng Tracebit đã phát hiện ra rằng, việc đặt các đoạn mã lệnh tiềm ẩn bên cạnh mật khẩu, khóa mã hóa,... lưu trữ trên Amazon Web Services (AWS) là một biện pháp hữu hiệu để bảo vệ hệ thống trước các cuộc tấn công từ tác nhân AI của hacker. Nhờ đó, khi tin tặc chỉ đạo một mô hình ngôn ngữ lớn (LLM) thực hiện hành vi vi phạm các rào cản an toàn (guardrails), mô hình này sẽ phản hồi bằng cách tự động ngắt kết nối do đã vấp phải các mã lệnh được cấy sẵn từ trước.

Phương pháp mới mang tên Context bombing ( Gài bẫy ngữ cảnh ) này là một giải pháp bảo vệ hệ thống khỏi các cuộc tấn công tiêm mã lệnh trực tiếp hoặc gián tiếp  về cơ bản là khi kẻ tấn công nhúng các lệnh độc hại vào nội dung để đánh lừa LLM hoặc các tác nhân AI tự trị tuân theo. Những lệnh này có thể được ẩn giấu tinh vi bên trong một email hoặc lời mời trên lịch. Khi một LLM hoặc tác nhân AI vô tình tiếp xúc với các mã ngầm này và nhầm tưởng đó là chỉ thị hợp lệ từ người dùng, chúng có thể bị thao túng để đánh cắp dữ liệu nhạy cảm hoặc thực hiện các hành vi phá hoại khác.

Thực tế cho thấy, sự gia tăng của các nhóm tin tặc sử dụng tấn công tiêm mã lệnh để vô hiệu hóa hệ thống phòng thủ AI trong mạng lưới đang ở mức đáng báo động. Tháng trước, đội ngũ nghiên cứu từ công ty bảo mật Socket đã phát hiện một tác nhân AI (dựa trên LLM) bị thao túng để nhắm mục tiêu vào các LLM khác, lừa chúng cung cấp hướng dẫn chế tạo bom hạt nhân hoặc vũ khí sinh học. Các mã lệnh được tiêm vào để khởi xướng cuộc tấn công cũng được thiết kế nhằm làm tê liệt quy trình phân tích phần mềm độc hại có sự hỗ trợ của AI. Một nguyên mẫu mã độc tương tự cũng đã được các chuyên gia tại công ty bảo mật Check Point phát hiện trước đó.

Dù vậy, cho đến nay, vẫn chưa có cơ chế đủ mạnh nào để giải quyết tận gốc rễ của các cuộc tấn công tiêm mã lệnh. Thay vào đó, hầu hết các công ty AI chỉ thiết lập những rào chắn kỹ thuật phức tạp nhằm ngăn chặn mã lệnh độc hại kích hoạt LLM hoặc tác nhân AI hoạt động ngoài tầm kiểm soát. Tuy nhiên, nghiên cứu của Tracebit đã mở ra một hướng đi mới giúp lật ngược thế cờ với những kẻ tấn công thông qua kỹ thuật cấy ngữ cảnh.

Context bombing là gì và mang lại lợi ích ra sao?

Theo các nhà nghiên cứu của Tracebit, cấy ngữ cảnh xảy ra khi một LLM bắt gặp các lệnh cấm nhưng không tuân theo do đã vấp phải các lệnh mồi hoặc "bom ngữ cảnh" được gài sẵn từ trước. Về cốt lõi, kỹ thuật này kích hoạt một cơ chế từ chối được nhúng trực tiếp vào trong ngữ cảnh của mô hình.

Chia sẻ với tạp chí Wired, ông Andy Smith, đồng sáng lập kiêm Giám đốc điều hành của Tracebit, cho biết: “Điều chúng tôi muốn nhấn mạnh là phương pháp này thực sự mang lại hiệu ứng mạnh mẽ, sắc bén và khiến các tác nhân độc hại rất khó để khôi phục trạng thái ban đầu. Một khi những yếu tố này lọt vào ngữ cảnh của chúng, các mô hình AI sẽ liên tục từ chối thực hiện lệnh”.

Trong khuôn khổ nghiên cứu, đội ngũ Tracebit đã tiến hành thử nghiệm trên các mô hình Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro và Kimi 2.6. Các hệ thống này được vận hành trong môi trường AWS mô phỏng và được giao nhiệm vụ thực hiện các công việc lập trình thường quy. Quá trình này dẫn dắt các mô hình tiến hành kiểm kê tài nguyên và vô tình vấp phải các chuỗi lệnh được cấy sẵn. Thử nghiệm đã được tiến hành trên 5 mô hình hàng đầu với tổng cộng 152 lượt tấn công.

Kết quả cho thấy, bằng cách cài cắm một trong những chuỗi lệnh này vào dữ liệu nhạy cảm giả mạo (decoy secret), tỷ lệ các tác nhân AI chiếm đoạt thành công toàn quyền quản trị tài khoản đã giảm mạnh từ 57% xuống chỉ còn 5%. Tương tự, số trường hợp hệ thống bị xâm nhập hoàn toàn bởi tác nhân AI bị hack cũng giảm từ 36% xuống mức 1%.

"Tác nhân mạnh mẽ nhất trong các thử nghiệm của chúng tôi là Opus 4.8, vốn đạt tỷ lệ chiếm quyền quản trị lên tới 93% trong các lượt chạy thông thường, đã thất bại hoàn toàn trong mọi nỗ lực khi phải đối mặt với một 'bom ngữ cảnh'", nhóm nghiên cứu viết.

Kỹ thuật cấy ngữ cảnh được phát triển dựa trên một phương pháp phòng thủ mạng trước đó do chính Tracebit tạo ra vào đầu năm nay. Kỹ thuật này bao gồm việc đặt mã lệnh dọc theo cơ sở hạ tầng AWS của các doanh nghiệp; nhờ đó, khi hệ thống bị các tác nhân AI độc hại dò xét, đội ngũ bảo mật sẽ tự động nhận được cảnh báo. Mô phỏng theo khái niệm "chim hoàng yến trong mỏ than" (dùng để cảnh báo khí độc), phương pháp này được phát triển nhằm giúp các chuyên gia an ninh mạng nhận tín hiệu cảnh báo sớm khi hạ tầng AI của họ bị các tác nhân thù địch nhắm tới, trước khi hệ lụy nghiêm trọng thực sự xảy ra.