Giới thiệu

Một AI agent không phải là một chatbot duy nhất tự động biết hết mọi thứ. Bên trong, nó vận hành một vòng lặp lặp lại: nó quan sát một điều gì đó, suy nghĩ về những gì cần làm, chọn một công cụ, và thực hiện hành động. Sau đó nó quan sát kết quả của hành động đó và lặp lại. Hiểu vòng lặp này là nền tảng cho tất cả những gì tiếp theo trong khóa học này — kết nối cơ sở dữ liệu, gọi API và xử lý xác thực đều là các bước "hành động" bên trong vòng lặp này.

Vòng lặp Nhận thức–Lập kế hoạch–Hành động

Vòng lặp của agent có bốn pha lặp đi lặp lại cho đến khi nhiệm vụ của agent được hoàn thành.

Nhận thức là mọi thứ mà agent có thể đọc được hoặc cảm nhận được: gợi ý của người dùng, lịch sử cuộc trò chuyện, kết quả của một lần gọi công cụ trước đó, hoặc dữ liệu được lấy từ cơ sở dữ liệu. Lập kế hoạch là bước lý luận của mô hình LLM nơi nó quyết định điều gì nên xảy ra tiếp theo. Lựa chọn công cụ là thời điểm mô hình chọn một hàm cụ thể (như query_database hay send_email) và tạo tham số cho nó. Hành động là khi công cụ đó thực sự chạy và trả về kết quả.

sơ đồ luồng 4 bước trong một vòng tròn: Nhận thức -> Lập kế hoạch -> Lựa chọn công cụ -> Hành động -> quay lại Nhận thức

Sau khi hành động trả về, kết quả trở thành đầu vào nhận thức mới. Agent sau đó lên kế hoạch lại. Đây là lý do tại sao các agent có thể ghép nối các cuộc gọi — kết quả của một công cụ thông báo quyết định cho lần quyết định tiếp theo.

Cách Mô hình Quyết định Sử dụng Công cụ Nào

Các agent hiện đại được cung cấp một danh sách có cấu trúc các công cụ có sẵn, mỗi công cụ có tên, mô tả và sơ đồ tham số. Mô hình LLM đọc các mô tả này và quyết định cái nào phù hợp với nhu cầu hiện tại. Nó không "biết" cách gọi API một cách tự động — nó chọn công cụ mà bạn, nhà phát triển, đã đăng ký.

python
tools = [
{
"name": "query_database",
"description": "Run a read-only SQL query against the users database.",
"parameters": {
"type": "object",
"properties": {
"sql": {"type": "string", "description": "SELECT statement only"}
},
"required": ["sql"]
}
},
{
"name": "get_weather",
"description": "Fetch current weather for a city.",
"parameters": {
"type": "object",
"properties": {
"city": {"type": "string"}
},
"required": ["city"]
}
}
]

Khi người dùng hỏi "Có bao nhiêu người đã đăng ký ở tuần trước?", mô hình ghép yêu cầu để truy vấn_database, sinh tham số SQL, và lúc chạy thực thi nó. Xin lưu ý rằng agent không tự ý phát minh khả năng của mình — nó đã chọn từ một menu bạn định nghĩa.

Where External Integrations Fit

Mọi truy vấn cơ sở dữ liệu, gọi API, hay xác thực đều chỉ là một công cụ khác trong menu đó. Từ góc độ của agent, không có sự khác biệt giữa "tra cứu một đơn hàng trong Postgres" và "gọi endpoint hoàn tiền Stripe" — cả hai đều là công cụ có schema và hàm xử lý. Khóa học sẽ xây dựng các trình xử lý này lần lượt: trước là truy vấn DB đọc-được, sau là các thao tác ghi, rồi các API bên ngoài, rồi các luồng được xác thực.

python
def handle_tool_call(tool_name, arguments):
if tool_name == "query_database":
return db.execute(arguments["sql"])
if tool_name == "get_weather":
return requests.get("https://api.weather.example/current",
params={"city": arguments["city"]}).json()
raise ValueError(f"Unknown tool: {tool_name}")

Trình xử lý này là nơi làm việc thực sự diễn ra. Mô hình ngôn ngữ lớn (LLM) chỉ đề xuất những gì cần làm — mã của bạn quyết định những gì an toàn để làm.

Các sai sót phổ biến

Đối xử với LLM như có thể làm mọi thứ — nó không thể gọi các công cụ bạn chưa đăng ký, và nó không thể tiếp cận dữ liệu bạn chưa cung cấp công cụ cho nó. Nhầm lẫn giữa lập kế hoạch và thực thi — mô hình chỉ đề xuất; runtime của bạn phải xác nhận và thực thi. Để cho agent vòng lặp vô tận — luôn đặt giới hạn tối đa số lượt lặp để công cụ có hành vi sai có thể không kéo được agent. Cuối cùng, đừng bao giờ tin output thô của mô hình như một cuộc gọi database hay API trực tiếp mà không kiểm tra; tiêm SQL và payload API xấu đến từ việc bỏ qua bước này.

Tóm tắt

Một agent AI là một vòng lặp: nhận thức, lập kế hoạch, chọn công cụ, hành động, quan sát kết quả, lặp lại. Các công cụ là cầu nối giữa lý luận của LLM và thế giới bên ngoài. Các cơ sở dữ liệu, API và lớp xác thực đều được triển khai dưới dạng công cụ có schema và trình xử lý. Thành thạo mô hình tư duy này là điều kiện tiên quyết cho mọi thứ khác trong khóa học này.

Bài kiểm tra cuối bài

1. What are the four phases of the AI agent loop introduced in this lesson?

2. Đâu là nơi thực thi thực sự một truy vấn cơ sở dữ liệu diễn ra trong hệ thống tác nhân?

3. Tại sao một nhà phát triển đăng ký công cụ kèm mô tả và schema tham số?

4. Sau khi một lần gọi công cụ trả về kết quả, tác nhân sẽ làm gì tiếp theo?

5. Về mặt nhận thức của tác nhân, sự khác biệt giữa việc truy vấn cơ sở dữ liệu và gọi một API bên ngoài như Stripe là gì?

6. Đâu là một trong những biện pháp an toàn được đề xuất khi chạy vòng lặp của tác nhân?

7. Một suy nghĩ sai phổ biến về agent AI được nhắc trong bài học là gì?

8. Điều gì xảy ra ở giai đoạn "Action" của vòng lặp agent?

Cơ sở: Cách một AI Agent nhận thức, lập kế hoạch và hành động