Giới thiệu

AI tạo sinh (Generative AI) là nhóm các mô hình trí tuệ nhân tạo có khả năng tạo ra nội dung mới — văn bản, hình ảnh, âm thanh, code — thay vì chỉ phân loại hay dự đoán như các mô hình AI truyền thống. Điểm khác biệt cốt lõi: AI truyền thống trả lời câu hỏi "cái này thuộc loại nào?", còn AI tạo sinh trả lời "tiếp theo nên là gì?".

ChatGPT, Claude, Gemini đều thuộc nhóm này. Chúng được xây dựng trên nền tảng gọi là Large Language Model — mô hình ngôn ngữ lớn, thường viết tắt là LLM.

LLM là gì và hoạt động như thế nào

LLM là mô hình học máy được huấn luyện trên lượng văn bản khổng lồ từ internet, sách, tài liệu kỹ thuật. Sau quá trình đó, mô hình học được cách "dự đoán từ tiếp theo" với xác suất cao nhất trong ngữ cảnh đã cho.

Nói đơn giản: khi bạn gõ "Thủ đô của Việt Nam là", LLM tính toán rằng từ tiếp theo có xác suất cao nhất là "Hà" rồi "Nội". Quá trình này lặp lại từng token cho đến khi tạo ra câu trả lời hoàn chỉnh.

Token không hoàn toàn bằng từ. Trong tiếng Anh, "running" có thể là 1 token, nhưng "ChatGPT" có thể bị tách thành "Chat" + "G" + "PT". Trong tiếng Việt, tokenization phức tạp hơn vì mỗi âm tiết thường là 1 token riêng. Đây là lý do tại sao khi dùng LLM với tiếng Việt, chi phí token thường cao hơn tiếng Anh với cùng nội dung.

sơ đồ luồng LLM nhận input text, chuyển thành tokens, qua các lớp transformer, xuất ra token tiếp theo lặp lại cho đến khi kết thúc

Kiến trúc bên trong hầu hết LLM hiện đại dựa trên Transformer — một cơ chế cho phép mô hình "chú ý" đến các phần khác nhau của câu khi dự đoán từ tiếp theo. Bạn chưa cần hiểu sâu về Transformer để làm việc với LLM, nhưng cần biết rằng đây là lý do LLM hiểu được ngữ cảnh dài và mối quan hệ giữa các ý trong đoạn văn.

Các khái niệm nền tảng cần nắm

Context window là giới hạn lượng văn bản mà LLM có thể "nhớ" trong một lần xử lý, tính bằng token. GPT-4o có context window 128.000 token, tương đương khoảng 300 trang sách. Vượt quá giới hạn này, mô hình sẽ không thể tham chiếu đến nội dung bị đẩy ra ngoài cửa sổ.

Temperature là tham số điều chỉnh mức độ "sáng tạo" của mô hình. Giá trị từ 0 đến 2. Temperature thấp (0.1 - 0.3) cho kết quả nhất quán, ít biến thiên — phù hợp cho tác vụ phân tích, trích xuất dữ liệu. Temperature cao (0.8 - 1.2) cho kết quả đa dạng hơn — phù hợp cho viết sáng tạo.

Prompt là đầu vào bạn gửi cho LLM. Chất lượng prompt ảnh hưởng trực tiếp đến chất lượng output — đây là lý do cả một lĩnh vực gọi là "prompt engineering" ra đời.

Finetune là quá trình huấn luyện thêm LLM trên tập dữ liệu chuyên biệt để mô hình giỏi hơn trong một domain cụ thể. GPT-4 base được finetune thêm với dữ liệu hội thoại để tạo ra ChatGPT.

So sánh các LLM phổ biến hiện tại

Thị trường hiện có ba nhóm LLM chính bạn sẽ làm việc cùng trong khóa học này.

Nhóm OpenAI gồm GPT-4o và GPT-4o mini. GPT-4o là mô hình đa phương thức (nhận text, hình ảnh, audio), phù hợp cho tác vụ phức tạp. GPT-4o mini rẻ hơn đáng kể và đủ dùng cho phần lớn tác vụ thông thường.

Nhóm Anthropic có Claude 3.5 Sonnet — được đánh giá cao về khả năng lập luận và tuân thủ instruction phức tạp, đặc biệt hữu ích khi xây dựng AI Agent.

Nhóm mã nguồn mở tiêu biểu là Llama (Meta) và Mistral. Ưu điểm là chạy được locally, không tốn chi phí API, phù hợp khi dữ liệu nhạy cảm không thể gửi lên cloud.

sơ đồ so sánh 3 nhóm LLM: OpenAI, Anthropic, Open Source — theo 3 trục: chi phí, hiệu năng, khả năng tùy chỉnh

Không có mô hình "tốt nhất" tuyệt đối. Lựa chọn phụ thuộc vào yêu cầu cụ thể về chi phí, tốc độ, độ chính xác và chính sách dữ liệu của dự án.

Tổng kết

AI tạo sinh và LLM không phải là công nghệ "thần kỳ" — chúng là các mô hình xác suất được huấn luyện để dự đoán token tiếp theo dựa trên ngữ cảnh. Hiểu điều này giúp bạn đặt kỳ vọng đúng: LLM không "biết" sự thật, chúng "đoán" dựa trên pattern từ dữ liệu huấn luyện.

Ba khái niệm quan trọng nhất từ bài này để mang vào các bài tiếp theo: context window quyết định bộ nhớ làm việc của mô hình, temperature điều chỉnh tính ngẫu nhiên của output, và prompt là đòn bẩy chính bạn có để kiểm soát kết quả.

Bài kiểm tra cuối bài

1. Điểm khác biệt cốt lõi giữa AI tạo sinh và AI truyền thống là gì?

2. LLM dự đoán output theo cơ chế nào?

3. Context window trong LLM có nghĩa là gì?

4. Khi nào nên dùng temperature thấp (ví dụ 0.1 - 0.3)?

5. Tại sao chi phí token khi dùng tiếng Việt thường cao hơn tiếng Anh với cùng nội dung?

6. Finetune một LLM có nghĩa là gì?

7. Ưu điểm chính của các LLM mã nguồn mở như Llama so với GPT-4o là gì?