Khi nào AI agent cho doanh nghiệp cần một model không sinh văn bản?

Thay vì ép model chat trả lời dài dòng rồi cắt lấy JSON, một thế hệ model mới không sinh câu chữ nào. Với phần lớn SME, việc cần làm trước là biết bước nào chỉ cần vài dòng code thường.

Frosted glass funnel sorting mixed shapes into two lanes of spheres and navy cubes
Article index

    Nếu từng xây dựng một luồng AI agent cho doanh nghiệp, có thể bạn đã gặp tình huống trớ trêu này: bạn chỉ cần hệ thống kiểm tra xem tin nhắn gửi đến có phải là yêu cầu báo giá hay không và dặn máy chỉ trả về đúng chữ true hoặc false. Kết quả nhận về lại là: "Chào bạn, tôi rất vui lòng hỗ trợ. Sau khi phân tích ngữ cảnh, câu trả lời là: true". Một câu chào lịch sự vô hại với con người, nhưng đủ làm gãy hoàn toàn đoạn code xử lý tự động phía sau nếu lập trình viên không bọc thêm vài lớp chắn lọc dữ liệu.

    Một hệ thống tự động hoá tốt là hệ thống chọn đúng công cụ cho từng mắt xích: việc nào code thường làm được, việc nào cần model ra quyết định có cấu trúc, và việc nào mới thật sự cần đến LLM đa năng.

    So sánh model chat trả về đoạn văn với model ra quyết định trả về nhãn có ngưỡng và phương án dự phòng
    Cùng một câu hỏi, model ra quyết định trả về một nhãn rõ ràng thay vì một đoạn văn.

    TypeSafe AI công bố gì với Jev?

    Ngày 15/09/2026, nhà sáng lập Diogo Almeida của TypeSafe AI công bố dòng model System One cùng sản phẩm đầu tiên mang tên Jev. Điều đáng chú ý là Jev không cố viết hay hơn hay trò chuyện giỏi hơn. TypeSafe nói họ bỏ hẳn việc sinh văn bản. Jev không nói một lời nào.

    Thay vì đóng vai một người trò chuyện, Jev hoạt động như một dịch vụ API trên nền tảng đám mây (hiện đang trong giai đoạn thử nghiệm sớm qua danh sách chờ) chuyên xử lý các bài toán ra quyết định: phân loại, phân luồng tin nhắn, chấm điểm, trích xuất dữ liệu, kiểm tra điều kiện rẽ nhánh và chặn những yêu cầu không an toàn. Kết quả trả về là các giá trị có kiểu dữ liệu chặt chẽ khớp với cấu trúc định sẵn, kèm một phân phối xác suất đã được hiệu chuẩn và một điểm tin cậy từ 0 đến 1 tính từ chính phân phối đó.

    TypeSafe cho biết cái tên System One được lấy cảm hứng từ cách nhà tâm lý học Daniel Kahneman phân chia tư duy con người trong cuốn sách Tư duy nhanh và chậm (Thinking, Fast and Slow): Hệ thống 1 phản xạ nhanh, trực giác; còn Hệ thống 2 tư duy chậm, suy luận logic sâu. Khi xây dựng luồng vận hành cho doanh nghiệp, bạn không nhất thiết phải kéo một chuyên gia tư duy chậm và đắt đỏ đứng ở cửa chỉ để phân loại xem một tin nhắn Zalo gửi đến là hỏi giá hay khiếu nại dịch vụ.

    Về hiệu năng, TypeSafe công bố thời gian phản hồi của Jev đạt từ 70 đến 500 mili-giây, so với mức 3 đến 329 giây ở các LLM đa năng hàng đầu. Tuy nhiên, chúng tôi cũng lưu ý bạn rằng đây là số liệu do chính TypeSafe đo từ laptop của họ ở Bờ Tây nước Mỹ. TypeSafe cũng tự nhận các con số trên trang chủ của họ (nhanh hơn 193,6 lần, rẻ hơn 444,6 lần) nhiều khả năng nằm ở mức cao so với thực tế triển khai. Hơn nữa, hãng chưa công bố dữ liệu đo kiểm độc lập nào về mức độ chuẩn xác trên tiếng Việt.

    Ba tầng xử lý: Code thường, Decision Model hay LLM?

    Nói đến chuyện không để doanh nghiệp bị khoá vào một hệ sinh thái, nhiều người chỉ nghĩ đến việc đổi từ ChatGPT sang Claude hoặc Gemini. Nhưng trong thiết kế hệ thống thực tế, phổ lựa chọn rộng hơn thế rất nhiều. Khi đứng trước một tác vụ rẽ nhánh, chúng tôi khuyến nghị bạn cân nhắc theo 3 tầng:

    1. Tầng 1 - Code truyền thống (nhanh, rẻ, chạy đúng như viết): Nếu điều kiện rẽ nhánh dựa trên dữ liệu cứng — ví dụ: kiểm tra định dạng số điện thoại, lọc theo mã tỉnh thành, hay kiểm tra đơn hàng trên 5 triệu đồng — hãy dùng vài dòng code hoặc regex. Đừng lãng phí token và thời gian gọi API vào những việc mà lập trình viên có thể viết xong trong năm phút.
    2. Tầng 2 - Model ra quyết định có cấu trúc (Nhanh, trả về schema và xác suất): Phù hợp cho những tình huống có ngữ cảnh mờ mà code thường không bắt được, nhưng đầu ra chỉ là một tập hữu hạn các lựa chọn đóng. Ví dụ: phân loại nội dung, phát hiện ý định mua hàng khẩn cấp, hoặc chấm điểm rủi ro. Ở tầng này, bạn cần câu trả lời kèm một con số tin cậy từ 0 đến 1 để máy tự rẽ nhánh.
    3. Tầng 3 - LLM đàm thoại đa năng (Linh hoạt, giàu ngữ cảnh, chi phí cao hơn): Dành riêng cho các công đoạn thực sự cần giao tiếp: viết thư phản hồi cá nhân hoá, tóm tắt biên bản họp phức tạp, hoặc trích xuất thông tin từ những tài liệu phi cấu trúc có dung lượng lớn.

    Tình huống giả định: Một doanh nghiệp phân phối quy mô 50 nhân sự tiếp nhận khoảng 2.000 tin nhắn mỗi ngày qua Zalo OA, Facebook Fanpage và email. Nhu cầu đặt ra là phân luồng các tin nhắn hỏi báo giá tồn kho để chuyển ngay cho nhân viên kinh doanh phụ trách.

    Nếu dùng regex hay từ khoá cứng, hệ thống sẽ bỏ sót những câu hỏi tự nhiên như "bên em còn mã dao phay ngón 4 me hôm nọ không". Nhưng nếu đẩy cả 2.000 tin nhắn này vào một LLM lớn, giá trị nhận lại cũng không nằm ở việc tiết kiệm vài giây hay giảm vài đồng tiền token, bởi nhân viên tư vấn cũng mất vài phút mới phản hồi khách. Giá trị thực sự nằm ở việc kiểm soát rủi ro: Hệ thống có một nhãn phân loại rõ ràng kèm điểm tin cậy. Ví dụ, tin nhắn có điểm tin cậy từ 0,9 trở lên tự vào hàng đợi của nhân viên kinh doanh; mọi tin nhắn còn lại được chuyển cho người trực kiểm tra tay.

    Sơ đồ quyết định ba bước chọn giữa code thường, model ra quyết định và LLM đa năng
    Ba câu hỏi để chọn tầng xử lý cho từng mắt xích: code thường, model ra quyết định hay LLM đa năng.

    Ba câu hỏi trước khi nghĩ đến việc đổi công nghệ

    Đưa một API còn đang thử nghiệm vào lõi vận hành thường rước thêm rắc rối. Trước khi tìm hiểu sâu về các giải pháp như Jev hay tìm kiếm các dịch vụ tích hợp AI cho doanh nghiệp, bạn nên tự trả lời ba câu hỏi thực tế:

    1. Nghiệp vụ của bạn đã đóng gói thành các câu hỏi đóng chưa?
    Một model ra quyết định không thể trả lời những câu hỏi vô định như "Làm sao để tăng doanh số?". Nó chỉ hoạt động khi bạn đưa ra câu hỏi đóng: "Đây là tin nhắn hỏi giá hay khiếu nại?", "Khách hàng này có thuộc danh sách nợ xấu không?". Nếu quy trình nội bộ của bạn chưa phân định được ranh giới giữa các bước, máy móc không thể chọn thay bạn.

    2. Ngưỡng chấp nhận sai sót của bạn ở mức nào?
    Ưu điểm lớn nhất của việc trả về phân phối xác suất và điểm tin cậy là bạn được quyền chủ động đặt ngưỡng. Nhưng ngưỡng bao nhiêu là an toàn thì không vendor nào quyết định thay bạn được. Với việc gán nhãn thư rác thông thường, ngưỡng tin cậy 0,8 có thể là đủ. Nhưng với phê duyệt hạn mức công nợ hay duyệt chiết khấu đặc biệt, bạn có thể cần ngưỡng trên 0,98. Những con số này bắt buộc phải được thử nghiệm và tinh chỉnh trên chính dữ liệu lịch sử của doanh nghiệp bạn.

    3. Khi máy không chắc, việc sẽ chuyển cho ai?
    Không có model nào chuẩn xác tuyệt đối. Một hệ thống vận hành bền vững cần biết dừng lại và chuyển giao cho người phụ trách khi tín hiệu không đủ chắc chắn, thay vì tự đưa ra hành động cuối cùng.

    Hành động tuần này: Rà lại luồng dữ liệu trước khi mua thêm công cụ

    Quan điểm của chúng tôi rất rõ ràng: Phần lớn các doanh nghiệp SME quy mô từ 20 đến 200 nhân sự chưa cần vội đăng ký danh sách chờ của Jev. Trừ khi doanh nghiệp của bạn đang có một mắt xích phân loại khối lượng lớn, chạy liên tục suốt ngày và việc chậm trễ hay nhầm lẫn ở bước đó đang gây thiệt hại thấy rõ.

    Thay vì tìm kiếm thêm các công cụ mới, việc thiết thực nhất bạn có thể làm trong tuần này là lấy ngẫu nhiên 100 tin nhắn hoặc yêu cầu gần nhất từ Zalo và email của khách hàng. Hãy đưa cho hai nhân viên vận hành độc lập gán nhãn thủ công (ví dụ: đâu là hỏi giá, đâu là khiếu nại). Nếu chính hai nhân sự của bạn còn tranh cãi xem một tin nhắn nên xếp vào đâu, thì không có model hay AI agent nào trên thị trường có thể xử lý mượt mà thay bạn được. Hãy chuẩn hoá câu hỏi nghiệp vụ trước, rồi mới chọn công cụ sau.

    The path forward

    Start with assessment, partnership, and one measured pilot.

    Talk to an expert