Hãy đưa cùng một trợ lý AI cho người làm tốt nhất và người yếu nhất của bạn, và bạn sẽ không nhận được hai phiên bản thu nhỏ của cùng một mức tăng. Bạn nhận được hai dấu ngược nhau. Trong một thí nghiệm thực địa ngẫu nhiên kéo dài năm tháng với 640 chủ doanh nghiệp nhỏ, những người vốn đã làm tốt và được cấp một cố vấn kinh doanh chạy trên GPT-4 đã tăng doanh thu và lợi nhuận khoảng 15%, trong khi những chủ doanh nghiệp vốn đã chật vật lại kết thúc thấp hơn nhóm đối chứng gần 10% (MIT Sloan Management Review, 2026). Cùng một công cụ. Cùng một khoảng thời gian truy cập. Cùng một lượng lời khuyên. Khoảng cách hiệu suất AI không thu hẹp — nó giãn rộng, và một phần của sự giãn rộng đó là thiệt hại thuần túy.
Kết quả này nên thay đổi một quyết định về thứ tự mà hầu hết Giám đốc Vận hành đang đưa ra ngay lúc này: ai được nhận copilot trước.
Vì sao khoảng cách hiệu suất AI giãn rộng thay vì khép lại
Nicholas Otis, Rowan Clarke, Solène Delecourt, David Holtz và Rembrand Koning đã phân ngẫu nhiên quyền truy cập một trợ lý GPT-4, được thiết lập để đóng vai cố vấn kinh doanh, cho 640 chủ doanh nghiệp Kenya điều hành quán ăn nhanh, trại gà, tiệm internet và các cơ sở nhỏ tương tự. Việc phân phối được thiết kế không ma sát một cách có chủ ý: một liên hệ trên WhatsApp — nền tảng mà khoảng 90% người Kenya vốn đã dùng — theo dõi trong năm tháng (Berkeley Haas, 2026). Nghiên cứu được công bố với nhan đề The Uneven Impact of Generative Artificial Intelligence on Entrepreneurial Performance (Management Science, 2026).
Thiết kế quan trọng hơn bối cảnh. Quyền truy cập được phân ngẫu nhiên, nên sự phân hóa không phải câu chuyện về ai tự nguyện tham gia. Công cụ giống hệt nhau ở cả hai nhánh. Khối lượng sử dụng không giải thích được sự phân kỳ. Điều tách biệt hai nhóm là những gì họ mang đến cho trợ lý và những gì họ làm với câu trả lời nhận được.
Hãy đọc điều đó như một điều kiện vận hành, không phải một chuyện lạ ở Nairobi. Biến số được kiểm định — một AI cố vấn đa năng có giúp được người mà phán đoán vốn đã chông chênh hay không — chính là biến số đang vận hành khi bạn trao copilot cho nhóm tứ phân vị thấp nhất của một đơn vị vận hành 200 người và gọi đó là nâng cao năng lực.
Bằng chứng "AI thu hẹp khoảng cách kỹ năng" là thật — và hẹp hơn bạn nghĩ
Câu chuyện san bằng không phải huyền thoại. Đó là một phát hiện về một lớp công việc cụ thể.
Brynjolfsson, Li và Raymond nghiên cứu 5.179 nhân viên hỗ trợ khách hàng trong quá trình triển khai theo đợt một trợ lý AI tạo sinh. Năng suất tăng 14% trung bình, với mức cải thiện 34% ở nhân viên mới và tay nghề thấp, và tác động tối thiểu lên nhóm giàu kinh nghiệm nhất (Quarterly Journal of Economics, 2025). Cơ chế: mô hình lan truyền cách làm của những nhân viên giỏi nhất và giúp người mới đi xuống đường cong kinh nghiệm nhanh hơn.
Hãy nhìn kỹ bản chất của công việc đó. Phạm vi có giới hạn. Một câu trả lời đúng đã tồn tại sẵn đâu đó trong công ty. Phản hồi tức thì từ khách hàng. Chất lượng được giám sát viên kiểm tra trong vài giờ. Trong những điều kiện ấy, một AI mã hóa các thực hành tốt ngầm sẽ nén phân phối lại — người yếu nhất hưởng lợi nhiều nhất vì khoảng cách giữa hành vi của họ và chuẩn đã được mã hóa là lớn nhất.
Giờ hãy đổi một biến: bỏ đi câu trả lời đúng đã biết. Hỏi mô hình một câu mở về định giá, tuyển dụng, hay nên chi khoản tiền tiếp theo vào đâu. Không có mục tiêu đã kiểm chứng để hội tụ về, không có giám sát viên khép vòng, không có tín hiệu tức thì rằng lời khuyên đã sai. Nén thôi không còn là mặc định. Khuếch đại tiếp quản.
Hiệu ứng san bằng là thuộc tính của các nhiệm vụ kiểm chứng được, không phải của công nghệ.
Biến điều tiết là phán đoán, không phải quyền truy cập hay kỹ năng viết prompt
Các tác giả nghiên cứu Kenya nói rõ về cơ chế: điều quyết định dấu của hiệu ứng là "liệu chủ doanh nghiệp có đủ phán đoán để phân biệt lời khuyên AI tốt với lời khuyên tồi hay không". Những người làm kém hơn đã làm theo lời khuyên chung chung hoặc gây hiểu lầm vì họ thiếu bộ lọc để bác bỏ nó (MIT Sloan Management Review, 2026).
Chi tiết hành vi bên dưới còn sắc hơn. Người làm tốt mang đến cho trợ lý những vấn đề xử lý được — câu hỏi có cấu trúc, nơi đầu ra của mô hình có thể đối chiếu với điều họ đã biết. Những chủ doanh nghiệp chật vật mang đến những vấn đề khó nhất, mơ hồ nhất họ có: đối thủ phá giá, hạn hán, cạn vốn lưu động. Đó là những câu hỏi mà cả AI lẫn một chuyên gia tư vấn đều không thể trả lời tốt từ bên ngoài doanh nghiệp (Berkeley Haas, 2026). Mô hình vẫn trả lời. Nó luôn trả lời. Lời khuyên chung chung — giảm giá, chi thêm cho quảng cáo — trôi chảy, nghe hợp lý, và phá hủy biên lợi nhuận khi được áp dụng mà thiếu phán đoán theo tình huống.
Vậy chuỗi nhân quả là: phán đoán yếu hơn → câu hỏi khó và mơ hồ hơn → câu trả lời chung chung hơn → tỷ lệ thực thi lời khuyên tồi cao hơn → thiệt hại đo được.
Hãy để ý điều không có trong chuỗi đó. Không phải quyền truy cập. Không phải khối lượng sử dụng. Không phải kỹ năng prompt engineering. Can thiệp mà phần lớn chương trình nâng cao năng lực bỏ tiền mua — thêm giấy phép, thêm đào tạo prompt — không tác động vào bất kỳ bước nào đã tạo ra tổn thất.
Đây cũng chính là hình dạng phát hiện của Dell'Acqua và cộng sự với 758 chuyên gia tư vấn BCG: trên 18 nhiệm vụ nằm trong biên năng lực của AI, các chuyên gia dùng AI hoàn thành nhiều hơn 12,2% nhiệm vụ, nhanh hơn 25,1%, với chất lượng cao hơn rõ rệt; còn ở một nhiệm vụ quản trị phức tạp được đặt có chủ ý ra ngoài biên đó, chuyên gia có AI hỗ trợ lại có xác suất đưa ra lời giải đúng thấp hơn 19% so với người hoàn toàn không dùng AI (Harvard Business School, 2023). Hai nghiên cứu, hai quần thể khác nhau, cùng một cấu trúc: thiệt hại xuất hiện khi đầu ra đầy tự tin gặp một người dùng không thể đánh giá nó.
Vì sao bản năng "cứu người yếu trước" bị đảo ngược
Đây là quyết định mà tất cả những điều trên định khung lại.
Nước đi trực giác — nước đi xuất hiện trong hầu hết kế hoạch nâng cao năng lực — là đưa công cụ AI trước cho những người đang chật vật. Nó nghe công bằng, nghe hiệu quả, và mượn uy tín từ kết quả ở trung tâm chăm sóc khách hàng. Nâng đáy lên, khép khoảng cách, bỏ túi mức trung bình.
Với công việc tư vấn mở, thứ tự đó bị đảo ngược. Bạn đang trao một cỗ máy lời khuyên không qua bộ lọc cho đúng nhóm ít được trang bị nhất để lọc nó, và bằng chứng thực địa nói rằng giá trị kỳ vọng là âm, chứ không chỉ nhỏ.
Chi phí phải trả hai lần. Lần đầu ở thiệt hại trực tiếp: những quyết định tệ hơn so với khi không có trợ giúp. Lần thứ hai ở việc quy kết. Khi thí điểm cho ra một con số tổng hợp bằng phẳng hoặc âm, kết luận rút ra thường là "công cụ này không hợp với chúng ta", và chương trình chết. Công cụ vận hành tốt với nhóm biết dùng nó. Cái thất bại là thiết kế triển khai, và không ai đo ở mức chi tiết đủ để nhìn thấy điều đó.
Số trung bình che giấu sự đảo dấu. Nếu thí điểm của bạn chỉ báo một con số gộp, nó không thể cho biết bạn đã giúp được ai hay chưa.
Cần thay đổi gì trong triển khai quý này
Giới hạn việc dùng AI kiểu tư vấn mở cho những người có phán đoán chuyên môn đã được chứng minh
Việc dùng kiểu tư vấn mở — câu hỏi chiến lược, quyết định giá, xếp thứ tự ưu tiên, bất cứ điều gì mà câu trả lời của mô hình không thể đối chiếu với một mục tiêu đã biết — nên giới hạn cho những người đã có phán đoán chuyên môn để bác bỏ một câu trả lời tồi. Đó là cổng năng lực, không phải cổng thâm niên: nhân viên mười năm chưa từng chịu trách nhiệm một bảng lãi lỗ không tự động qua cổng; chuyên viên phân tích hai năm mà dự báo luôn trúng thì qua.
Giao cho nhóm tứ phân vị yếu công việc hẹp, kiểm chứng được, sau một cổng rà soát
Chính những người bị tổn hại bởi cách dùng tư vấn mở lại là những người hưởng lợi nhiều nhất từ các nhiệm vụ có giới hạn với đầu ra kiểm tra được — đúng những điều kiện đã tạo ra mức tăng 34% cho người mới trong nghiên cứu hỗ trợ khách hàng. Soạn thảo theo mẫu, tóm tắt một tài liệu đã biết, phân loại vòng đầu, trích xuất dữ liệu có cấu trúc. Hãy thêm một cổng rà soát của con người có thẩm quyền bác bỏ, chứ không chỉ đóng dấu. Đó mới là cấu hình mà AI thực sự san bằng.
Đo tác động theo tứ phân vị hiệu suất, không đo gộp
Hãy thiết lập thí điểm sao cho chỉ số kết quả được tách theo tứ phân vị hiệu suất trước đó, ngay trước khi triển khai bắt đầu. Nếu chỉ nhìn mức trung bình gộp, +15% ở tứ phân vị trên và −10% ở tứ phân vị dưới sẽ triệt tiêu nhau thành một con số đủ gần 0 để bạn kết luận rằng chẳng có gì xảy ra — và bạn đã trả giá cho thiệt hại mà không hề nhìn thấy nó.
Thay đổi nội dung đào tạo
Đào tạo prompt dạy người ta lấy được đầu ra trôi chảy hơn. Nó không dạy họ bác bỏ đầu ra trôi chảy nhưng sai. Điều bằng chứng đòi hỏi là đào tạo đánh giá: một câu trả lời tốt trong lĩnh vực này trông như thế nào, các kiểu lỗi đã biết của mô hình là gì, và — hữu ích nhất nhưng ít được dạy nhất — câu hỏi nào nên đưa cho mô hình và câu hỏi nào nên đưa cho một con người.
Phản biện đáng được xem xét nghiêm túc
Phản biện trung thực: các hộ kinh doanh siêu nhỏ ở Kenya không phải nhân sự vận hành của một doanh nghiệp tầm trung, và một bot tư vấn trên WhatsApp không phải triển khai cấp doanh nghiệp có truy xuất tài liệu nội bộ, quy trình xác định và dấu vết kiểm toán. Cả hai đều đúng. Độ lớn của hiệu ứng sẽ không chuyển nguyên vẹn.
Nhưng cơ chế không nằm ở bối cảnh. Nó nằm ở tương tác giữa câu hỏi mở, đầu ra tự tin và người đánh giá không thể kiểm chứng. Mọi triển khai doanh nghiệp đặt một trợ lý đa năng trước mặt nhân viên và mời họ hỏi bất cứ điều gì đều tái tạo đủ ba điều kiện đó. Neo mô hình vào dữ liệu của chính bạn sẽ thu hẹp bề mặt lỗi; nó không đóng được bề mặt ấy, và còn khiến những câu trả lời sai nghe có thẩm quyền hơn về mặt tổ chức khi chúng xuất hiện.
Lập trường có thể bảo vệ được không phải là "điều này sẽ xảy ra với chúng ta ở cùng mức độ". Mà là "chúng ta chưa hề đo xem nó có đang xảy ra hay không" — điều mà, với phần lớn thí điểm tầm trung chỉ báo một con số năng suất gộp, đơn giản là chính xác.
Quyết định trên bàn của bạn
Khoảng cách hiệu suất AI không phải một vấn đề công bằng để giải quyết sau. Đó là một tham số thiết kế mà bạn đang đặt ngay lúc này, một cách mặc định, mỗi lần bạn quyết định ai được cấp quyền tiếp theo.
Trước khi đợt giấy phép kế tiếp được phát đi, hãy tách đôi việc triển khai: dùng kiểu tư vấn mở cho những người mà bạn vốn đã tin vào phán đoán của họ trong một căn phòng không có công cụ; nhiệm vụ hẹp, kiểm chứng được sau cổng rà soát cho tất cả những người còn lại — và một chỉ số duy nhất, báo cáo theo tứ phân vị hiệu suất, để bạn biết mình đã đúng về nửa nào.