IOSG: Từ tăng điểm đến trả tiền, ảo tưởng về nhu cầu của Model Fusion
Tác giả: Yiping & David @ IOSG
Bài viết này chỉ dành cho mục đích học tập và giao tiếp và không mang tính chất tư vấn đầu tư. Vui lòng ghi rõ nguồn khi in lại và liên hệ với nhóm IOSG để nhận được ủy quyền và hướng dẫn in lại. Tất cả các dự án được đề cập trong bài viết không phải là khuyến nghị hay lời khuyên đầu tư.
Mô hình Fusion là gì?
Vào tháng 6 năm 2026, thị trường AI chứng kiến hai sản phẩm có tên “Fusion” ra mắt trong vòng chưa đầy ba tuần.
Vào ngày 12 tháng 6, OpenRouter đã phát hành Fusion Router, có tựa đề Vượt qua hiệu suất biên giới với Fusion. Trong đánh giá nghiên cứu chuyên sâu về DRACO, nhóm mô hình gồm Fable 5 và GPT-5.5 đạt 69,0 điểm, vượt 65,3 điểm của mô hình đơn Fable 5. Điểm bán hàng mà OpenRouter đưa ra rất đơn giản: khi một mô hình duy nhất không đủ tốt, hãy để nhiều mô hình trả lời cùng một câu hỏi, sau đó các mô hình đánh giá sẽ so sánh và tổng hợp.
Vào ngày 29 tháng 6, Cognition đã phát hành Devin Fusion nhưng tựa đề là Hiệu suất vượt trội với chi phí thấp hơn 35%. Thay vì để nhiều mô hình lặp lại toàn bộ nhiệm vụ, nó cho phép mô hình tiên tiến đảm nhiệm việc lập kế hoạch và phán đoán, giao việc thử nghiệm, sửa đổi cơ học, v.v. cho người bạn phụ rẻ hơn và chuyển đổi linh hoạt các mô hình trong quá trình thực hiện.
Cùng một từ chỉ ra hai nhóm logic kinh tế trái ngược nhau. OpenRouter mua mức trần cao hơn với nhiều điện toán hơn; Nhận thức quản lý để giảm chi phí tính toán tốn kém trong khi vẫn duy trì chất lượng. Sự tương phản này minh họa vấn đề tốt hơn bất kỳ danh sách xếp hạng mô hình nào. Đề xuất kỹ thuật của phản ứng tổng hợp mô hình đúng: nhiều lần thử có cơ hội vượt quá một lần. Nhưngđiều thị trường thực sự khen thưởng không phải là "nhiều cuộc gọi mẫu hơn", mà là ai có thể chi tiêu ít hơn và giao hàng nhanh hơn sau khi đáp ứng ngưỡng chất lượng.
▲ Hình 1: Hai cuộc kết hợp trong cùng một tháng
Bài viết này giới hạn Model Fusion ở một kiến trúc hẹp hơn:Nhiều mô hình trả lời song song cùng một nhiệm vụ, kết quả so sánh mô hình được xem xét và cuối cùng một mô hình đưa ra câu trả lời. Devin Fusion không thuộc định nghĩa này, nó giống hơn
Gần định tuyến động và phân công nhiệm vụ. Lý do tôi đặt nó ngay từ đầu là vì thị trường đang sử dụng "Fusion" như một thuật ngữ chung cho tất cả các dàn nhạc đa mô hình và các sản phẩm thực sự hiệu quả thường rời xa sự kết hợp mô hình hẹp.
Nhận định của chúng tôi nghiêng về phía bi quan:Model Fusion là một hợp đồng bảo hiểm chất lượng đắt tiền. Nó có thể cải thiện hiệu suất tuyệt đối của một số nhiệm vụ nhất định, nhưng hiếm khi thực sự đẩy ranh giới hiệu quả về chi phí-chất lượng-độ trễ ra bên ngoài. Có rất ít nhiệm vụ thực sự đáng mua bảo hiểm này. Nó vẫn ở đây, nhưng nhiều khả năng nó là một tính năng được kích hoạt tần suất thấp hơn là kiến trúc mặc định và khó trở thành một danh mục độc lập hơn.
Các tùy chọn hiện tại cho mô hình là gì?
Discuss Fusion có thể dễ dàng được đưa vào bảng xếp hạng chính xác nhưng các công ty không mua thứ hạng. Doanh nghiệp mua kết quả đủ tiêu chuẩn cho một nhiệm vụ, đồng thời tính toán giá cả, độ trễ, quyền riêng tư và tính ổn định. Miễn là mẫu giá rẻ đã có
Vượt qua ranh giới chấp nhận của doanh nghiệp, việc tiếp tục trả tiền cho "thông minh hơn" có thể không có ý nghĩa kinh tế. Hiệu quả chi phí là mục tiêu chính thực sự của thị trường mẫu mã.
▲ Hình 2: Mô hình thông minh và chi phí nhiệm vụ đơn, trục hoành là thang logarit
Điều đáng chú ý nhất về biểu đồ không phải là điểm cao nhất ở góc trên bên phải mà là những điểm đi chệch khỏi xu hướng sức mạnh giá: chúng cung cấp đủ năng lượng ở mức giá thấp hơn và có hiệu quả vượt trội đối với một khối lượng công việc cụ thể. Chỉ số toàn diện không thể trả lời trực tiếp cái nào
Mô hình này phù hợp nhất để đánh giá mã, nghiên cứu của Trung Quốc hoặc triển khai theo quy định, nhưng nó chỉ ra một hướng:Nguồn cung cấp mô hình đang trở thành hàng hóa và "mô hình mạnh nhất" và "sự lựa chọn tốt nhất" đang tách biệt.
Đối mặt với khoảng cách chất lượng tương tự, hiện có bốn phương thức mua chính trên thị trường.
Đầu tiên là trực tiếp nâng cấp lên một mẫu máy mạnh hơn. Đây là cách đơn giản và dễ kiểm tra nhất; miễn là mức tăng giá biên của mẫu cao cấp thấp hơn chi phí sửa lỗi hoặc làm lại thì mẫu đó thường vẫn được ưa chuộng hơn. Thứ hai là thêm tính toán thời gian thử nghiệm trên cùng một mô hình, chẳng hạn như suy luận mở rộng, tự thống nhất hoặc lấy mẫu nhiều lần. Thứ ba là định tuyến, phân tầng và phân công nhiệm vụ: bắt đầu với các mô hình giá rẻ cho các bộ phận cơ khí hoặc có thể kiểm chứng và chỉ nâng cấp khi bạn gặp khó khăn. Loại thứ tư là Model Fusion theo nghĩa hẹp: nhiều mô hình được phép trả lời lặp đi lặp lại cùng một câu hỏi, sau đó câu trả lời cuối cùng được hình thành thông qua việc xem xét và mô hình toàn diện.
Bốn phương pháp này có thể "đánh đổi nhiều phép tính để lấy chất lượng", sự khác biệt nằm ở chỗ các phép tính được thực hiện ở đâu. Việc mở rộng mô hình đơn lẻ mang lại khả năng suy luận sâu hơn, định tuyến giúp phân bổ tài nguyên chính xác hơn và Fusion mua nhiều câu trả lời ứng viên hơn. Ba phương pháp đầu tiên tập trung ngân sách vào các lĩnh vực có nhiều khả năng thay đổi kết quả nhất; Fusion trả tiền cho những ý kiến trùng lặp trước tiên và sau đó đánh cược rằng mô hình đánh giá có thể tìm ra những khác biệt hiệu quả. Các mẫu ứng viên chỉ mang đủ thông tin độc lập và người đánh giá có thể xác định được thông tin này.
Hợp nhất có thể hoạt động tốt hơn ba tùy chọn đầu tiên.
Việc định tuyến đã chứng minh rằng sự khác biệt về khả năng giữa các mô hình trước hết là cơ hội lập kế hoạch. RouteLLM đã giảm chi phí hơn 2 lần trong một số đánh giá mà không làm giảm chất lượng; Switchcraft đã giảm được 84% chi phí với độ chính xác là 82,9% và theo tính toán của bài báo, nó có thể tiết kiệm hơn 3.600 USD cho mỗi triệu yêu cầu. Kết quả vẫn cần được nhân rộng trên lưu lượng truy cập của chính doanh nghiệp, nhưng logic kinh tế rất đơn giản:Thay vì có nhiều mô hình họp, chỉ cần giao từng nhiệm vụ cho mô hình đủ điều kiện rẻ nhất.
Điều này có nghĩa làthị trường trước tiên sẽ giải quyết những thiếu sót về chất lượng bằng các nâng cấp, định tuyến và xác minh; chỉ khi những cách tiếp cận này vẫn chưa đủ thì việc mua thêm các câu trả lời ứng cử viên cho Fusion mới là hợp lý.
Tại sao điểm tăng không có giá trị bằng nhau?
Vì Fusion phải vượt quaba ngưỡng cùng một lúc: chất lượng gia tăng phải bù đắp những chi phí và sự chậm trễ mới, các mô hình ứng viên phải cung cấp thông tin độc lập và người đánh giá phải liên tục xác định các câu trả lời tốt hơn. Nếu bất kỳ yếu tố nào trong số đó không được thiết lập thì sự cải thiện điểm số không thể được chuyển đổi thành giá trị sản xuất.
Tính toán chi phí: Cần thêm bao nhiêu ngân sách và thời gian chờ?
Việc tăng điểm của Fusion trước hết là một khoản chi phí điện toán nhất định. OpenRouter gọi song song nhiều mô hình bảng điều khiển và các mô hình xem xét và tổng hợp sẽ tạo ra câu trả lời. Ba nhóm so sánh của DRACO đều cải thiện điểm số: Fable 5 + GPT-5.5 tăng từ 65,3 lên 69,0; Tự hợp nhất Opus 4.8 tăng từ 58,8 lên 65,5; và nhóm ba mẫu giá rẻ tăng từ 60,3 lên 64,7.
Tuy nhiên, sự cải thiện về khả năng tự kết hợp của Opus lớn hơn, cho thấy rằng lợi ích có thể đến từ việc tìm kiếm và lấy mẫu bổ sung thay vì bổ sung kiến thức giữa các mô hình. Một so sánh công bằng nên so sánh tính tự nhất quán, suy luận dài hơn và các mô hình đơn lẻ mạnh mẽ trong cùng một ngân sách mã thông báo. Nghiên cứu hiện tại cũng cho thấy hiệu suất đa tác nhân cải thiện tới 7,1 điểm phần trăm với khối lượng tính toán gấp khoảng 20 lần; khi ngân sách bằng nhau, tranh luận và Hỗn hợp các tác nhân chỉ cao hơn 1,3 và 2,7 điểm phần trăm so với tính tự thống nhất. Một nghiên cứu về mã thông báo lý luận bình đẳng khác cho thấy tác nhân đơn lẻ bằng hoặc tốt hơn. Nhiều "lợi ích hợp tác" sẽ biến mất sau khi các tài khoản tính toán được căn chỉnh.
▲ Hình 3: Cải tiến cơ bản của OpenRouter và giá thành sản phẩm
Chi phí của bảng điều khiển 3 mô hình mặc định của OpenRouter là khoảng 4-5 lần và chậm hơn 2-3 lần, nhưng mã thông báo hoàn chỉnh, chi phí và độ trễ của mỗi cấu hình DRACO không được tiết lộ, khiến không thể đánh giá liệu cải tiến 3,7 điểm có đáng giá hay không. Chỉ có 100 nhiệm vụ tiếng Anh văn bản đơn giản trong quá trình đánh giá và chỉ có 93 cấu hình liên quan đến Truyện ngụ ngôn được hoàn thành; việc thay đổi mô hình đánh giá có thể làm điểm tuyệt đối tăng thêm 10-25 điểm phần trăm. Điều đó chứng tỏ rằng Fusion cải thiện điểm số chứ không phải Fusion cải thiện ROI sản xuất.
Các cuộc gọi có chọn lọc chỉ có thể làm giảm chi phí. Theo ước tính được OpenRouter tiết lộ, khi tỷ lệ kích hoạt là 1% thì chi phí tổng thể là khoảng 1,03-1,04 lần; khi là 10% thì gấp 1,30-1,40 lần; khi ở mức 25% đã đạt 1,75-2,00 lần.
▲ Hình 4: Tính kinh tế tổng thể của việc gọi Fusion có chọn lọc
Yêu cầu khó nhất rất có thể sẽ kích hoạt Fusion, nhưng hệ thống phải đợi thành viên hội đồng chậm nhất hoàn thành việc xem xét và tạo hàng loạt, do đó, độ trễ ở phần đuôi tập trung vào các nhiệm vụ có giá trị nhất. Cuộc gọi của nhiều nhà cung cấp cũng làm tăng khả năng xảy ra lỗi, độ phức tạp trong kiểm tra và khả năng bảo mật. Chi phí của Fusion không chỉ là giá API mà còn là thời gian chờ đợi và rủi ro hệ thống gia tăng.
Tính bổ sung thông tin: Nhiều mô hình có thực sự cung cấp thông tin khác nhau không?
Giá trị của Fusion phụ thuộc vào việc liệu các mô hình ứng cử viên có mang lại thông tin độc lập hay không, nhưng các mô hình khác nhau thường chia sẻ nội dung đào tạo, nguồn trang web và cơ sở giả. Trong các nhiệm vụ nghiên cứu, điều này có thể dẫn đến "rửa trích dẫn": nhiều mô hình được truy tìm đến cùng một nguồn nhưng được đóng gói dưới dạng nhiều bằng chứng độc lập. Nếu hệ thống không giữ lại đường dẫn tìm kiếm và xuất xứ ở cấp độ yêu cầu,khi số lượng mô hình tăng lên, chi phí API sẽ tăng gần như tuyến tính nhưng tính đa dạng của bằng chứng không nhất thiết phải tăng.
Người đồng sáng lập và Giám đốc điều hành KAIKAKU.AI Josef Chen đã nghiên cứu 67 mô hình từ 21 nhà cung cấp dịch vụ trong bài báo năm 2026 của ông Khi nào việc kết hợp các mô hình ngôn ngữ có ích? Trong nhiệm vụ toán học mở, xác suất dự đoán của tất cả các mô hình trả lời sai cùng lúc là 2,3%, nhưng xác suất đo được đạt 5,2% - gấp khoảng 2,3 lần giá trị dự đoán; tỷ lệ thất bại phổ biến đối với tác vụ mã được tính điểm và phiên bản phản hồi miễn phí của GPQA-Diamond tiếp tục tăng lên 7,9% và 12,7%
Chuyển sang 100 câu hỏi GPQA-Diamond sẽ có khoảng 13 câu hỏi mà tất cả các mẫu ứng viên sẽ cùng trả lời sai và sẽ không có câu trả lời đúng để bình chọn, xét duyệt hoặc tổng hợp. Sự khác biệt giữa các mô hình ở những câu hỏi dễ sẽ khuếch đại giá trị của sự kết hợp và ở những câu hỏi đuôi cần bảo hiểm nhất, chúng có thể cùng thất bại.
Độ tin cậy của phán đoán: Hệ thống có thể xác định và tổng hợp các câu trả lời tốt hơn không?
Ngay cả khi câu trả lời của ứng viên mang tính bổ sung, giá trị vẫn phụ thuộc vào đánh giá. Khi các ứng viên nhất quán, người đánh giá có thể nhầm lẫn các lỗi liên quan với độ tin cậy cao;khi các ứng viên khác nhau thì người đánh giá phải có đủ chuyên môn để chọn đúng. Các mô hình tích hợp cũng có thể xóa bỏ các ý kiến phê phán thiểu số hoặc biến những bất đồng thực sự thành kết luận chắc chắn.
Trong các tác vụ viết mã, trình biên dịch, kiểm tra và phân tích tĩnh thường đáng tin cậy hơn ý kiến mô hình khác; trong các nhiệm vụ sáng tạo, việc xem xét và tổng hợp có thể dễ dàng biến những khác biệt thành những câu trả lời trung bình. Mô hình đánh giá sẵn có mạnh nhất trong LitBench chỉ phù hợp 73% với sở thích viết sáng tạo của con người. Khi các nhiệm vụ đã có trình xác nhận bên ngoài rẻ tiền hoặc bản thân “sự tốt đẹp” dựa trên các đánh giá chủ quan, thì rất khó để chuyển điểm của Fusion thành giá trị phải trả.
Ai sẽ trả tiền cho Fusion?
Nhu cầu về Fusion phụ thuộc vào hai ngưỡng: liệu nhiệm vụ có thể hưởng lợi từ nhiều mô hình hay không và liệu lợi ích này có đủ để đảm bảo thanh toán liên tục hay không. Cái trước là vấn đề kỹ thuật, cái sau là vấn đề thị trường.
Từ ứng dụng kỹ thuật đến thành lập nền kinh tế
Xác suất Fusion sẽ sửa lỗi × khả năng tránh được việc mất một lỗi duy nhất phải lớn hơn chi phí API mới, độ trễ, độ phức tạp trong vận hành và bảo trì cũng như rủi ro về quyền riêng tư.
Điểm chuẩn không thể trả lời câu hỏi lãi lỗ này. Việc kết hợp chỉ có thể thực hiện được nếu chi phí xảy ra lỗi cao, các mô hình ứng viên cung cấp đường dẫn tìm kiếm bổ sung, thiếu trình xác thực bên ngoài rẻ hơn và doanh nghiệp có thể chấp nhận độ trễ bổ sung cũng như rủi ro của nhà cung cấp; kết quả cuối cùng vẫn phải được xác nhận bởi con người hoặc bằng chứng bên ngoài.
▲ Hình 5: Từ thích ứng kỹ thuật đến nhu cầu bền vững
Chủ yếu đáp ứng các điều kiện này lànghiên cứu có giá trị cao và thẩm định, đánh giá kiến trúc và bảo mật cũng như "ý kiến thứ hai" trước các quyết định không thể thay đổi được. Điểm chung của chúng là các ràng buộc không đầy đủ, chi phí bỏ sót cao và bản thân một ý tưởng độc lập khác cũng có giá trị. Ngược lại,mã thông thường, ứng dụng tiêu dùng thời gian thực, quy trình làm việc có hiệu suất cao và biên độ thấp và các tác vụ có thể được xác minh trực tiếp bằng các thử nghiệm hoặc quy tắc thường không yêu cầu Fusion. Các cơ quan quản lý cũng có thể từ chối bảng điều khiển của nhiều nhà cung cấp do ranh giới dữ liệu và yêu cầu kiểm tra.
Từ sự sẵn sàng chi trả đến nhu cầu bền vững
Hữu ích về mặt kỹ thuật có thể mang lại mức độ sẵn sàng chi trả cao nhưng điều đó không có nghĩa là nhu cầu có thể mở rộng. Để tạo ra nhu cầu bền vững, chi phí sai sót phải có thể định lượng được, các nhiệm vụ phải được lặp lại, phải có chủ sở hữu ngân sách rõ ràng trong tổ chức và Fusion phải luôn hoạt động tốt hơn các chuyên gia con người, các mô hình đơn lẻ mạnh mẽ và xác thực bên ngoài. Nhưng ngân sách thẩm định có xu hướng dành cho các nhà phân tích và các nguồn đáng tin cậy, ngân sách bảo mật có xu hướng dành cho các cuộc kiểm toán chuyên nghiệp và các quyết định không thể thay đổi được rất hiếm khi xảy ra.
Do đó, chúng tôi không lạc quan về những công ty chỉ thực hiện trình bao bọc đa mô hình, chạy bảng điều khiển theo mặc định hoặc sử dụng thuật toán lựa chọn mô hình tĩnh làm hào. API kết nối rất dễ sao chép và chiến lược cố định sẽ nhanh chóng trở nên không hợp lệ khi khả năng của mô hình và giá cả thay đổi; nếu bạn không biết lỗi đó có giá trị bao nhiêu và Fusion thực sự sửa nó bao nhiêu lần, bạn không thể định giá bảo hiểm này. Giá trị có nhiều khả năng được nắm bắt bởi những người sở hữu kết quả thực tế: nền tảng cổng và đại lý, ứng dụng dọc, chủ sở hữu quy trình làm việc cũng như các sản phẩm đo lường và quan sát. Họ biết cái giá phải trả của sai sót, có thể quan sát hậu quả và có thể tối ưu hóa các chiến lược kích hoạt. Điều thực sự khó để tái tạo không phải là danh sách bảng điều khiển, mà là biết khi nào không nên gọi Fusion.
Xác minh thị trường
Thị trường đại chúng vẫn chưa đủ lớn để đánh giá quy mô nhu cầu về Fusion, nhưng có thể thấy nó sẽ được sử dụng như thế nào. Hội đồng mô hình Perplexity chỉ dành cho người dùng Max và người dùng Enterprise Max có chi phí 200 USD mỗi tháng. Người dùng chọn thủ công ba mô hình trên trang web để nghiên cứu đầu tư, ra quyết định phức tạp và xác minh thông tin; các trường hợp người dùng công cộng bao gồm việc tích hợp Hội đồng mô hình vào quy trình nghiên cứu chứng khoán thông qua tự động hóa trình duyệt. Hermes Mixture of Agents biến Fusion thành một mô hình ảo tùy chọn trong tác nhân: người dùng chỉ có thể nâng cấp một vấn đề khó thông qua /moa hoặc có thể kích hoạt liên tục trong các phiên phức tạp, với nhiều mô hình tham chiếu cung cấp phân tích, sau đó trình tổng hợp gọi công cụ và hoàn thành nhiệm vụ. Hermes sau đó đã giảm tần suất phân xuất mặc định và sử dụng lại vòng ý kiến mô hình trước đó để kiểm soát chi phí. Những trường hợp này cho thấy nhu cầu thực sự của Fusion tập trung vào các nhiệm vụ khó khăn với tần suất thấp như nghiên cứu, gỡ lỗi, đánh giá và ra quyết định quan trọng. Phương pháp sử dụng thông thường là chủ động nâng cấp sau khi một mẫu máy gặp phải nút thắt cổ chai, thay vì quy trình tự động tần số cao được bật theo mặc định. Bằng chứng hiện có chứng minh rằng nhu cầu này tồn tại, nhưng thông tin công khai vẫn chưa đủ để đánh giá liệu nó có thể hình thành một thị trường trả phí độc lập và quy mô lớn hay không.
Tương lai của Fusion
Giá suy luận giảm về mặt bề ngoài là tốt cho Fusion, nhưng nó cũng sẽ đồng thời giảm chi phí của các mô hình đơn lẻ, định tuyến và xác minh bên ngoài mạnh mẽ. Sự kết hợp không cạnh tranh cho một mô hình của ngày hôm qua mà để cạnh tranh với các đường cơ sở phối hợp và mô hình đơn thế hệ tiếp theo.
Devin Fusion của Cognition cho thấy cuộc cạnh tranh này đang hướng tới đâu: Hãy để những mẫu đắt tiền tự phán xét và để những công việc cơ khí có thể kiểm chứng được cho những mẫu rẻ hơn. Trong thử nghiệm tự kiểm tra của nhà sản xuất, điểm tổng thể của Fusion + Fable 5 tăng nhẹ từ 57,0 lên 57,6 và chi phí trung bình giảm từ 5,12 USD xuống 3,00 USD; tuy nhiên, trong 5 trường hợp được công bố, chi phí giảm 25%-62%, trong khi điểm nhiệm vụ dao động trong khoảng từ +12 đến -27. Khả năng tái cấu trúc ES6 với ranh giới rõ ràng và thử nghiệm đầy đủ đã tăng từ 98 lên 100; Chức năng phản ứng/Redux dựa trên sự hiểu biết tương tác và các yêu cầu tiềm ẩn đã giảm từ 54 xuống 27 khi được ủy quyền không chính xác.
▲ Hình 6: Điểm và chi phí nhiệm vụ của Devin Fusion
Đây là những trường hợp được các nhà sản xuất lựa chọn và không đại diện cho sự phân phối tổng thể, nhưng quan điểm rất rõ ràng: Khả năng cốt lõi của các hệ thống đa mô hình trong tương lai không phải là gọi thêm mô hình mà là vẽ ra ranh giới suy thoái chính xác. Các nhiệm vụ cơ học và có thể xác minh được có thể được giao cho các mô hình giá rẻ, trong khi các nhiệm vụ đòi hỏi nhiều khả năng phán đoán phải được giao cho các mô hình tiên tiến. OpenRouter bán "nhiều thông tin hơn" và Cognition bán "cùng thông tin, chi phí thấp hơn"; đề xuất thứ hai gần với định hướng dài hạn hơn. Một hệ thống càng gần với kinh tế sản xuất thì nó càng ít giống Model Fusion theo nghĩa hẹp mà càng giống với việc định tuyến, ủy quyền và xác nhận.
Vào cuối tháng 7, các phương tiện truyền thông đưa tin rằng Stripe đang đàm phán để mua lại OpenRouter với giá xấp xỉ 10 tỷ USD, một thỏa thuận vẫn chưa được xác nhận. Tín hiệu này không nên được hiểu là Fusion đã được thị trường xác nhận: giá trị cốt lõi của OpenRouter không phải là một bảng điều khiển nhất định mà là một lớp gọi trung lập kết nối hơn 5 triệu nhà phát triển với hơn 400 mô hình. Stripe đã cung cấp khả năng kiểm soát thanh toán, thuế và rủi ro cho OpenRouter, đồng thời cho phép các nhà phát triển trực tiếp tạo tài khoản, lấy khóa API và kết nối thanh toán thông qua Stripe Projects. Những gì Stripe thực sự có thể mua là một cổng giao dịch để suy luận AI: OpenRouter xử lý việc lựa chọn mô hình, sử dụng mã thông báo và chi phí, trong khi Stripe xử lý việc định giá, lập hóa đơn và thanh toán. Điều này cung cấp tín hiệu thị trường cho phán đoán giá trị được đề cập ở trên: giá trị trong kỷ nguyên đa mô hình có nhiều khả năng vẫn nằm trong lớp điều phối có thể quan sát các nhiệm vụ, phân bổ cuộc gọi và giải quyết hoàn tất, và Fusion chỉ là một chiến lược nâng cấp chi phí cao trên đó.
Các hệ thống đa mô hình trong tương lai sẽ không triệu tập các hội đồng theo mặc định mà trước tiên sẽ ước tính độ khó của nhiệm vụ, chi phí xác minh và tổn thất do lỗi; chỉ khi các mô hình đơn mạnh hơn, suy luận mở rộng và các công cụ bên ngoài vẫn chưa đủ, chúng mới tham gia tìm kiếm phân kỳ đa mô hình. Tỷ lệ kích hoạt, tỷ lệ thành công gia tăng và chi phí cho mỗi kết quả được xác minh là những số liệu sản phẩm có ý nghĩa. Sự kết hợp sẽ vẫn là một tính năng tần suất thấp thay vì trở thành kiến trúc mặc định hoặc một danh mục riêng biệt.
