I

Inference

用於 LLM 推斷的分散式 GPU 集群

表现

RD 熱度指數

7746.23% (24h)
0100200300400500
項目排名: 105/15416

RD 增長指數

4671.43% (24h)
0400800120016002000
項目排名: 576/15416

比較

募款

跟隨更新

跟隨列表

人物

關於Inference

Inference.net 營運一個專門用於 LLM 推理的分散式 GPU 叢集,提供隨需應變的運算資源,無需長期合約。其核心業務是提供同步、批次與非同步推理模式,其中非同步模式透過利用閒置 GPU 容量,定價約為同步費率的 10%。該平台還包含 Catalyst,這是一套用於可觀測性、評估與微調的工具組,並輔以 CLI 工具以實現工作流程自動化。 其競爭優勢在於透過閒置容量利用來降低成本,以及結合追蹤、評估與模型調整的統一工作流程。其核心論述是讓 LLM 推理盡可能經濟且高效,尤其針對高吞吐量或延遲容忍度較高的工作負載。市場痛點十分明確:GPU 成本仍然過高,業界平均利用率僅 15-40%,且現有工具分散於不同供應商。 在過去六個月(2026-03-01 至 2026-09-01),Inference.net 於 3 月推出 Catalyst 平台,4 月推出 CLI,5 月推出非同步請求,7 月新增微調功能,並於 8 月開源部分元件。一項值得注意的負面消息是:2025 年,部分用戶回報 GPU 供應波動導致推理延遲飆升,但此情況並不普遍。

更新時間: 2026-09-01

Inference 成立於 2023 年,總部位於舊金山,專注於為大型語言模型推論與客製模型訓練建構分散式 GPU 基礎設施。2025 年 10 月,該公司完成由 Multicoin Capital 與 a16z CSX 領投、Topology Ventures、Founders, Inc. 及多位天使投資人參與的 1,180 萬美元種子輪融資。這筆資金將協助其實現使命:透過部署較小、專注特定任務的模型,以顯著更低的成本與延遲達成同等效能,幫助 AI 原生企業減少對前沿實驗室的依賴。Inference 的平台支援端到端模型生命週期管理,涵蓋訓練、部署、監控與評估,並號稱相較於通用 API 可降低高達 90% 的成本,且推論速度提升 2 至 3 倍。該公司瞄準生產環境工作負載,提供可在客戶控制環境中運行的基礎設施以保障資料隱私。這輪種子融資標誌著驗證特定推論基礎設施市場的重要里程碑,使 Inference 得以在快速演進的 AI 基礎設施層中競爭。

更新時間: 2026-09-01

Inference(inference.net)在過去六個月(2026年3月1日至2026年9月1日)取得了顯著進展,官方公告與產品發布即為明證。 關鍵發展包括推出AutoEvals,這是一款利用生產流量自動評估與比較LLM表現的工具,能實現數據驅動的模型選擇。該平台也發布了Schematron V2,這是一系列專為HTML轉JSON提取設計的模型,相較前代版本提供了更高的準確度與吞吐量(單張H100上每秒4.14個請求)。值得注意的是,與Gravity Ads的客戶案例顯示,透過在生產數據上微調一個1B模型來取代通用的70B模型,推理成本降低了10倍,p99延遲改善了5.7倍。 展望未來,Inference的官方路線圖強調深化其持續改進循環:擴大使用生產數據進行自動化訓練與評估,強化Catalyst平台以實現端到端模型生命週期管理,並開發Schematron Pro以在維持吞吐量的同時達到更高的提取品質。該公司也致力於使其訓練循環更具成本效益且更易於使用,計劃進一步縮短即時流量與模型改進之間的距離。

更新時間: 2026-09-01

Sam Heutmaker(創辦人兼執行長):曾創立多家新創公司,包括Leap(技術長,用戶規模達12萬)和Ultramail(共同創辦人,用戶規模達10萬)。曾任Crowe資深軟體工程師。具備打造AI原生產品及分散式系統的背景。 Ibrahim Ahmed(共同創辦人兼技術長):曾任Founders, Inc.創始工程師與工作室創辦人。具備孵育AI新創公司的技術領導經驗,專精於模型訓練與專業語言模型。

更新時間: 2026-09-01