Hướng dẫn
Hỏi đáp trên Hacker News: Ai đang ứng dụng MCP vào môi trường thực tế?
(giờ Việt Nam)
Tóm tắt AI
Cộng đồng Hacker News thảo luận sôi nổi về việc triển khai Model Context Protocol (MCP) trong môi trường sản xuất, chia sẻ kinh nghiệm thực tế và các thách thức khi áp dụng giao thức này.
Chính văn · Bản dịch AI
Tôi đã tự xây dựng một máy chủ MCP cho trợ lý giọng nói của mình. Mặc định, Home Assistant cung cấp một vài công cụ cho các mô hình AI, nhưng tôi cảm thấy vẫn còn thiếu sót nên đã tự tay xây dựng thêm.
Nó có các công cụ để lấy thông tin về những câu đùa thực tế, tính toán, chuyển đổi đơn vị, lấy thông tin chứng khoán, tìm kiếm web với Kagi và những thứ khác mà tôi cho là thiết yếu đối với một trợ lý giọng nói. Nó thậm chí còn được vợ tôi tán thành.
Trong công việc, tôi cũng sử dụng máy chủ MCP của chúng tôi để gỡ lỗi và khắc phục các vấn đề với mã nguồn. Ngay ngày hôm qua, tôi đã dùng nó để tìm hiểu lý do tại sao một thẻ (tag) không hiển thị trong các bản ghi (traces); nhờ sử dụng máy chủ MCP, LLM đã có thể thấy rằng thẻ đó có xuất hiện trong các bản ghi cha nhưng lại bị mất trên đường truyền, và nó đã tìm ra nguyên nhân.
Liệu tôi có thể tìm ra điều đó mà không cần máy chủ MCP không? Có, nhưng tôi sẽ mất hàng giờ để xem qua các bản ghi dài dằng dặc, trong khi MCP và LLM đã tìm ra vấn đề chỉ trong vài phút.
Tôi cũng sử dụng MCP cho một trợ lý giọng nói khác.
Tôi đã mua một chiếc nhẫn Pebble Index 01 và nó có hỗ trợ các máy chủ MCP tùy chỉnh. Tôi chạy một máy chủ trên Tailscale và nó có thể tương tác với Home Assistant, trình theo dõi công việc của tôi, thiết lập Anki, v.v.
Tôi đã có cái nhìn toàn diện về MCP. Với các tác nhân (agents) có công cụ shell, chúng nhanh chóng trở nên không cần thiết, nhưng gần đây tôi đã nghĩ ra nhiều trường hợp sử dụng mang tính tác nhân hơn mà tôi không muốn cấp quyền shell cho tác nhân đó, và một giao diện MCP hẹp hơn lại là lựa chọn rất phù hợp.
Chúng tôi đã sử dụng MCP trong môi trường thực tế (production) từ ngày 26 tháng 3 cho các phân tích và lập kế hoạch thể thao sức bền hướng tới người dùng, tích hợp trực tiếp với máy chủ MCP, trong trường hợp này là các giao diện trò chuyện của ChatGPT, Claude, Grok, Perplexity.ai, Mistral, v.v. Tất cả các nền tảng đó đều cho phép người dùng thêm các máy chủ MCP tùy chỉnh, điều mà người dùng có thể thực hiện với một hướng dẫn đơn giản. Ví dụ, để kết nối Claude: https://www.tredict.com/faq/connect-claude-web-with-tredict/ Bằng cách này, người dùng có thể sử dụng Claude để tạo và đẩy các bài tập lên thiết bị Garmin của họ dựa trên phân tích trước đó. Chúng tôi cũng có một ứng dụng ChatGPT sử dụng MCP ở chế độ nền: https://chatgpt.com/plugins/plugin_asdk_app_69aef5b699a08191...
Điểm mấu chốt ở đây là MCP là xương sống đằng sau sản phẩm và cho phép người dùng phổ thông thực hiện các tác vụ mà không cần biết bất cứ điều gì về nó.
Toàn bộ cuộc thảo luận về việc "MCP có vô dụng không?" hoàn toàn vô nghĩa từ góc độ người tiêu dùng phổ thông, đôi khi họ còn chẳng biết MCP là gì. Ứng dụng Tredict ChatGPT kết nối chỉ với một cú nhấp chuột và quy trình oauth đơn giản. Chỉ vậy thôi.
Đúng vậy. Chúng tôi cũng từng nghĩ MCP vô dụng, nhưng giờ đây các quy trình làm việc của ChatGPT và Claude đã rất tốt; nó tốt như việc cài đặt một ứng dụng từ App Store vậy. Chúng tôi đã ra mắt MCP cho SaaS của mình và ngay lập tức thấy người dùng sử dụng nó.
API và MCP đều chỉ là những từ thông dụng (buzzwords) đối với khách hàng. Điều họ quan tâm là liệu họ có thể hoàn thành công việc trong SaaS của chúng tôi bằng cách sử dụng Claude hay ChatGPT hay không. Nếu làm được, đó là một thành công.
Hôm nay tôi BẮT BUỘC phải sử dụng nó, dù tôi đã tránh né chúng nhiều nhất có thể. Chúng tôi có một thiết kế Figma không thực sự ở cấp độ doanh nghiệp với các thành phần khác nhau và theo một số cách thì không thực sự mạch lạc, và ban quản lý muốn các trang web phải giống hệt với thiết kế Figma.
Biết trước "địa ngục" đang chờ đợi mình trong việc cố gắng đạt độ chính xác từng pixel trên khoảng 40 trang, tôi đã thiết lập Figma MCP với codex của mình, và thật bất ngờ... nó thực sự đã làm được những gì tôi cần, đó là một điều tôi cảm thấy biết ơn.
Để tham khảo, việc cung cấp ảnh chụp màn hình cho AI lúc đầu không mang lại hiệu quả tốt lắm.
Chúng tôi có một MCP nhưng tất cả những gì nó làm là bao bọc (wrap) các điểm cuối OpenAPI của chúng tôi bằng một loạt công cụ (không phơi bày hàng trăm/hàng nghìn điểm cuối dưới dạng công cụ), mà chỉ là list_resources, list_endpoints, describe_endpoint, describe_ref, execute.
Lý do chính chúng tôi có cái này là vì những người không rành kỹ thuật sẽ dễ dàng kết nối nó với AI Claude/ChatGPT/v.v. hơn là bắt họ tạo khóa API, cung cấp URL cơ sở và thông số kỹ thuật openapi, v.v.
MCP cũng cho phép chúng tôi phơi bày một vài công cụ công thức/kỹ năng (list_skills/read_skill) mô tả các quy trình làm việc phổ biến về cách sử dụng để thực hiện những việc có thể chưa rõ ràng.
Giá trị của các MCP đang giảm dần một chút, vì các AI Agent đang trở nên thông minh hơn trong việc sử dụng API/CLI. Ví dụ, tôi sử dụng gh cli thông qua Claude thay vì MCP của họ, vì tôi đã thiết lập cli rồi, nên không cần dùng MCP nữa.
MCP có thể mang lại giá trị lớn nếu chúng kết nối nhiều nguồn và kết hợp các kết quả lại với nhau. Ví dụ, tại nơi làm việc, chúng tôi sử dụng một MCP nội bộ để tìm kiếm nhật ký/số liệu trên năm hệ thống (cũ) khác nhau. Nó tìm thấy mối tương quan giữa các sự kiện trong các hệ thống khác nhau chỉ trong vài phút.
Tôi thấy rất nhiều điểm chuẩn khi làm việc với cái này, và thành thật mà nói có quá nhiều thứ để đề cập trong bình luận này nhưng: - bài viết này không cho phép tìm kiếm công cụ ngay từ đầu, nơi các token bắt đầu ở mức gần bằng 0 đối với cả MCP - ngay cả với điều trên, việc nói về số lượng token thô không tính đến việc đối với các quỹ đạo rất dài, bộ nhớ đệm prompt (prompt cache) sẽ khấu hao phần lớn chi phí này, và một tính năng của MCP là bạn cũng có thể tùy chỉnh các công cụ thành một tập hợp con được chọn, và điều đó rất mạnh mẽ - bạn có thể thêm xác nhận công cụ cho các hành động ghi/phá hủy một cách dễ dàng - dữ liệu đào tạo cũ trên CLI rất tốt nhưng thực tế đối với các tính năng mới, việc MCP quảng bá chúng cũng là một điểm cộng, nhưng cần thời gian để thấy điều đó, MCP chưa quá cũ.
Còn nhiều khía cạnh khác nữa, nhưng ngay cả với GitHub MCP, nơi tác nhân có lượng đào tạo khổng lồ về CLI, vẫn có những lý do khiến mọi người sử dụng nó rộng rãi - bạn không nghe thấy nhiều về điều đó ở đây nhưng đủ để nói rằng mức độ sử dụng chưa bao giờ ngừng tăng cho đến ngày nay.
Tôi nghĩ nếu CLI đang hoạt động tốt với bạn thì tốt thôi, tôi cũng thích cli của chúng tôi và đã thực hiện một số công việc trên đó, như thêm lệnh phụ gh skill.
Hãy sử dụng những gì hiệu quả, đo lường và cải thiện - nhưng theo tôi, bài viết này không đánh giá đúng về máy chủ MCP.
> - bài viết này không cho phép tìm kiếm công cụ ngay từ đầu, nơi các token bắt đầu ở mức gần bằng 0 đối với cả MCP
Đó có phải là lý do tại sao tôi phải liên tục nhắc Claude và ChatGPT rằng chúng có quyền truy cập vào một plugin Github có thể truy cập tài khoản của tôi, thay vì cố gắng và thất bại trong việc sử dụng gh cli không?
Tôi sử dụng MCP mọi lúc, nhưng cũng giống như trường hợp của bạn: chúng là các máy chủ MCP của riêng tôi.
Chúng thực hiện chính xác những gì tôi muốn và theo cách tôi muốn. Chúng chỉ phơi bày thông tin và các tính năng mà tôi muốn LLM có. Và cũng giống như trường hợp của bạn, nó kết hợp nhiều nguồn thông tin vào 1 phản hồi.
Tôi không sử dụng MCP nhiều cho mục đích cá nhân, nhưng tôi đã thấy được lợi ích của việc có một cơ chế tiêu chuẩn hóa để phân phối công cụ cho các nhóm không phải lập trình viên, đặc biệt là khi họ đang sử dụng một tập hợp các tác nhân hỗn tạp.
Tôi cũng rất hào hứng với phần mở rộng SEP-2640 sắp tới cho MCP, cho phép các kỹ năng được phân phối thông qua MCP. Mặc dù định dạng kỹ năng đã được tiêu chuẩn hóa, nhưng việc phân phối kỹ năng thì chưa. Tôi biết có các công cụ như Vercel skills CLI, nhưng đó không phải là lựa chọn tốt cho những người không phải lập trình viên.
MCP dành cho khi người dùng cuối của bạn (người điều khiển một LLM Agent) không rành về kỹ thuật. Hầu hết những người không rành kỹ thuật sẽ không cài đặt CLI trên máy tính của họ. Hầu hết sẽ không điều khiển LLM agent thông qua terminal.
Nó cũng rất hữu ích khi bạn cần xác thực. MCP OAuth với CIMD giúp mọi thứ trở nên dễ dàng thay vì quy trình tạo khóa API rườm rà.
Nếu bạn là người rành kỹ thuật và đã sử dụng CLI, thì MCP không mang lại nhiều giá trị cho bạn.
Công ty tôi (tôi không thuộc nhóm chịu trách nhiệm về bất kỳ thứ gì liên quan đến AI) có các MCP cho Jira, Confluence, bản fork của Mattermost và một vài tích hợp khác.
Tôi không biết về câu hỏi MCP so với API nhưng tôi luôn cho rằng toàn bộ mục đích của MCP là một lớp trừu tượng giữa mô hình và công cụ/dịch vụ.
Nghĩa là mô hình không cần phải biết về một API nhất định (chưa nói đến một phiên bản cụ thể của nó) để làm việc với một dịch vụ.
Chúng tôi sử dụng MCP trong môi trường thực tế cho các tác nhân giọng nói hướng tới khách hàng. Máy chủ MCP tùy chỉnh của chúng tôi xác định các công cụ và tài nguyên mà các tác nhân giọng nói cần truy cập để tương tác với khách hàng của chúng tôi. (Ví dụ: lên lịch hẹn, kiểm tra trạng thái đơn hàng, v.v.).
Bây giờ chúng tôi có thể trỏ bất kỳ nền tảng tác nhân giọng nói nào mà chúng tôi chọn -- eleven labs, vapi, pipecat, bất cứ thứ gì -- vào máy chủ MCP tùy chỉnh của chúng tôi và nó ngay lập tức hiểu được các công cụ có sẵn, đầu vào của chúng và cách sử dụng chúng.
So với các lựa chọn thay thế mà mọi người trên HN ủng hộ, như cli và API, đây là một lựa chọn hiển nhiên. Thành thật mà nói, tôi thậm chí không chắc lựa chọn thay thế thực tế sẽ là gì.
Tôi có nên đóng gói và phân phối một cli cho ElevenLabs và yêu cầu họ sử dụng nó không? Cung cấp cho họ một thông số kỹ thuật API đầy đủ để họ triển khai cho tôi?
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.