jevmem v0.5 giúp Claude Code tự động ghi lại các quyết định, lỗi và việc cần làm vào file JEVMEM.md. Công cụ này giữ lại các kết luận cũ dưới dạng 'superseded' để duy trì ngữ cảnh cho các phiên làm việc sau, đồng thời hỗ trợ cả Cursor và Codex.
Banger paper from Microsoft on prompt optimization. (bookmark it) The claim that a coding agent re…
DịchNghiên cứu mới từ Microsoft đề xuất phương pháp CASD, cho phép các Coding Agent tự phân tích nhật ký hoạt động để tìm lỗi và viết lại prompt tối ưu mà không cần truy cập môi trường thực tế.
Bài báo trên arXiv nghiên cứu khả năng của các Coding Agent trong việc tự động tạo ra mã nguồn có khả năng khái quát hóa qua nhiều tình huống, nhằm giải quyết các bài toán lập kế hoạch nhiệm vụ và chuyển động (TAMP) phức tạp.
Claude Opus 5.5 is the new #1 in the Artificial Analysis Coding Agent Index, with gains across all t…
DịchTheo đánh giá từ Artificial Analysis, Claude Opus 5.5 đã vươn lên vị trí số 1 trên Coding Agent Index với 66 điểm, nhờ hiệu suất vượt trội trong các bài kiểm tra lập trình chuyên sâu, dù đi kèm với mức chi phí vận hành cao hơn đáng kể.
Các AI coding agent đang trở thành trợ thủ đắc lực, giúp lập trình viên mắc ADHD giảm bớt gánh nặng tâm lý khi phải tương tác với đồng nghiệp, đồng thời tối ưu hóa quy trình làm việc cá nhân.
Safety refusal reporting is now available in the Artificial Analysis Coding Agent Index In our late…
DịchArtificial Analysis vừa bổ sung báo cáo từ chối an toàn vào Coding Agent Index v1.5 để làm rõ hành vi của các mô hình. Đáng chú ý, Claude Fable 5.1 ghi nhận tỷ lệ 'fallback' cao nhất trên Claude Code và Devin Fusion, ảnh hưởng trực tiếp đến kết quả đánh giá.
Anthropic tiết lộ thách thức khi áp dụng Coding Agent: khối lượng code tăng gấp 8 lần (80% do Claude viết) khiến số lượng kiểm thử tăng vọt, buộc hệ thống CI phải cải tổ toàn diện sau khi tải trọng tăng 25 lần chỉ trong nửa năm.
Karminski giới thiệu dự án MiniCPM5-2B-WebGPU-Pi cho phép chạy Coding Agent trực tiếp trên trình duyệt bằng WebGPU. Với mô hình 4bit chỉ dưới 2GB, người dùng có thể sử dụng terminal ảo, trình chỉnh sửa file và gọi công cụ mà không cần cài đặt Docker hay Node.js.
OpenAI vừa mua lại Git AI, nền tảng chuyên theo dõi hiệu suất, chi phí và vòng đời của mã nguồn do AI tạo ra. Thương vụ này cho thấy OpenAI đang tập trung vào việc giúp doanh nghiệp kiểm soát bài toán kinh tế khi triển khai các tác nhân AI trong lập trình.
I'm in London tonight - calling all fans of RPI software factories slopcodebench show-me solving…
DịchDex Horthy từ HumanLayer tổ chức buổi giao lưu thân mật tại London dành cho những người quan tâm đến coding agent và các dự án liên quan. Sự kiện không có tài trợ, khách mời tự chi trả đồ uống và có thể liên hệ trực tiếp để biết thêm chi tiết.
We independently benchmarked Devin Fusion for its release today - this is the first time a multi-mod…
DịchArtificial Analysis vừa công bố kết quả kiểm thử độc lập cho Devin Fusion, trở thành tác nhân lập trình đa mô hình đầu tiên góp mặt trong bảng xếp hạng Coding Agent Index của họ.
CEO Lâm Phàm dự báo các công ty công nghệ sẽ ưu tiên tuyển dụng nhân sự AI trong năm tới, khi Coding Agent có khả năng đảm nhận hầu hết công việc văn phòng. Hiện nay, nhu cầu tuyển dụng nhân sự AI đang bùng nổ với mức lương cho sinh viên mới tốt nghiệp có thể lên tới hàng triệu nhân dân tệ.
Dr. Claw là không gian làm việc mã nguồn mở kết nối các tác nhân AI vào một quy trình có sự kiểm soát của con người, giúp việc lập kế hoạch, thực thi và viết báo cáo trở nên minh bạch và có thể truy xuất nguồn gốc.
Kiến trúc sư OpenAI Codex cảnh báo việc lạm dụng prompt dài và tài liệu cồng kềnh đang làm lãng phí token. Bài viết đề xuất 5 quy tắc tối ưu hóa giúp Coding Agent hoạt động hiệu quả hơn, kèm theo prompt kiểm tra kho lưu trữ và mẫu ủy quyền thực thi.
Nhóm nghiên cứu tại Đại học Tây Hồ giới thiệu Code World Model, mô hình kết hợp Coding Agent để quản lý logic thế giới và mô hình video để hiển thị hình ảnh, giúp thế giới ảo duy trì tính nhất quán và logic dài hạn thay vì chỉ tạo ra các khung hình đơn lẻ.
Vì sao đáng đọc: Đột phá trong cách tiếp cận mô hình thế giới bằng cách tách biệt logic (code) và hình ảnh (video), giải quyết bài toán khó về tính nhất quán trong các môi trường mở.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứu giới thiệu mô hình Editable Visual Design, kết hợp VLM làm bộ não sáng tạo và mô hình tạo ảnh làm công cụ thực thi, cho phép chỉnh sửa thiết kế chuyên sâu thông qua Coding Agent.
Meta harnesses are fascinating. Pay attention if you are an AI engineer. A different problem set, bu…
DịchCác nhà nghiên cứu tại Thượng Hải giới thiệu Harness-of-Harness (HoH), khung làm việc cho phép các tác nhân AI tự động lập kế hoạch, viết mã và kiểm thử lặp đi lặp lại để phát triển phần mềm mà không cần sự can thiệp của con người.
How far can you push an agent harness? Great paper providing some insights.
DịchNhóm nghiên cứu từ Huawei giới thiệu openJiuwen, một framework AI lập trình đạt kết quả ấn tượng 82.6% trên SWE-bench Verified và 87.19% trên Terminal-Bench, thiết lập kỷ lục mới vượt xa các tiêu chuẩn hiện tại.
LoopsBench là bộ tiêu chuẩn mới từ Microsoft và ĐH Nam Kinh, tập trung đánh giá khả năng duy trì kế hoạch và quản lý quy trình làm việc phức tạp của các Coding Agent trong các dự án phần mềm dài hạn thay vì chỉ giải quyết các tác vụ đơn lẻ.