Abstract
We propose BrickBench, a benchmark for agentic text-conditioned LEGO-set design. Given a prompt, an agent is tasked with producing an assembly that not only satisfies semantic and design criteria, but that can also be physically built. To do so, it must select parts from a discrete library and reason jointly about local and global constraints. We score validity, alignment, and design across three settings that vary in scale and part availability. We provide BrickAgent, an environment for coding agents to construct, inspect, and validate their designs. We find that leading agents largely satisfy verifiable physical and semantic requirements, but fall short of human designs. We release our benchmark and environment at http://www.brickben.ch
Keywords
Publication details
- Journal
- Not available
- Open access
- Green open access
Cite this article
APA 7
Kulits, P., Xu, Y., Jones, R. K., Schmid, C., & Wu, J. (2026). BrickBench: Evaluating Agentic Brick Design. https://omanscience.com/en/articles/brickbench-evaluating-agentic-brick-design
MLA 9
Kulits, Peter, et al. "BrickBench: Evaluating Agentic Brick Design." https://omanscience.com/en/articles/brickbench-evaluating-agentic-brick-design.
Chicago (author–date)
Kulits, Peter, Yiqing Xu, R. Kenny Jones, Cordelia Schmid, and Jiajun Wu. 2026. "BrickBench: Evaluating Agentic Brick Design." https://omanscience.com/en/articles/brickbench-evaluating-agentic-brick-design.
Harvard
Kulits, P., Xu, Y., Jones, R. K., Schmid, C. and Wu, J. (2026) 'BrickBench: Evaluating Agentic Brick Design', Available at: https://omanscience.com/en/articles/brickbench-evaluating-agentic-brick-design.
Vancouver
Kulits P, Xu Y, Jones RK, Schmid C, Wu J. BrickBench: Evaluating Agentic Brick Design. https://omanscience.com/en/articles/brickbench-evaluating-agentic-brick-design
IEEE
P. Kulits, Y. Xu, R. K. Jones, C. Schmid, and J. Wu, "BrickBench: Evaluating Agentic Brick Design," https://omanscience.com/en/articles/brickbench-evaluating-agentic-brick-design.