TasteVal: Measuring Experimental Research Taste of AI Systems
The authors introduce TasteVal, a benchmark designed to evaluate how well frontier AI models can choose research problems, design experiments, and interpre
The authors introduce TasteVal, a benchmark designed to evaluate how well frontier AI models can choose research problems, design experiments, and interpre